夜間のWebデータ収集

夜間のWeb収集を、処理状態とアクセス条件を管理して実行

ブラウザ処理はサーバー上の実行基盤で順次進め、翌朝に完了結果と例外を確認する運用を設計できます。

この業務で起きている悩み

担当
営業企画・調査・バックオフィスの担当者
頻度
毎日または週次の決めた時刻
止まる場所
勤務時間外の実行管理と、途中で失敗した対象の切り分け
  • 長い収集処理のために担当者のPCを起動したままにしている
  • 複数の対象をどこまで処理したか把握しにくい
  • 一部の失敗で全件をやり直している
Before / After

人が行う手順と、導入後に残す確認作業

以下は手順の比較です。所要時間や削減率は業務条件によって変わるため、数値効果は個別の条件で試算します。

Before

現在の手順

  1. 1対象URLと収集項目を一覧にする
  2. 2担当者のPCで順番にページを開く
  3. 3必要な項目をコピーして表へ貼り付ける
  4. 4途中で止まった対象を探してやり直す
  5. 5全件の完了と重複を確認する

After

Pigeon Workflow導入後

  1. 1定期実行でサーバー上のブラウザ処理を開始する
  2. 2Google スプレッドシートまたはPigeonCloudから処理済み識別子と状態を取得し、未処理分を特定する
  3. 3取得間隔を守りながら1件ずつ収集する
  4. 41件ごとに処理済み識別子と状態をGoogle スプレッドシートまたはPigeonCloudへ書き込む
  5. 5担当者は停止分・手動キューに加え、導入初期は成功分もサンプリングで確認する
Workflow

実装済みノードで組むワークフロー

  1. 決めた時刻に開始

    定期実行

  2. 対象と前回の処理状態を取得

    スプレッドシート取得

  3. 未処理分を特定

    入力チェック

  4. 順番に処理

    繰り返し

  5. Webから収集

    ブラウザ自動操作 RPA

  6. 識別子と状態を1件ずつ記録(またはPigeonCloud)

    スプレッドシート書き込み

  7. 失敗を通知

    Slack 送信

例外・確認の分岐

  • ブラウザ自動操作 RPA から分岐

    1. アクセス制限(429)を検知
    2. 指定時間だけ待機
    3. 上限回数内で再試行

    上限到達または確認不能なら停止して通知

  • ブラウザ自動操作 RPA から分岐

    1. ページ構造の変更を検知
    2. 取得処理を停止
    3. 対象URLとログを通知

    設定を確認するまで再実行しない

  • スプレッドシート書き込み から分岐

    1. 途中停止を検知
    2. 次回起動時に状態表を取得
    3. 処理済み識別子と照合

    未処理分から続ける方法は個別に設計

再実行回数には上限を設けます。登録・送信を伴う処理は重複キーで反映状況を照合し、未反映の場合に限って再実行します。確認できない場合は停止して手動キューへ送ります。

Integrations

必要な連携

専用ノード

定期実行・Google スプレッドシート・PigeonCloud・Slack

決めた時刻の起動、対象一覧・処理済み識別子・状態の取得と1件ごとの記録、停止や手動確認対象の通知に使います。

Webhook・REST

取得元の公式API

公式APIへ接続できる場合は、その利用条件とレート制限に従ってREST APIを利用します。接続方法は個別に確認します。

ブラウザRPA

Chromiumで操作するWeb画面

利用規約とrobots.txtを確認し、対象にできる場合にページ移動、データ抽出、ページ送りを行います。

Exception handling

例外時の挙動

01

アクセス制限

429などの制限を検知したら待機し、設定した上限回数まで再試行します。上限到達時は停止して通知します。

02

ページ構造の変更

想定した項目やページ送りを確認できなければ処理を停止し、対象URLとログを担当者へ通知します。

03

途中停止

次回起動時にGoogle スプレッドシートまたはPigeonCloudから処理済み識別子と状態を取得し、未処理分を判定します。再開の方法は個別に設計します。

Fit & design

適用条件と設計のポイント

01取得間隔とレート制限
利用規約と公式の制限に合わせて待機時間、同時実行数、再試行回数の上限を決めます。
02ページ送り
次ページの有無、最終ページの判定、同じページを巡回しないための識別方法をサンプルで確認します。
03状態台帳と再開方法
処理済み識別子と状態を1件ずつGoogle スプレッドシートまたはPigeonCloudへ書き込み、次回起動時に取得して未処理分を特定します。再開の方法は個別に設計します。
04取得してはいけない条件
利用規約やrobots.txtで禁止されている取得、権限のない情報、許可されていない高頻度アクセスは対象にしません。
Price guide

料金目安

Light 月額50,000円

税抜・10ユーザー・25,000 AIクレジット・RPAノード

実行量、ブラウザRPAの利用範囲、連携要件によって必要なプランは異なります。適合確認後に個別にご案内します。

料金プランを見る
FAQ

よくあるご質問

担当者のPCを起動しておく必要はありますか?

ブラウザRPAはサーバー上の実行基盤で動くため、実行中に担当者のPCを起動し続ける必要はありません。結果、停止分、手動キューは担当者が確認します。

途中で失敗すると最初からやり直しですか?

処理済み識別子と状態を1件ずつGoogle スプレッドシートまたはPigeonCloudへ記録し、次回起動時にその表を取得して未処理分を判定する構成にします。再開の方法は個別に設計します。

どのWebサイトからでも収集できますか?

対象サイトの利用規約、robots.txt、アクセス制限、認証方法、画面構成を確認して個別に判断します。許可されていない取得は対象にしません。

More use cases

他の活用シーン

Consultation

この業務をどこまで任せられるか確認しませんか

現在の手順、利用中のツール、例外条件を伺い、対象範囲と人の確認を残す場所を整理します。