ツール

どのページもきれいな Markdown に。

ページをモデルにコピー&ペーストすると、メニュー、バナー、フッター、スクリプトも一緒に入り、そのすべてにトークンを支払うことになります。ここでは、ヘッダーに出典を付けたMarkdown形式のコンテンツだけを出力します。

モジュール
スクレイピング
入力
URL 1 件
実行場所
Rovemark のサーバー
費用
無料・登録不要
このツールがすること

必要な本文だけ。ページの残りは付いてこない

Webページはブラウザ向けに作られています。メニュー、バナー、ニュースレターフォーム、フッター、大量のスクリプトがあります。これをモデルにコピーすると、すべてが一緒に入ります。コンテキストを使い、トークンの費用がかかり、重要な内容の読解も妨げます。

ツールはページを取得し、本文でないものを捨て、主要なブロックを選んで Markdown に変換します。見出しは #、リストは -、テーブルはテーブルのまま、リンクは絶対 URL に。先頭には出典 URL を書いたヘッダーが付き、モデルはそれがどこから来たかを知ります。

仕組み
  1. 01

    ページのアドレスを貼る

    1 ページ、登録は不要です。クローラーと同じように、オリジンから直接取得します。

  2. 02

    本文でないものは落とす

    スクリプト、スタイル、メニュー、フッター、サイドバーは除外されます。最も連続したテキストの多いブロックだけが残り、そこにコンテンツがあります。

  3. 03

    貼ればすぐ使える Markdown が出る

    語数とトークンの見積もり付き。どれだけがモデルのコンテキストに収まるか分かります。

よくある質問
01

なぜプレーンテキストではなく Markdown なのですか?

Markdownはほとんどトークンを使わずに階層を保持できるからです。モデルはタイトル、リスト項目、表を識別できるため、すべてが同じ重みの連続した文章より、構造化されたテキストについてより適切に答えられます。
02

どのサイトでも動きますか?

テキストが配信HTMLに含まれている場所で機能します。JavaScriptの実行後にしかコンテンツを組み立てないサイトは空の外枠を返します。その場合、ツールは成功したふりをして空のファイルを渡すのではなく、知らせます。
03

変換したページをツールは保存しますか?

いいえ。ページは同じリクエストの中で取得され、変換され、返されます。サーバー側には何も保存しません。
04

ログインやペイウォールの先でも使えますか?

いいえ。取得はセッションなしで、匿名の訪問者とまったく同じように行われます。つまり、ログインしていない人が見られる内容を受け取ります。ログインの背後にあるコンテンツには、認証済みセッションで動作するデータ収集モジュールが必要です。
05

トークン数がなぜ見積もりなのですか?

モデルごとにトークナイザーが異なり、正確な数はモデルごとに変わるからです。推定では、文字あたりの平均的な比率を文章に合わせて調整します。コンテキストとコストの規模を見積もるには十分ですが、請求額を確定するためのものではありません。
06

サイト全体を一度に変換できますか?

ここではできません。無料ツールは一度に1ページを処理します。サイト全体を、スケジュールとAPIで配信するのは、同じエンジンを規模化して動かすデータ収集モジュールの役割です。

1 ページは簡単です。では 1000 ページは?

このツールは 1 ページをその場で処理します。サイト全体を巡回し、毎日繰り返し、結果を API で届けるのは、同じエンジンを使うスクレイピングモジュールの仕事です。