工具

任意网页变成干净的 Markdown。

把一个页面直接复制粘贴进模型,会连菜单、横幅、页脚和脚本一起带上,而这些你都要为它们付token。这里只输出内容,以Markdown格式呈现,并在开头注明来源。

所属模块
网页抓取
输入
一个网址
运行位置
Rovemark 服务器
费用
免费,无需注册
这个工具做什么

只要有用的正文,不带整页的其余部分

一个网页是为浏览器设计的:有菜单、横幅、订阅表单、页脚,还有一堆脚本。当你把它整个复制进模型里时,所有东西都会一起进去,占用上下文,消耗token,还会干扰对重要内容的阅读。

工具取回页面,丢掉不是内容的部分,挑出正文区块并转成 Markdown:标题变成 #,列表变成 -,表格仍是表格,链接补成绝对地址。开头带一段说明,写上来源网址,让模型知道这段文字从哪来。

工作原理
  1. 01

    粘贴页面地址

    一个页面,无需注册。工具像爬虫那样直接从源站取回。

  2. 02

    不是内容的部分被丢掉

    脚本、样式、菜单、页脚和侧边栏都会被去掉。剩下的是正文最集中的那部分,也就是内容真正所在的地方。

  3. 03

    输出可直接粘贴的 Markdown

    附带词数与 token 预估,让你知道其中多少放得进模型的上下文。

常见问题
01

为什么用 Markdown,而不是纯文本?

因为Markdown几乎不用消耗额外的token就能保留层级结构。模型能分辨出哪里是标题、哪里是列表项、哪里是表格,对结构化文本的回答,也比对一整块权重相同的文字要好。
02

所有网站都能用吗?

只要文本存在于服务器返回的HTML中,这个工具就能运作。有些网站要等JavaScript执行后才生成内容,这类网站只会返回一个空壳,工具会在这种情况下提示你,而不是假装成功却给出一个空文件。
03

工具会保存我转换过的页面吗?

不会。页面在同一次请求里被取回、转换并返回。服务端什么也不保存。
04

需要登录或付费墙的页面可以吗?

不会。抓取是在没有会话的情况下进行的,就像一个匿名访客一样,所以你得到的是任何未登录的人都能看到的内容。登录后才能看到的内容,需要用采集模块,它支持带身份验证的会话。
05

token 数为什么只是预估?

因为每个模型都有自己的分词器,精确数字因模型而异。这里的估算使用按文字类型调整过的平均字符比例,足够用来评估上下文和成本,但不足以用来核对账单。
06

能一次转换整个网站吗?

这里不行:免费工具一次只处理一个页面。整个网站,配合排程和API交付,是采集模块要解决的问题,同一个引擎,规模化运行。

一个页面很容易。一千个呢?

这个工具当场处理一个页面。爬完整站、每天重跑、把结果通过 API 交付,是网页抓取模块的活,用的是同一套引擎。