任意网页变成干净的 Markdown。
把一个页面直接复制粘贴进模型,会连菜单、横幅、页脚和脚本一起带上,而这些你都要为它们付token。这里只输出内容,以Markdown格式呈现,并在开头注明来源。
- 所属模块
- 网页抓取
- 输入
- 一个网址
- 运行位置
- Rovemark 服务器
- 费用
- 免费,无需注册
这个工具做什么
只要有用的正文,不带整页的其余部分
一个网页是为浏览器设计的:有菜单、横幅、订阅表单、页脚,还有一堆脚本。当你把它整个复制进模型里时,所有东西都会一起进去,占用上下文,消耗token,还会干扰对重要内容的阅读。
工具取回页面,丢掉不是内容的部分,挑出正文区块并转成 Markdown:标题变成 #,列表变成 -,表格仍是表格,链接补成绝对地址。开头带一段说明,写上来源网址,让模型知道这段文字从哪来。
工作原理
- 01
粘贴页面地址
一个页面,无需注册。工具像爬虫那样直接从源站取回。
- 02
不是内容的部分被丢掉
脚本、样式、菜单、页脚和侧边栏都会被去掉。剩下的是正文最集中的那部分,也就是内容真正所在的地方。
- 03
输出可直接粘贴的 Markdown
附带词数与 token 预估,让你知道其中多少放得进模型的上下文。
常见问题
- 01
为什么用 Markdown,而不是纯文本?
- 因为Markdown几乎不用消耗额外的token就能保留层级结构。模型能分辨出哪里是标题、哪里是列表项、哪里是表格,对结构化文本的回答,也比对一整块权重相同的文字要好。
- 02
所有网站都能用吗?
- 只要文本存在于服务器返回的HTML中,这个工具就能运作。有些网站要等JavaScript执行后才生成内容,这类网站只会返回一个空壳,工具会在这种情况下提示你,而不是假装成功却给出一个空文件。
- 03
工具会保存我转换过的页面吗?
- 不会。页面在同一次请求里被取回、转换并返回。服务端什么也不保存。
- 04
需要登录或付费墙的页面可以吗?
- 不会。抓取是在没有会话的情况下进行的,就像一个匿名访客一样,所以你得到的是任何未登录的人都能看到的内容。登录后才能看到的内容,需要用采集模块,它支持带身份验证的会话。
- 05
token 数为什么只是预估?
- 因为每个模型都有自己的分词器,精确数字因模型而异。这里的估算使用按文字类型调整过的平均字符比例,足够用来评估上下文和成本,但不足以用来核对账单。
- 06
能一次转换整个网站吗?
- 这里不行:免费工具一次只处理一个页面。整个网站,配合排程和API交付,是采集模块要解决的问题,同一个引擎,规模化运行。
其他免费工具
