Outils

N’importe quelle page devient du Markdown propre.

Copier-coller une page dans le modèle inclut le menu, la bannière, le pied de page et les scripts, et vous payez des tokens pour tout cela. Ici, seul le contenu est produit, en Markdown, avec la source dans l’en-tête.

Module
Scraping
Entrée
Une URL
Où ça tourne
Serveur Rovemark
Coût
Gratuit, sans inscription
Ce que fait l’outil

Le texte qui compte, sans le reste de la page collé dessus

Une page web est conçue pour un navigateur : elle contient un menu, une bannière, un formulaire de newsletter, un pied de page et une pile de scripts. Lorsque vous copiez cela dans un modèle, tout est inclus, occupe du contexte, coûte des tokens et gêne encore la lecture de ce qui compte.

L’outil récupère la page, écarte ce qui n’est pas du contenu, choisit le bloc principal et le convertit en Markdown : les titres deviennent des #, les listes des -, les tableaux restent des tableaux et les liens passent en absolu. En haut, un en-tête porte l’URL d’origine, pour que le modèle sache d’où cela vient.

Comment ça marche
  1. 01

    Vous collez l’adresse de la page

    Une page, sans inscription. L’outil la récupère directement à la source, comme le ferait un robot.

  2. 02

    Tout ce qui n’est pas contenu est écarté

    Les scripts, styles, menus, pieds de page et barres latérales sont supprimés. Il reste le bloc avec le plus de texte continu, là où se trouve le contenu.

  3. 03

    Il sort du Markdown prêt à coller

    Avec le nombre de mots et une estimation de tokens, pour savoir quelle part tiendra dans le contexte du modèle.

Questions fréquentes
01

Pourquoi du Markdown et pas du texte brut ?

Parce que le Markdown préserve la hiérarchie avec un coût en tokens presque nul. Le modèle voit ce qui est un titre, un élément de liste ou un tableau, et répond mieux à un texte structuré qu’à un bloc continu où tout a le même poids.
02

Est-ce que ça marche sur tous les sites ?

Cela fonctionne lorsque le texte se trouve dans le HTML servi. Les sites qui ne construisent le contenu qu’après le JavaScript renvoient une coque vide, et l’outil l’indique lorsque c’est le cas, au lieu de livrer un fichier vide en prétendant avoir réussi.
03

L’outil conserve-t-il la page que j’ai convertie ?

Non. La page est récupérée, convertie et renvoyée dans la même requête. Rien n’est enregistré côté serveur.
04

Cela fonctionne-t-il derrière un identifiant ou un paywall ?

Non. La récupération se fait sans session, exactement comme pour un visiteur anonyme, vous obtenez donc ce que verrait toute personne non connectée. Le contenu derrière une connexion exige le module Collecte, qui travaille avec une session authentifiée.
05

Pourquoi le comptage de tokens est-il une estimation ?

Parce que chaque modèle a son propre tokenizer et que le nombre exact varie de l’un à l’autre. L’estimation utilise le ratio moyen par caractère, ajusté selon l’écriture, suffisant pour dimensionner le contexte et le coût, pas pour établir une facture.
06

Puis-je convertir un site entier d’un coup ?

Pas ici : l’outil gratuit traite une page à la fois. Un site entier, avec planification et livraison par API, est ce que résout le module Collecte, avec le même moteur, à grande échelle.

Une page, c’est facile. Et mille ?

Cet outil fait une page, tout de suite. Explorer un site entier, recommencer chaque jour et livrer le résultat par API, c’est ce que fait le module Scraping, sur le même moteur.