Qualsiasi pagina diventa Markdown pulito.
Copiare e incollare una pagina nel modello porta con sé menu, banner, piè di pagina e script, e paghi token per tutto questo. Qui esce solo il contenuto, in Markdown, con la fonte nell'intestazione.
- Modulo
- Scraping
- Ingresso
- Un URL
- Dove gira
- Server Rovemark
- Costo
- Gratis, senza registrazione
Il testo che conta, senza il resto della pagina attaccato
Una pagina web è fatta per un browser: ha menu, banner, modulo newsletter, piè di pagina e una pila di script. Quando copi tutto dentro un modello, va tutto insieme, occupa contesto, costa token e ostacola anche la lettura di ciò che conta.
Lo strumento recupera la pagina, scarta ciò che non è contenuto, sceglie il blocco principale e lo converte in Markdown: i titoli diventano #, gli elenchi -, le tabelle restano tabelle e i link diventano assoluti. In cima va un’intestazione con l’URL di origine, così il modello sa da dove viene.
- 01
Incolli l’indirizzo della pagina
Una pagina, senza registrazione. Lo strumento la recupera direttamente dall’origine, come farebbe un crawler.
- 02
Ciò che non è contenuto viene scartato
Script, stile, menu, piè di pagina e barra laterale vengono scartati. Resta il blocco con più testo continuo, dove vive il contenuto.
- 03
Esce Markdown pronto da incollare
Con conteggio parole e stima dei token, così sai quanto ne entrerà nel contesto del modello.
- 01
Perché Markdown e non testo semplice?
- Perché Markdown preserva la gerarchia con quasi nessun costo in token. Il modello vede cosa è un titolo, cosa è un elemento di elenco e cosa è una tabella, e risponde meglio a un testo strutturato che a un blocco continuo dove tutto ha lo stesso peso.
- 02
Funziona su qualsiasi sito?
- Funziona dove il testo è nell'HTML servito. I siti che assemblano il contenuto solo dopo JavaScript restituiscono un guscio vuoto, e lo strumento avvisa quando è questo il caso, invece di consegnare un file vuoto fingendo successo.
- 03
Lo strumento conserva la pagina che ho convertito?
- No. La pagina viene recuperata, convertita e restituita nella stessa richiesta. Non si salva nulla lato server.
- 04
Va bene per siti con login o paywall?
- No. La richiesta viene effettuata senza sessione, esattamente come un visitatore anonimo, quindi ricevi ciò che vedrebbe chiunque non abbia effettuato l'accesso. I contenuti dietro login richiedono il modulo Raccolta, che lavora con una sessione autenticata.
- 05
Perché il conteggio dei token è una stima?
- Perché ogni modello ha il proprio tokenizzatore e il numero esatto cambia da uno all'altro. La stima usa il rapporto medio per carattere, adattato alla scrittura, sufficiente per dimensionare contesto e costo, non per chiudere una fattura.
- 06
Posso convertire un sito intero in una volta?
- Qui no: lo strumento gratuito gestisce una pagina alla volta. L'intero sito, con pianificazione e consegna via API, è ciò che risolve il modulo Raccolta, lo stesso motore, in esecuzione su scala.
Una pagina è facile. E mille?
Questo strumento fa una pagina, subito. Percorrere un sito intero, ripeterlo ogni giorno e consegnare il risultato via API è ciò che fa il modulo Scraping, sullo stesso motore.
