Elke pagina wordt schone Markdown.
Een pagina kopiëren en plakken in het model neemt ook menu, banner, footer en script mee, en je betaalt tokens voor dat alles. Hier krijg je alleen de inhoud, in Markdown, met de bron in de kop.
- Module
- Scraping
- Invoer
- Een URL
- Draait op
- Rovemark-server
- Kosten
- Gratis, zonder registratie
De tekst die ertoe doet, zonder de rest van de pagina eraan vast
Een webpagina is gemaakt voor een browser: met menu, banner, nieuwsbrief-formulier, footer en een stapel scripts. Wanneer je dit naar een model kopieert, gaat alles mee, neemt het context in, kost het tokens en belemmert het ook het lezen van wat belangrijk is.
De tool haalt de pagina op, gooit weg wat geen inhoud is, kiest het hoofdblok en zet het om in Markdown: koppen worden #, lijsten worden -, tabellen blijven tabellen en links worden absoluut. Bovenaan staat een kop met de bron-URL, zodat het model weet waar het vandaan komt.
- 01
Je plakt het adres van de pagina
Eén pagina, zonder registratie. De tool haalt hem rechtstreeks bij de bron op, zoals een crawler zou doen.
- 02
Alles wat geen inhoud is, valt af
Script, stijl, menu, footer en zijbalk worden verwijderd. Over blijft het blok met de meeste doorlopende tekst, waar de inhoud staat.
- 03
Eruit komt Markdown, klaar om te plakken
Met woordentelling en tokenschatting, zodat je weet hoeveel ervan in het contextvenster past.
- 01
Waarom Markdown en geen platte tekst?
- Omdat Markdown de hiërarchie behoudt met bijna geen tokenkosten. Het model ziet wat een titel is, wat een lijstitem is en wat een tabel is, en antwoordt beter over gestructureerde tekst dan over een doorlopend blok waarin alles hetzelfde gewicht heeft.
- 02
Werkt het op elke site?
- Het werkt wanneer de tekst in de door de server geleverde HTML staat. Sites die de inhoud pas na JavaScript opbouwen, geven een lege omhulling terug, en de tool meldt dat wanneer dat het geval is, in plaats van een leeg bestand als succesvol af te leveren.
- 03
Bewaart de tool de pagina die ik omzette?
- Nee. De pagina wordt opgehaald, omgezet en in hetzelfde verzoek teruggegeven. Aan de serverkant wordt niets opgeslagen.
- 04
Werkt het achter een login of betaalmuur?
- Nee. De pagina wordt zonder sessie opgehaald, precies zoals een anonieme bezoeker, dus je krijgt wat iedereen zonder inloggen zou zien. Inhoud achter een login vereist de module Scraping, die met een geauthenticeerde sessie werkt.
- 05
Waarom is de tokentelling een schatting?
- Omdat elk model zijn eigen tokenizer heeft en het exacte aantal per model verschilt. De schatting gebruikt de gemiddelde verhouding per teken, aangepast aan de schrijfwijze, genoeg om context en kosten in te schatten, niet om een factuur exact af te sluiten.
- 06
Kan ik een hele site in één keer omzetten?
- Hier niet: de gratis tool verwerkt één pagina per keer. Een hele site, met planning en levering via API, lost de module Scraping op, met dezelfde engine, op schaal.
Eén pagina is makkelijk. En duizend?
Deze tool verwerkt één pagina, direct. Een hele site crawlen, elke dag herhalen en het resultaat via API leveren, doet de module Scraping, met dezelfde engine.
