Cualquier página se vuelve Markdown limpio.
Copiar y pegar una página en el modelo lleva también menú, banner, pie de página y script, y pagas token por todo eso. Aquí sale solo el contenido, en Markdown, con la fuente en el encabezado.
- Módulo
- Scraping
- Entrada
- Una URL
- Dónde funciona
- Servidor Rovemark
- Coste
- Gratis, sin registro
El texto que importa, sin el resto de la página pegado
Una página web está hecha para un navegador: tiene menú, banner, formulario de newsletter, pie de página y una pila de scripts. Cuando copias eso dentro de un modelo, todo va junto, ocupa contexto, cuesta token y además dificulta la lectura de lo que importa.
La herramienta busca la página, descarta lo que no es contenido, elige el bloque principal y lo convierte en Markdown: los títulos pasan a #, las listas a -, las tablas siguen siendo tablas y los enlaces quedan absolutos. Arriba va una cabecera con la URL de origen, para que el modelo sepa de dónde salió.
- 01
Pegas la dirección de la página
Una página, sin registro. La herramienta la busca directamente en el origen, como haría un rastreador.
- 02
Lo que no es contenido se descarta
Script, estilo, menú, pie de página y barra lateral se descartan. Queda el bloque con más texto corrido, que es donde vive el contenido.
- 03
Sale Markdown listo para pegar
Con recuento de palabras y estimación de tokens, para que sepas cuánto de eso cabrá en el contexto del modelo.
- 01
¿Por qué Markdown y no texto plano?
- Porque Markdown conserva la jerarquía con casi ningún costo de token. El modelo ve qué es título, qué es elemento de lista y qué es tabla, y responde mejor sobre un texto estructurado que sobre un bloque corrido donde todo tiene el mismo peso.
- 02
¿Funciona en cualquier sitio?
- Funciona donde el texto está en el HTML entregado. Los sitios que solo montan el contenido después de JavaScript devuelven una estructura vacía, y la herramienta avisa cuando ese es el caso, en lugar de entregar un archivo vacío fingiendo éxito.
- 03
¿La herramienta guarda la página que convertí?
- No. La página se busca, se convierte y se devuelve en la misma petición. No se guarda nada del lado del servidor.
- 04
¿Sirve para sitios con login o muro de pago?
- No. La consulta se hace sin sesión, exactamente como un visitante anónimo, así que recibes lo que vería cualquier persona sin iniciar sesión. El contenido detrás de inicio de sesión requiere el módulo Recolección, que trabaja con sesión autenticada.
- 05
¿Por qué el recuento de tokens es una estimación?
- Porque cada modelo tiene su propio tokenizador y el número exacto cambia de uno a otro. La estimación usa la proporción media por carácter, ajustada por escritura, suficiente para dimensionar contexto y costo, no para cerrar una factura.
- 06
¿Puedo convertir un sitio entero de una vez?
- Aquí no: la herramienta gratuita procesa una página a la vez. El sitio completo, con programación y entrega por API, es lo que resuelve el módulo Recolección, el mismo motor, funcionando a escala.
Una página es fácil. ¿Y mil?
Esta herramienta hace una página, ahora mismo. Rastrear un sitio entero, repetirlo cada día y entregar el resultado por API es lo que hace el módulo Scraping, con el mismo motor.
