도구

어떤 페이지든 깨끗한 Markdown으로.

페이지를 모델에 복사해 붙여넣으면 메뉴, 배너, 푸터, 스크립트까지 함께 들어가며, 그 모든 것에 토큰 비용을 냅니다. 여기에서는 헤더에 출처를 포함한 Markdown 콘텐츠만 나옵니다.

모듈
스크래핑
입력
URL 하나
실행 위치
Rovemark 서버
비용
무료, 가입 불필요
이 도구가 하는 일

필요한 본문만, 페이지의 나머지는 떼고

웹페이지는 브라우저를 위해 만들어집니다. 메뉴, 배너, 뉴스레터 양식, 푸터, 많은 스크립트가 있습니다. 이를 모델에 복사하면 모두 함께 들어가 컨텍스트를 차지하고 토큰 비용이 들며, 중요한 내용을 읽는 데도 방해가 됩니다.

도구는 페이지를 가져와 본문이 아닌 것을 버리고, 주요 블록을 골라 Markdown으로 바꿉니다. 제목은 #, 목록은 -, 표는 표 그대로, 링크는 절대 주소로. 맨 위에는 출처 URL이 담긴 머리말이 붙어, 모델이 이 글이 어디서 왔는지 알게 합니다.

작동 방식
  1. 01

    페이지 주소를 붙여넣습니다

    한 페이지, 가입 불필요. 크롤러가 그러듯 원본에서 곧바로 가져옵니다.

  2. 02

    본문이 아닌 것은 떨어져 나갑니다

    스크립트, 스타일, 메뉴, 푸터, 사이드바는 제거됩니다. 가장 긴 본문 텍스트 블록만 남습니다. 콘텐츠가 있는 곳입니다.

  3. 03

    붙여넣기만 하면 되는 Markdown이 나옵니다

    단어 수와 토큰 추정치가 함께 나와, 그중 얼마가 모델의 컨텍스트에 들어갈지 알 수 있습니다.

자주 묻는 질문
01

왜 일반 텍스트가 아니라 Markdown인가요?

Markdown은 거의 토큰 비용 없이 계층 구조를 보존하기 때문입니다. 모델은 제목, 목록 항목, 표를 구분할 수 있으며, 모든 요소의 비중이 같은 긴 텍스트 블록보다 구조화된 텍스트에 더 잘 답합니다.
02

어떤 사이트에서든 되나요?

서버가 제공하는 HTML에 텍스트가 있을 때 작동합니다. JavaScript 이후에만 콘텐츠를 구성하는 사이트는 빈 껍데기를 반환합니다. 이 도구는 그 경우를 알려주며, 성공한 척 빈 파일을 제공하지 않습니다.
03

변환한 페이지를 도구가 저장하나요?

아닙니다. 페이지는 같은 요청 안에서 가져오고, 변환하고, 돌려줍니다. 서버 쪽에는 아무것도 저장하지 않습니다.
04

로그인이나 페이월 뒤에서도 되나요?

아닙니다. 조회는 세션 없이 익명 방문자와 정확히 같은 방식으로 이루어집니다. 따라서 로그인하지 않은 누구나 볼 수 있는 내용을 받습니다. 로그인 뒤의 콘텐츠는 인증된 세션으로 작동하는 스크래핑 모듈이 필요합니다.
05

토큰 수가 왜 추정치인가요?

모델마다 토크나이저가 다르며 정확한 수치는 모델마다 달라지기 때문입니다. 추정치는 문자당 평균 비율을 사용하고 작성 방식에 맞춰 조정합니다. 컨텍스트와 비용을 가늠하기에는 충분하지만 청구 금액을 확정하기 위한 수치는 아닙니다.
06

사이트 전체를 한 번에 변환할 수 있나요?

여기서는 아닙니다. 무료 도구는 한 번에 한 페이지를 처리합니다. 일정 설정과 API 제공을 포함한 전체 사이트 처리는 스크래핑 모듈이 해결합니다. 같은 엔진을 규모 있게 실행합니다.

한 페이지는 쉽습니다. 천 페이지는요?

이 도구는 지금 이 자리에서 한 페이지를 처리합니다. 사이트 전체를 훑고, 매일 반복하고, 결과를 API로 넘기는 일은 같은 엔진을 쓰는 스크래핑 모듈이 합니다.