LLMs.txt, robots.txt 및 AI 크롤러: 각 파일이 실제로 제어하는 것

겉보기에는 단순한 질문이 자주 등장합니다. 인공지능이 웹사이트를 올바르게 읽도록 llms.txt를 추가하면서도, 동시에 학습을 위해 콘텐츠를 가져가지 못하게 해야 할까요? 이에 대한 보편적인 예·아니요 답은 없습니다. 크롤러 액세스, 검색 노출, AI 에이전트를 위한 안내라는 서로 다른 세 가지가 뒤섞여 있기 때문입니다.

파일 자체보다 이들을 구분하는 일이 더 중요합니다. 그렇지 않으면 원하는 트래픽을 차단하면서도 기대했던 보호는 얻지 못할 수 있습니다.

먼저 무엇을 달성하려는지 명확히 하세요

  • Google 또는 ChatGPT Search가 페이지를 찾기를 원합니다. 색인 생성, 기술적 SEO 및 해당 검색 크롤러의 규칙을 다뤄야 합니다.
  • 모델 학습을 위해 콘텐츠를 제공하고 싶지 않습니다. 학습 크롤러와 서비스 약관을 다뤄야 합니다.
  • 에이전트에게 간결한 문서 지도를 제공하고 싶습니다. 이때는 llms.txt가 의미가 있을 수 있습니다.
  • 공개되지 않은 콘텐츠를 보호하고 싶습니다. 텍스트 파일만으로는 충분하지 않습니다. 인증, 권한 부여 및 실제 보안이 필요합니다.

이러한 결정은 기술적으로 서로 독립적입니다. 회사의 검색 크롤러와 학습 크롤러는 이름과 규칙이 서로 다를 수 있습니다.

llms.txt란 무엇이며, 무엇이 아닌가

LLMs.txt는 웹사이트 루트에 두는 간단한 Markdown 파일에 대한 제안입니다. 에이전트에게 짧은 설명과 중요한 출처로 연결되는 링크를 제공합니다. 광범위한 문서의 경우 제품, API, 약관 및 일반 절차를 담은 디렉터리가 될 수도 있습니다.

이는 액세스 정책이 아닙니다. 누가 학습을 위해 콘텐츠를 사용해도 되는지 권위 있게 규정하지 않으며, 페이지 다운로드를 막거나 검색 결과에서의 인용을 보장하지도 않습니다. Google은 Search의 AI 기능에 특별한 AI 파일이 필요하지 않으며 llms.txt가 Google Search에 아무것도 추가하지 않는다고 명시합니다.

회사 웹사이트에서는 짧고 정확하며 유용한 출처 목록을 유지할 수 있을 때 이를 배포하겠습니다. 빈 SEO 제스처로 사용하지는 않습니다. 오래된 지도는 잘못된 가격, 이전 지침 또는 삭제된 페이지를 제공하므로 없는 것보다 나쁩니다.

Robots.txt는 신뢰나 보안이 아니라 크롤링을 제어합니다

robots.txt 파일은 협조적인 크롤러에게 어디로 이동해도 되는지 또는 안 되는지를 알려줍니다. 이 파일은 공개되어 있고 규칙은 사용자 에이전트에 따라 달라지며, 말을 듣지 않는 로봇을 막는 방화벽이 아닙니다.

robots.txt에서 차단한다고 해서 검색 엔진에서 URL이 제거되는 것은 아닙니다. Google은 콘텐츠를 읽을 수 없더라도 다른 링크를 통해 주소를 알 수 있습니다. 공개되지 않은 데이터에는 로그인을 사용하세요. 결과에 표시되지 않아야 하는 페이지라면 일반적으로 크롤링 가능한 URL에서 noindex를 사용하거나 적절한 상태 코드를 적용합니다.

모든 AI 로봇을 위한 단일 스위치는 없습니다

OpenAI: 검색과 학습은 별도로 결정할 수 있습니다

OpenAI는 별도의 크롤러를 문서화하고 있습니다. OAI-SearchBot는 ChatGPT 검색을 위한 콘텐츠를 발견하고, GPTBot는 생성형 모델 개선을 위해 사용될 가능성과 관련됩니다. 따라서 첫 번째는 허용하고 두 번째는 차단할 수 있습니다.

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User는 사용자가 실행한 요청을 식별하며 검색에 포함시키기 위한 메커니즘이 아닙니다. 오래된 사용자 에이전트 목록을 그대로 복사하기보다 제공업체의 최신 약관을 확인하세요.

Google: Search와 Google-Extended는 동일하지 않습니다

Google Search 문서에 따르면 AI Overviews와 AI Mode는 검색 색인과 해당 시스템을 사용합니다. 따라서 Googlebot 액세스는 일반 검색과 이러한 기능의 대상 여부에 영향을 줍니다.

Google-Extended는 Gemini 모델 개선을 위해 콘텐츠를 사용하고 일부 제품에서 근거 자료로 활용하기 위한 별도의 제품 토큰입니다. Google은 이를 차단해도 Search에서의 포함 여부나 순위에는 영향을 주지 않는다고 설명합니다. 이는 Googlebot 규칙을 대신할 수 없습니다.

다른 서비스에는 각자의 규칙이 있습니다

Anthropic은 ClaudeBot, Claude-SearchBot 및 사용자가 시작한 로딩을 구분합니다. Perplexity는 검색 색인을 위해 PerplexityBot를 설명합니다. 이름과 목적은 바뀔 수 있습니다. 중요한 서비스 목록을 유지하고 각 서비스의 기본 문서와 대조해 확인하세요.

회사 웹사이트에서 제가 결정하는 방법

  1. 비즈니스 목표를 기록합니다. 자연 검색 트래픽, 인용, 유료 콘텐츠 보호를 원하는지, 아니면 서로 다른 규칙으로 이 모든 것을 원하는지 결정해야 합니다.
  2. 기술적 기반을 점검합니다. 표준 URL, 색인 생성, 상태 코드, 사이트맵 및 내부 링크를 확인합니다. 어떤 특별한 파일도 부실한 기반을 구해줄 수 없습니다.
  3. 목적별로 크롤러를 구분합니다. 검색, 학습 및 사용자 실행 로딩은 서로 다른 범주입니다.
  4. 공개되지 않은 데이터를 실제로 보호합니다. 고객 제안서, 관리 영역 및 내부 문서는 로봇에게 지시하는 것만으로 보호되지 않습니다.
  5. LLMs.txt를 콘텐츠 담당자와 함께 추가합니다. 링크와 설명이 계속 정확하게 유지되도록 관리해야 합니다.
  6. 결과를 측정합니다. 로그, Search Console 및 관련 출처에서 유입된 방문을 모니터링하세요. 파일이 존재한다고 해서 최적화가 완료된 것은 아닙니다.

AI 답변의 출처가 되고 싶다면 웹사이트 루트의 파일보다 콘텐츠와 근거에서 시작하세요. 이에 대해서는 AI와 Google이 출처를 선택하는 방법에서 설명합니다. 자연 검색 트래픽을 위험에 빠뜨리지 않고 크롤러 설정을 검토하려면 문의 페이지를 이용하세요.

마케팅에서 명확성이 필요하신가요?

먼저 상황을 명확히 정리해 보겠습니다.

귀사가 비슷한 의사결정에 직면해 있다면, 현재 상황을 간단히 알려 주세요. 계속 진행하는 것이 합리적인지 함께 살펴보겠습니다.

상황 설명하기