LLMs.txt、robots.txt、AIクローラー:各ファイルが実際に制御するもの

一見すると簡単な質問がよく出てきます。人工知能がウェブサイトを正しく読み取り、同時にコンテンツを学習に利用しないようにするには、llms.txt を追加すべきでしょうか。万能なイエスやノーはありません。クローラーのアクセス、検索での可視性、AIエージェントへの案内という、異なる3つの事柄が混同されているからです。

ファイルそのものよりも、それらを切り分けることが重要です。そうしなければ、望んでいるトラフィックをブロックしながら、期待していた保護も得られない可能性があります。

まず、何を達成したいのかを明確にする

  • GoogleやChatGPT Searchにページを見つけてもらいたい。インデックス登録、テクニカルSEO、そして対象となる検索クローラーのルールに取り組みます。
  • モデルの学習にコンテンツを提供したくない。学習クローラーとサービスの利用規約に取り組みます。
  • エージェントに簡潔なドキュメントの案内図を提供したい。llms.txt がここで意味を持つ場合があります。
  • 非公開コンテンツを保護したい。テキストファイルだけでは不十分です。認証、認可、そして実際のセキュリティが必要です。

これらの判断は技術的に独立しています。企業の検索クローラーと学習クローラーでは、名前もルールも異なる場合があります。

llms.txtとは何か、何ではないのか

LLMs.txtは、ウェブサイトのルートに置くシンプルなMarkdownファイルの提案です。エージェントに短い説明と重要な情報源へのリンクを提供します。大規模なドキュメントの場合は、製品、API、利用規約、一般的な手順などのディレクトリにすることもできます。

これはアクセス方針ではありません。学習のために誰がコンテンツを利用できるかを正式に定めたり、ページのダウンロードを防いだり、検索結果での引用を保証したりするものではありません。Googleは、検索のAI機能に特別なAIファイルは必要なく、llms.txt を追加してもGoogle検索には何も加わらないと明言しています。

企業サイトでは、短く正確で役立つ情報源のリストを維持できる場合に導入します。中身のないSEO施策としてではありません。古い案内図は、無効な価格、古い手順、削除済みページを示すため、ない場合より悪い結果を招きます。

Robots.txtが制御するのはクロールであり、信頼やセキュリティではない

robots.txtファイルは、協力的なクローラーに対して、アクセスしてよい場所、よくない場所を伝えます。公開情報であり、ルールはユーザーエージェントに依存します。指示に従わないロボットに対するファイアウォールではありません。

robots.txt でブロックしても、検索エンジンからURLを確実に削除できるわけではありません。Googleは、コンテンツを読み取れなくても、他のリンクからそのアドレスを知る可能性があります。非公開データにはサインインを使用してください。検索結果に表示したくないページには、通常、クロール可能なURL上で noindex を使うか、適切なステータスコードを使用します。

すべてのAIロボットに使える単一のスイッチはない

OpenAI:検索と学習は別々に判断できる

OpenAIの文書ではクローラーを分けて説明していますOAI-SearchBot はChatGPT検索用のコンテンツを発見し、GPTBot は生成モデルの改善に利用される可能性に関係します。そのため、前者を許可し、後者をブロックすることもできます。

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User はユーザーによって開始されたリクエストを識別するもので、検索への掲載を実現する仕組みではありません。古いユーザーエージェントの一覧をコピーするのではなく、プロバイダーの最新の利用規約を確認してください。

Google:SearchとGoogle-Extendedは同じではない

Google検索のドキュメントによると、AI OverviewsとAI Modeは検索インデックスとそのシステムを使用します。そのため、Googlebotへのアクセスは通常の検索と、これらの機能の対象となる可能性に影響します。

Google-Extended は、Geminiモデルの改善や一部の製品でのグラウンディングにコンテンツを使用するための、別個のプロダクトトークンです。Googleは、これをブロックしても検索への掲載やランキングには影響しないと説明しています。Googlebotのルールの代わりにはなりません。

他のサービスにはそれぞれのルールがある

Anthropicは、ClaudeBotClaude-SearchBot、ユーザーが開始した読み込みを区別しています。Perplexityは検索インデックス用にPerplexityBot を説明しています。名前や目的は変わる可能性があります。重要なサービスの一覧を作成し、各サービスの一次文書と照合してください。

企業サイトで私ならどう判断するか

  1. ビジネス上の目標を書き出す。オーガニックトラフィック、引用、有料コンテンツの保護、それとも異なるルールでこれらすべてを望んでいるのでしょうか。
  2. 技術的な基盤を確認する。カノニカルURL、インデックス登録、ステータスコード、サイトマップと内部リンクを確認します。基盤がなければ、特別なファイルで補うことはできません。
  3. 目的ごとにクローラーを分ける。検索、学習、ユーザーが開始した読み込みは、それぞれ異なるカテゴリーです。
  4. 非公開データを実際に保護する。顧客向けの提案書、管理画面、社内文書は、ロボットに指示するだけでは保護されません。
  5. LLMs.txtをコンテンツ担当者とともに追加する。リンクと説明が正確な状態を保てるよう、誰かが管理する必要があります。
  6. 結果を測定する。ログ、Search Console、関連する情報源からの訪問を監視します。ファイルが存在するだけでは最適化は完了しません。

AIの回答における情報源になりたいなら、ウェブサイトのルートにファイルを置くことではなく、コンテンツと根拠から始めてください。AIとGoogleが情報源を選ぶ仕組みで詳しく説明しています。オーガニックトラフィックを危険にさらさずにクローラー設定を見直すには、お問い合わせページを利用してください。

マーケティングの状況を明確にしたいですか?

まずは状況を明確にしましょう。

あなたの会社が同様の意思決定に直面しているなら、まずは状況を簡単にお知らせください。続ける意味があるか、一緒に検討します。

状況を説明する