Q1. 結局、止めるべきですか、通すべきですか。
本記事は、どちらにすべきかを指示しません。判断は三つの事実によって変わります。自社のIRドメインがいまAIの回答の中で出典として引かれているか。引かれていないなら、代わりに何が引かれているか。そして、説明会資料やよくある質問のように、自社サイトにしか置いていない説明がどれだけあるか、です。提出された開示には別の取得経路がありますが、自社サイトにしかない説明は、止めれば到達の機会そのものを失う場合があります。まず測ってください(§7)。
Q2. 「AIに学習されたくない」という方針は立てられますか。
立てられます。ただし、robots.txtで実現できるのは、そのクローラーによる今後の直接取得を減らすところまでです。すでに取得されたデータ、他者が収集した複製、契約に基づいて提供されたデータには及びません。また、提供者ごとに分け方が違います。OpenAIでは訓練用のGPTBotを個別に拒否できますが、GoogleのGoogle-ExtendedはGeminiの訓練と根拠付けを一つの名前で制御します。方針を立てたら、提供者ごとの公開文書に照らして書き方を確かめてください(§1、§6-3)。
Q3. GoogleとOpenAIで設定の書き方が違うのはなぜですか。
用途の分け方が違うためです。OpenAIは訓練用のGPTBotと検索用のOAI-SearchBotを別のクローラーとして公開しており、それぞれ別に指定できます。ただし、利用者の操作を起点とするChatGPT-Userには、robots.txtの規則が適用されない場合があると説明しています。GoogleのGoogle-Extendedは実際に取得しにくる別のクローラーではなく、robots.txtの中で制御に使われる名前で、Geminiの訓練と根拠付けを一つの名前で制御します(§1)。
Q4. 決算説明資料がPDFです。何に注意すべきですか。
HTMLのmetaタグはPDFに効きません。PDF自身にはHTMLのタグが無いためです。Googleの文書は、PDFなどHTML以外のリソースの索引付けを止めるには、HTTPのレスポンスヘッダ(X-Robots-Tag)を使うよう案内しています。ただし、これはGoogle検索での索引付けと表示の制御です。AIの提供者がその指定をどう扱うかは、提供者ごとの公開文書で確かめてください。「metaタグでnoindexを入れたから大丈夫」という理解でPDFを扱うと、意図した制御が掛かりません(§4)。
Q5. robots.txtを変更したのに結果が変わりません。効いていないのですか。
そう断定できません。OpenAIの文書は、robots.txtの変更が反映されるまで24時間ほどかかりうるとしています。また、ChatGPT-Userのようにrobots.txtの規則が適用されない場合がある取得や、すでに取得済みのデータもあります。IRでは、開示に別の取得経路が存在することも説明候補の一つです。これらは回答の観測だけからは区別できないため、「効かなかった」とも「別経路で届いている」とも決めつけないでください(§1-1、§3-1、§7-2)。
Q6. 本記事の内容は法的な助言ですか。
いいえ。§5-2で触れたEUと日本の制度は、条文と公的な資料を確認できた範囲の概観です。EUでは指令(EU)2019/790の第4条が、日本では著作権法第30条の4が関係しますが、具体的な扱いは各国の法令と個別の事情によって決まります。本記事は、ほかの国や地域の扱いを扱っていません。法的な評価が必要な場合は、個別に専門家へご確認ください。
Q7. Google-Extendedを拒否すると、Google検索での掲載や順位に影響しますか。
Googleの公式文書は、Google-ExtendedはGoogle検索への掲載に影響せず、Google検索の順位付けの要素としても使われないと明記しています。Google-Extendedは実際に取得しにくる別のクローラーではなく、取得そのものは既存のGoogleのクローラーが行います。Google-Extendedが制御するのは、GeminiアプリやVertex AIのGemini APIを支えるGeminiのモデルの訓練と、GeminiアプリおよびVertex AIでの根拠付けへの利用です。したがって、Geminiアプリなどでの利用と、Google検索での掲載とは、分けて確認することになります(§1-2)。
Q8. EDGARやEDINETに開示があるなら、自社IRサイトを止めても困らないのではありませんか。
提出された開示書類については、自社サイトとは別に機械が取得できる経路が存在するため、到達がすべて失われるとは限りません。ただし、経路が存在することと、ある提供者のAIがその経路から実際に取得していることとは別の問題です。また、説明会資料、よくある質問、事業説明のページのように自社サイトにしかない説明は、止めれば到達の機会そのものを失う場合があります。開示を制度上の経路で提出することと、AIの回答の中で自社ドメインが出典として引かれることは、別の目的です。自社ドメインが出典として引かれる機会と、情報への到達とを分けて確認してください(§3)。
Q9. 止めているのに引用されることがあるのはなぜですか。
理由は、公表されている観測からは特定できません。2026年5月に公表された観測では、robots.txtを取得できた引用のうち2.1%が、回答生成側のクローラーを拒否しているドメインからのものでした。ただし観測者自身が、契約による提供、第三者の索引、過去に取得済みのデータを区別できないと述べています。また、この標本では、拒否しているサイトの引用順位が自動的に後ろへ下がる現象は確認されていません。IRでは、開示に別の取得経路が存在することも説明候補の一つですが、どの経路が使われたかは、これらの観測からは分かりません(§2-3、§3-2)。
Q10. robots.txtでPDFのURLを拒否すれば、検索結果から消えますか。
消えるとは限りません。Googleの文書は、robots.txtで拒否したページでも、他のサイトからリンクされていれば索引に載りうるとしています。その場合、説明文の無いURLが検索結果に現れることがあります。さらに、metaタグやHTTPヘッダでの索引付けの指定はクロールの際に読まれるため、robots.txtで取得を拒否したURLでは読まれず、無視されます。取得を止めることと検索結果から消すことは、同じ操作では実現しません(§4-1)。
Q11. 研究の数字は、自社にも当てはまりますか。
そのまま当てはめることはできません。四つの研究は、それぞれ別のものを測っています。査読を経た研究はクローラーがrobots.txtに従うかを、未査読の研究はニュース発行元のトラフィックを、API観測はすでに現れた引用に拒否しているドメインがどれだけ含まれるかを、事業者による観測は拒否の状態と引用されやすさの2日間の相関を測りました。いずれも対象と期間が限られており、たとえば未査読の研究の因果推定は2024年5月より前の期間に限られています。自社への影響は、自社について測る必要があります(§2)。
Q12. robots.txtを変えた前後で測れば、変更の効果が分かりますか。
測定の条件を固定すれば、変更の前後の差は観測できます。ただし、その差だけからrobots.txtの変更の因果効果を特定することはできません。同じ期間に、モデルの更新、検索の索引の更新、報道、新しい開示などが重なりうるからです。設定を変えていないページや別の会社についての問いを対照として並べて測り、複数の時点で観測して、同時期の変化と区別してください(§7-4)。