部門別ユースケース

IRサイトのAIクローラーは止めるべきか|robots.txtで決める前に確かめること

2026-09-24読了目安 20分

著者: 株式会社Vaigate(AI上の認知を、複数のAIへの合計25回のステートレス計測で測定するVaipmを運営)

この記事のポイント

自社IRサイトで生成AIのクローラーを止めるべきか。OpenAIとGoogleでは制御の分け方が違います。提出された開示にはEDGAR・EDINET・TDnetという別の取得経路がある一方、自社サイトにしかない説明は到達を失いえます。引用される機会と到達を分けて確かめ、変更の前後に何を測るかまで解説します。

結論サマリー

自社のIRサイトで、生成AIのクローラーを止めるべきか、通すべきか。この問いに一行で答えられる設定はありません。

理由は二つあります。一つは、AIクローラーが用途ごとに分かれていて、しかも分け方が提供者ごとに違うことです。OpenAIは、訓練用のクローラーと検索機能用のクローラーを別々に指定できるようにしています。ただし、利用者の操作を起点とする取得にはrobots.txtの規則が適用されない場合がある、とも説明しています。GoogleのGoogle-Extendedは、Geminiの訓練と回答の根拠付けを一つの名前でまとめて制御し、Google検索への掲載には影響しません。「AIを止める」という一枚岩の操作は、そもそも存在しません。

もう一つは、IR情報に固有の事情です。上場企業の開示は、自社のIRサイト以外にも、機械が取得できる経路を持っています。 米国のEDGAR、日本のEDINETとTDnetは、いずれもプログラムによる取得を想定した経路です。ただし利用の条件は揃っていません。

したがって、自社IRサイトでクローラーを止めても、提出された開示情報への到達がすべて失われるとは限りません。一方で、説明会資料、よくある質問、事業説明のページのように、自社サイトにしか置いていない説明は、止めれば到達の機会そのものを失う場合があります。判断の中心は、自社ドメインが出典として引かれる機会と、情報そのものへの到達とを、分けて確認することです。

本記事は、止める・通すの判断材料を整理します。どう設定すべきかを指示する記事ではありません。設定の前に何を確かめるべきか、そして設定を変えたあとに何を測れば、何が言えて何が言えないのかまでを扱います。

なお、AIクローラーが自社サイトのJavaScriptを実行するかという到達の問題はAIクローラーとIRサイトの技術的条件を扱う記事で、開示PDFの中身が正しく取り出せているかという抽出の問題は開示資料の読み取りを扱う記事で扱っています。本記事は、その手前にある「取らせるかどうか」に絞ります。IR全体の見取り図はIRのためのAI認知の親記事をご覧ください。

1. 用途で分かれている

1-1. OpenAIは訓練用と検索用を別に指定できる

主要な提供者は、クローラーを用途で分けて公開しています。OpenAIの開発者向け文書は、次のように区分しています。

表1:OpenAIが公開しているクローラーの区分
名前用途(公式文書の記載)
GPTBot生成AIの基盤モデルの訓練に使われうるコンテンツの収集
OAI-SearchBotChatGPTの検索機能の結果にサイトを表示するため
ChatGPT-User利用者がChatGPTやカスタムGPTに質問した際などの、利用者の操作を起点とする取得。利用者が起点であるため、robots.txtの規則が適用されない場合があると記載されている
OAI-AdsBotChatGPTに出稿された広告のランディングページの安全性の確認。広告を利用者に表示するのがいつ適切かの判断に、ランディングページの内容を使う場合があると記載されている

この区分によって、「学習には使わせたくないが、ChatGPTの検索機能の回答には表示されたい」という設定が、技術的には書けます。 GPTBotだけを拒否し、OAI-SearchBotを許可する、という書き方です。同じ文書は、それぞれの設定は他の設定と別に扱われると述べています。また、OAI-SearchBotを拒否したサイトはChatGPTの検索の回答には表示されないが、ナビゲーション用のリンクとしては現れうる、とも書いています。

ただし、ChatGPT-Userについては事情が異なります。表1のとおり、同じ文書は、この取得は利用者の操作を起点とするため、robots.txtの規則が適用されない場合があると明記しています。したがって、OpenAIについて正確に言えるのは、訓練用のGPTBotと検索用のOAI-SearchBotを別々に指定できるというところまでです。利用者の操作を起点にした取得まで、robots.txtで同じように制御できるとは限りません。

同じ文書は、robots.txtの変更が反映されるまでの時間についても触れており、サイト側の更新から提供者側の仕組みが追随するまで24時間ほどかかりうるとしています。変更した直後に測って「変わらない」と判断するのは早すぎます。

1-2. Googleは別の形で分けている

Googleは、OpenAIと同じ形になっていません。ここは実務上、誤解が生じやすいところです。

Googleの公式文書は、Google-Extendedについて次のように述べています。

Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity.

つまり、Google-Extendedという名前のクローラーが実際にサイトへやってくるわけではありません。 取得そのものは既存のGoogleのクローラーが行い、Google-Extendedはrobots.txtの中で制御のために使われる名前です。

同じ文書によれば、Google-Extendedが制御するのは二つです。一つは、GeminiアプリやVertex AIのGemini APIを支える、今後のGeminiのモデルの訓練に使うかどうか。もう一つは、Geminiアプリと、Vertex AIの「Grounding with Google Search」で、回答の時点でモデルに内容を与える根拠付け(グラウンディング)に使うかどうかです。そして、検索との関係については次のように明示しています。

Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.

ここから二つのことが言えます。

第一に、Google-Extendedの範囲では、「Geminiの訓練には使わせないが、Geminiアプリでの回答の根拠付けには使ってほしい」という区別を、一つのトークンでは表現できません。 訓練と根拠付けが同じ名前で制御されるからです。OpenAIで訓練用と検索用を別に書けるのとは、分け方が違います。

第二に、Google-ExtendedはGoogle検索への掲載に影響しないと明記されているため、Google検索の中の扱いを制御する手段としては読めません。検索の側の扱いは、検索エンジン向けの規則として別に考える必要があります(§4)。この点はAIOの全体像を扱う記事でも触れていますが、IRの文脈では、Geminiアプリなどでの利用と、Google検索での掲載とを、区別して確認することになります。

この設計差を知らずに「AI関連のトークンをすべて拒否する」と書くと、提供者ごとに違う結果が出ます。それは設定の失敗ではなく、仕様が揃っていないことの帰結です。

2. 止めるとどうなるか

止めた場合に何が起きるかに関わる研究が、いくつか公表されています。根拠の性質ごとに並べます。四つの研究は、それぞれ別のものを測っています。 数字はいずれも、その研究の対象と期間に限った観測です。

2-1. 査読を経た測定

査読を経たものとして、ACM Internet Measurement Conference 2025で発表された研究があります。24種類のAIクローラーのユーザーエージェント、上位サイト群、2022年10月から2024年10月までのrobots.txtの履歴を用いた長期の分析で、安定して上位に入るサイトだけでも4万件を超えるrobots.txtが対象になっています。

この研究が主に測ったのは、クローラーがrobots.txtに従うかどうかです。AIの回答の中での引用は測っていません。本記事に効くのは次の二点です。

第一に、研究者が管理するサイトを6か月観測した実験で、訪れた9種類のAIクローラーのうち7種類はrobots.txtに従いました。1種類はrobots.txtを取得したうえでその指示に従いませんでした。残る1種類はChatGPT-Userで、robots.txtを取得していませんでした。 ChatGPT-Userについては、利用者の操作を起点とする取得にはrobots.txtが適用されない場合があるというOpenAIの説明(§1-1)と整合します。いずれにしても、「robots.txtに書けば技術的にアクセスできなくなる」わけではない、ということです。

第二に、2023年8月から2024年10月のあいだに、484のサイトが、いったん設定したGPTBotの制限を解除しています。 そこには提供者との商業的な関係を公表した発行元が含まれていました。ただし研究の著者自身が、契約が設定変更を引き起こしたとまでは立証していないと述べています。相関の観測です。

2-2. 未査読の因果推定

未査読の作業論文として、ニュース発行元の対応を分析したものがあります。新聞社30ドメインを主分析、上位500の発行元を補助分析として、2022年11月から2024年5月を対象にしています。

この研究が測ったのは、制限を設けた発行元のサイト全体のトラフィックです。AIの回答の中での引用は測っていません。

時期のずれを利用した差の差分析で、制限を設けた後の6週間で、ウェブのトラフィックがおおむね7%減少したと推定しています。 三つの計測系列で方向は揃いましたが、うち二つは信頼区間がゼロをまたいでおり、統計的な精度は系列によって異なります。

重要な限定が三つあります。第一に、これは「AI経由の流入が7%減った」と直接測ったものではありません。当時はAI経由の流入自体が小さく、著者らは露出や流通経路が弱まる間接的な効果を、ありうる機序として議論しています。

第二に、因果推定の対象期間は2024年5月より前に限られています。 Googleの検索でAIによる要約が導入された影響が混ざるのを避けるためだと著者らが述べています。つまり、AI検索が広がったあとの期間については、この推定は何も言っていません。

第三に、未査読の作業論文です。推定値をそのまま自社に当てはめられる性質のものではありません。

2-3. 止めていても引用される

2026年5月に公表された観測があります。複数の提供者のウェブ検索APIから、330件の問いに対する24,127件の引用を集めたものです。このうちrobots.txtを取得できた22,263件の引用を対象に数えると、学習側の取得を拒否しているドメインからの引用が7.8%、回答生成側の取得を拒否しているドメインからの引用も2.1%ありました。 残りの引用は、ネットワークや名前解決の失敗でrobots.txtを取得できず、計算から外されています。OpenAIについては、OAI-SearchBotを拒否しているドメインからの引用が1.1%ありました。

この観測が測ったのは、すでに回答に現れた引用のうち、拒否しているドメインからのものがどれだけ含まれるかです。止めたときに引用がどれだけ減るかは測っていません。また、拒否しているサイトの引用順位が自動的に後ろへ下がる現象は、この標本では確認されていません。

限界は大きいものです。これは消費者向けの製品そのものではなくAPIの観測であり、契約による提供、第三者の索引、過去に取得済みのデータを区別できません。「robots.txtは無意味だ」と読んではいけない、と観測者自身が述べています。

2-4. 事業者による観測

AI可視性のツールを提供する事業者による観測もあります。1,058のドメインについて2日間の引用を観測し、検索での出現で標準化したもので、提供者ごとのクローラーを拒否しているドメインでは、同じ提供者の回答での引用されやすさが大きく下がるという対応が見られたとしています。

この観測が測ったのは、拒否の状態と引用されやすさの対応(相関)です。ランダム化された実験ではなく、観測期間は2日間です。 クローラーを拒否するサイトは事業の形や規模も異なります。観測した事業者自身が、方向性を示すものであって因果を証明したものではないとしています。AI可視性のツールを提供する事業者による観測である、という点も併せてお読みください。

2-5. 研究ごとに言えること

四つの研究は、測っているものが違います。足し合わせて一つの結論にはできません。

表2:各研究が測ったものと、本記事で使える範囲
研究測ったもの本記事で使える範囲
査読を経た測定(§2-1)クローラーがrobots.txtに従うかrobots.txtに従わない取得や、robots.txtを取得しない取得があること。引用への影響は測っていない
未査読の作業論文(§2-2)制限を設けた発行元のサイト全体のトラフィック2024年5月より前の、ニュース発行元についての推定。回答の中での引用は測っていない
API観測(§2-3)すでに現れた引用に、拒否しているドメインがどれだけ含まれるか拒否していても引用が現れること。止めたときの減り方と、取得の経路は測っていない
事業者による観測(§2-4)拒否の状態と引用されやすさの対応2日間の相関。因果は示していない

以上から言えるのは、次のところまでです。

クローラーの拒否と、AIの回答の中での引用とのあいだには、関係が観測されている。一方、効果の大きさや因果関係は、研究ごとに射程が異なる。拒否していても引用が現れる例も観測されている。

拒否していても引用が現れる理由を、これらの観測から特定することはできません。次章では、IRに固有の事情として、その説明候補の一つになる構造を扱います。

3. 止めても消えないもの

ここがIRに固有の事情です。本記事の中心になります。

3-1. 開示には別の取得経路がある

上場企業の開示情報は、発行体のIRサイトだけに存在するのではありません。プログラムによる取得を想定した経路が用意されています。

表3:開示情報の機械取得の経路
経路運営利用の条件
EDGAR米国証券取引委員会無償・登録不要。APIや自動処理向けの索引を提供している。公平なアクセスのための方針として、現在の上限は毎秒10リクエスト、ヘッダで利用者を名乗ること、効率的な取得を求めている。許容される方針の範囲外の自動化ツールによるリクエストは、公平なアクセスを確保するよう管理されるとしている
EDINET金融庁アカウントの作成とAPIキーが必要。APIへの接続にはAPIキーによる認証を用い、APIキーの発行にはアカウントの作成を要する。書類の一覧を取得するAPIと、書類そのものを取得するAPIがあり、仕様書が公開されている
TDnet APIJPX総研(日本取引所グループ)有料の情報サービスとして提供されている。日本取引所グループのサイトでは、上場会社関連の有料情報の区分に置かれている

三つは同じ条件で開かれているわけではありません。 EDGARは登録なしで取得できますが、EDINETはアカウントとAPIキーを要し、TDnet APIは有料のサービスです。「公開されている」と一語でまとめると、この差が見えなくなります。

また、こうした経路を実際にどの事業者が使っているか、そこで取得された情報がどのAIの提供者に渡っているかは、本記事では確認できていません。

結果として、言えるのは次のところまでです。

自社のIRドメインでAIクローラーを止めても、法定開示・適時開示として提出された情報には、自社サイトとは別に機械が取得できる経路が存在する。ただし、経路が存在することと、ある提供者のAIがその経路から実際に取得していることとは、別の問題である。

3-2. 到達と引用機会を分けて考える

この事実から、判断の軸を二つに分けられます。

一つは、情報そのものへの到達です。提出された開示書類については、自社サイトを止めても別の経路が存在するため、到達がすべて失われるとは限りません。一方、説明会資料、よくある質問、事業説明のページのように、自社サイトにしか置いていない説明は事情が違います。止めれば、その説明に機械が到達する機会そのものを失う場合があります。

もう一つは、自社ドメインが出典として引かれる機会です。AIの回答が同じ決算の数字を述べるとき、その出典が自社のIRページを指しているのか、それとも開示ポータル、報道、まとめサイト、あるいは競合の比較記事を指しているのかは、別の問題です。

自社IRページの引用が減ったとき、他の供給源への置き換えが起きるのか、引用の数そのものが減るのか、回答の内容が変わるのかは、別に測る必要があります。確かめるべきは、回答で使われる出典の構成が変わるかどうかです。

前章で「止めていても引用される」という観測を紹介しました。IRでは、開示に別の取得経路が存在することが、その説明候補の一つになります。ただし、§2-3の観測は契約による提供、第三者の索引、過去に取得済みのデータを区別できないため、実際の取得経路をそこから特定することはできません。

3-3. 出典が自社かどうかで、何が変わりうるか

「出典として引かれる機会」と書くと抽象的に聞こえますが、IRの実務では具体的な差になりえます。

開示ポータルが出典になっている場合、そこで確認できるのは提出された一次の開示書類です。提出書類にも、事業や業績についての説明は含まれます。ただし、自社IRサイトに置かれた説明会資料、よくある質問、事業説明のページとは、含まれる説明の範囲や構成が異なります。

自社のIRサイトには、なぜその水準なのか、前提として何を置いたのかといった、会社側が補足した説明が置かれていることがあります。それが出典として引かれるかどうかは、AIの回答がどの説明を土台にするかの差になりえます。

報道やまとめサイトが出典になっている場合は、さらに事情が変わります。そこには他者による要約と評価が入っています。正確なこともあれば、古いこともあり、前提が落ちていることもあります。自社が説明していない部分を、他者の要約が埋めている場合があります。

この問題そのものは、クローラーの設定とは別に存在します。引用されているのに内容が誤っている、あるいは他社の事案が自社のものとして語られるという型については、AI誤情報・誤帰属対策の記事で扱っています。本記事が言えるのは、クローラーの設定が、その供給源の構成に影響しうるということまでです。

3-4. 二つの目的を分ける

同じ構造から、次のことも言えます。

開示情報を制度上の経路で提出することと、AIの回答の中で自社ドメインを出典として引いてもらうことは、分けて考えられます。 法定開示・適時開示の提出・配信の経路は、自社IRサイトのAIクローラー設定とは別に存在します。一方、自社ドメインが出典として引かれるかどうか、そして自社サイトにしかない説明に機械が到達できるかどうかは、自社サイトの設定に左右されます。

この二つを混ぜて「開示が届かなくなると困るから通す」と考えると、判断の根拠を取り違えます。逆に「どうせ別経路があるのだから止めてよい」と考えると、自社サイトにしかない説明への到達と、§3-3で述べた供給源の構成の話を落とします。二つの目的を分けて、それぞれに根拠を置いてください。

4. 手段の違い

止める・通すを実現する手段は一つではありません。効き方が異なります。IRでとくに重要なのは、PDFに効くかどうかです。

表に入る前に、一つ区別しておきます。HTMLのmetaタグとHTTPヘッダでの指定は、Googleが検索の索引付けと検索結果での表示を制御する手段として文書化しているものです。Googleの文書は、これらの規則がGoogle検索の結果での索引付けと表示を制御するものだと説明しています。検索エンジンの索引・表示の制御と、AIの提供者がそれぞれ定める利用の制御とは、区別して読んでください。 あるAIの提供者がこれらの指定をどう扱うかは、その提供者の公開文書で個別に確かめる必要があります。

表4:制御手段とPDFへの効き方
手段制御するものPDF限界
robots.txtクローラーごとの取得可否効く(URLとして指定できる)クローラーが従う前提。取得済みのデータは消えない。利用者の操作を起点とする取得には適用されない場合がある
HTMLのmetaタグ検索の索引付けや抜粋の可否(Googleの文書の場合)効かないPDF自身にHTMLのタグは無い。またHTMLを取得させなければタグを読ませられない
HTTPヘッダでの指定検索の索引付けや抜粋の可否(Googleの文書の場合)効くGoogleは、PDFなどHTML以外のリソースの索引付けを止める手段として案内している。AIの提供者が対応しているかは個別に確かめる必要がある
WAFやCDNでの遮断リクエストそのもの効くrobots.txtより強制力がある。ただし名前だけでの遮断は偽装されうる
認証コンテンツへの到達そのもの効く到達そのものを制限できるが、一般投資家向けの公開IRには通常なじまない
契約に基づく提供契約先だけに別経路で提供効くクローラーの設定とは別に管理できる

4-1. 決算説明資料をPDFだけで出している場合

IRの実務でよくある形です。このとき、次の差が効いてきます。

  • robots.txtでPDFのパスを拒否すると、従うクローラーはPDFの本文を取得しません。
  • HTMLのmetaタグは、PDFそのものには効きません。 Googleの文書は、PDFなどHTML以外のリソースの索引付けを止めるには、HTTPのレスポンスヘッダ(X-Robots-Tag)を使うよう案内しています。
  • PDFの応答にHTTPヘッダで指定すれば、Google検索での索引付けや抜粋の扱いを指定できます。AIの提供者がその指定に従うかは、提供者ごとに確かめる必要があります。

「metaタグでnoindexを入れたから大丈夫」という理解でPDFを扱うと、意図した制御が掛かりません。

もう一点、取得を止めることと検索結果から消すことは別です。Googleの文書は、robots.txtで拒否したページでも、他のサイトからリンクされていれば索引に載りうる、としています。その場合、説明文の無いURLが検索結果に現れることがあります。さらに、metaタグやHTTPヘッダでの指定はクロールの際に読まれるため、robots.txtで取得を拒否したURLでは、索引付けについての指定が読まれず、無視されると述べています。止めることと消すことは、同じ操作では実現しません。

5. 制度の話

5-1. robots.txtはアクセス制御ではない

robots.txtの仕様はRFC 9309として2022年9月に標準化されています。その文書自身が、次のように述べています。

The Robots Exclusion Protocol is not a substitute for valid content security measures.

同じ文書は、robots.txtにパスを列挙することはそのパスを公開することであり、発見可能にしてしまうとも指摘しています。実際のアクセス制御が必要なら、アプリケーション側の認証など有効な手段を用いるべきである、という立場です。

robots.txtは、従う相手にだけ効く申し入れです。 §2-1で触れた、指示に従わなかったクローラーの観測は、この性質の裏返しです。

5-2. 国や地域によって位置づけが違う

権利の側から見ると、扱いは国や地域ごとに異なります。ここでは、条文と公的な資料を確認できた二つを挙げます。

  • EUでは、デジタル単一市場における著作権指令(指令(EU)2019/790)の第4条が、テキスト・データマイニングのための複製と抽出について例外を定めています。同条第3項は、この例外を、権利者が適切な方法で明示的に留保していない場合に適用するとし、オンラインで公開されたコンテンツについては機械可読な手段を例に挙げています。指令は加盟国の国内法を通じて適用されるため、具体的な扱いは各国の法令によります。
  • 日本では、著作権法第30条の4が、情報解析の用に供する場合など、著作物に表現された思想又は感情の享受を目的としない利用について定めています。条文には、権利者が留保を表明すれば適用が外れる、という定めは置かれていません。ただし書として、著作権者の利益を不当に害することとなる場合は適用しないと定めています。文化審議会著作権分科会法制度小委員会の「AIと著作権に関する考え方について」(2024年3月15日)は、著作権者が反対の意思を示していることそれ自体によって権利制限の対象から除外されると解釈するのは困難だとしています。そのうえで、robots.txtによるアクセス制限のような技術的な措置が、他の事情と併せて、ただし書に当たるかどうかの検討にかかわる場合があると整理しています。同文書は、それ自体が法的な拘束力を持つものではないと明記しています。

ほかの国や地域の扱いは、本記事では扱いません。いずれも本記事の範囲を超える論点です。法的な評価が必要な場合は、個別に専門家へご確認ください。本記事は法的助言ではありません。

5-3. 提供者ごとに対応が異なる表記がある

画像などで使われるnoaiやnoimageaiという表記があります。DeviantArtは2022年11月、作品をAIの学習に使うことを許諾していない旨を伝えるものとして、これらをHTMLのmetaタグとHTTPヘッダで付与する仕組みを導入したと公表しています。

一方で、各AIの提供者がこれらの表記をどう扱うかは、提供者ごとの公開文書で個別に確かめる必要があります。たとえば、Googleのrobots metaタグの仕様が挙げる規則の一覧には、これらは含まれていません。

機械可読な形で、AIによる利用についての意向を表明する方法については、IETFのAI Preferences作業部会で、語彙と、robots.txtやHTTPヘッダを使った付与の方法の検討が続いています。2026年9月23日時点で、この作業部会から発行されたRFCは確認できませんでした。

6. よくある誤解

否定形で四つ整理します。

6-1. 「GPTBotを止めればChatGPTに引用されない」

誤りです。 GPTBotは訓練用の区分であり、回答時の参照はOAI-SearchBotやChatGPT-Userという別の区分で行われます。ChatGPT-Userには、robots.txtの規則が適用されない場合があります(§1-1)。さらに、止めていても引用が発生する観測があります(§2-3)。IRの場合は、開示に別の取得経路が存在すること(§3-1)も、説明候補の一つになります。

6-2. 「OAI-SearchBotを許可すれば引用される」

保証されません。 許可は取得を妨げないというだけで、引用されることを約束する記載は公式文書にありません。許可は必要条件になりうるとしても、十分条件ではありません。

6-3. 「robots.txtで止めれば学習されない」

言えるのは、そのクローラーによる今後の直接取得が減るというところまでです。すでに取得されたデータ、他者が収集した複製、契約に基づいて提供されたデータには及びません。robots.txtは過去に遡って何かを消す仕組みではありません。

6-4. 「robots.txtを無視したら違法」

一律には言えません。 §5-2のとおり、権利の側からの位置づけは国や地域によって違います。また§5-1のとおり、robots.txtはアクセス制御の仕組みとして設計されていません。技術的な申し入れに従わなかったことと、その行為の法的な評価は、別々の枠組みで決まります。

7. 止める前に、止めた後に、何を測るか

ここまでの整理は、判断の材料を並べたものです。しかし「止めるべきか」は、材料だけでは決まりません。自社が現在どう扱われているかを測らなければ、どちらに振っても根拠がありません。

止める判断も、通す判断も、測定の上に置く必要があります。

7-1. 止める前に測るもの

三つあります。

第一に、いま自社のIRドメインが、AIの回答の中で出典として引かれているか。 引かれているなら、止めることで何を手放しうるのかが見えてきます。引かれていない場合も、そこから言えるのは「測定した問いの範囲では、自社ドメインからの引用は観測されなかった」というところまでです。未測定の問いや、引用として表示されない利用までは、この測定からは判断できません。「引かれていないから、止めても失うものはない」とは言えません。

第二に、引かれているなら、どのエンジンで、どの問いに対してか。 提供者ごとに仕様が違う以上(§1)、結果も揃いません。決算の数字を聞かれたときと、事業内容を聞かれたときでも、引かれる先は変わります。

第三に、引かれていないなら、代わりに何が引かれているか。 ここは実務上重要です。開示ポータルなのか、報道なのか、まとめサイトなのか、競合の比較記事なのか。自社が引かれていない理由が「止めているから」とは限りません。 止めていないのに引かれていないのであれば、取得できるテキストがあるか、情報がどう構造化されているかに加えて、問いとの関連性、検索や引用候補の選ばれ方、情報の鮮度、言語など、複数の要因を切り分ける必要があります。robots.txtを書き換えるだけで変わるとは限りません。

7-2. 止めた後に測るもの

第四に、上の三つがどう変わったか。 robots.txtを変更した日を基準に置いて、前後で比べます。§1-1のとおり、反映には時間がかかる場合があります。変更した翌日に測って結論を出すのは早すぎます。変わった場合も、その変化をrobots.txtの変更だけに帰属させることはできません(§7-4)。

第五に、変わらなかった場合に何が言えるか。 ここを誤読しやすいところです。変わらなかったことは「効かなかった」を意味しません。 別の取得経路が存在すること(§3-1)は、説明候補の一つです。ほかにも、反映に時間がかかっていること、ChatGPT-Userのようにrobots.txtが適用されない場合がある取得、すでに取得済みのデータなど、いくつかの可能性があります。これらは、回答の観測だけからは区別できません。

7-3. 何を問いにするか

測るといっても、AIに「御社をどう思いますか」と聞くことではありません。IRの文脈では、投資家が実際に投げそうな問いを組みます。

表5:問いの組み方と、そこで分かること
問いの型例分かること
社名を出して聞く直近の業績、事業の構成、方針自社について語るとき、何を出典にしているか
社名を出さずに聞くその業界で注目される会社、特定の条件を満たす会社そもそも候補に挙がるか。挙がらないなら、代わりに誰が挙がるか
競合と並べて聞く同業数社の比較、指標での並び比較の文脈で、どの出典が使われるか
固有の施策名で聞く自社が公表している計画や取り組みの名称自社しか説明していない内容が、回答に反映されているか

四つ目は、クローラーの設定と直接に結びつきます。 自社しか説明していない内容について回答が出ないのであれば、そのテキストが取得されていない可能性があります。ただし、回答が出ないことから、取得されていないと断定することはできません。

逆に、自社しか説明していない内容が正しく返ってくる場合、それはその情報が何らかの形でモデルまたは検索の仕組みにとって利用可能であることを示す観測にはなります。しかし、学習済みのデータ、過去の取得、他者による転載、回答時の取得を、回答だけから区別することはできません。取得の経路や時点の特定には使えません。

問いの文面は、投資家が実際に使いそうな言い回しにしてください。社内用語や自社だけの略称で聞くと、回答が出ないのが当然になり、測定になりません。

7-4. なぜ一回では足りないか

生成AIの回答は、同じ問いを投げても毎回同じにはなりません。一度測って「引かれていた」「引かれていなかった」と記録しても、それは状態の証明になりません。

測定の条件を固定し、反復して測り、その条件を開示したうえでなければ、前後の比較が成り立ちません。固定すべき条件は、反復の回数、ログイン状態や履歴を排した状態であること、複数のエンジンにまたがること、言語、そして問いの設計です。条件を書かずに出された数字は、解釈できません。

robots.txtの変更は、いつ、何を変えたかが記録に残る操作です。測定の条件を固定すれば、変更の前後の差は観測できます。ただし、その差だけから、robots.txtの変更の因果効果を特定することはできません。 同じ期間に、モデルの更新、検索の索引の更新、報道、新しい開示などが重なりうるからです。

同時期の変化と区別するには、対照となる問い、たとえば設定を変えていないページや、別の会社についての問いを並べて測り、複数の時点で観測する必要があります。§2-2の研究が、制限を設けていない発行元との比較を含む差の差分析を用いているのも、同時期の変化を取り除くための設計です。条件を固定していなければ、そもそも変更の前後の差と測定のばらつきを区別できません。

7-5. 当社の測り方

Vaipmは、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定しています。ステートレスというのは、ログイン状態や過去のやりとりを引き継がずに測る、という意味です。同じ条件で反復することで、回答のばらつきの中から、状態として読める部分を取り出します。

本記事で挙げた回答・引用・出典構成の変化は、この形で観測できます。自社のIRドメインが出典として引かれているか、引かれていないなら代わりに何が引かれているか、そしてrobots.txtの変更の前後で何が動いたか、です。ただし、取得の経路そのものの特定や、変更との因果関係の特定は、回答の観測とは別の検証を要します。

測定の設計そのもの、つまり正解表の作り方や記録項目、指標の定義については、AI回答の照合テストの設計を扱う記事で詳しく扱っています。

8. まとめ

自社IRサイトでAIクローラーを止めるべきか。本記事の整理は次のとおりです。

一つ目。「AIを止める」という一枚岩の操作はありません。 OpenAIでは、訓練用のGPTBotと検索用のOAI-SearchBotを別々に指定できますが、利用者の操作を起点とするChatGPT-Userにはrobots.txtの規則が適用されない場合があります。GoogleのGoogle-Extendedは、Geminiの訓練と根拠付けを一つの名前で制御し、Google検索への掲載には影響しません。提供者ごとに、分け方が違います。

二つ目。研究は、それぞれ別のものを測っています。 査読を経た研究はクローラーがrobots.txtに従うかを、未査読の研究は発行元のトラフィックを、API観測はすでに現れた引用に拒否しているドメインがどれだけ含まれるかを、事業者による観測は拒否の状態と引用されやすさの相関を測りました。拒否と引用のあいだに関係は観測されていますが、効果の大きさや因果関係は研究ごとに射程が異なります。拒否していても引用が現れる例もあります。

三つ目。IRでは、提出された開示には、自社サイトとは別の取得経路が存在します。 そのため、止めても情報への到達がすべて失われるとは限りません。一方、自社サイトにしかない説明は、到達の機会そのものを失う場合があります。自社ドメインが出典として引かれる機会と、情報への到達とを、分けて確認してください。

四つ目。手段によって効き方が違います。 とくに、HTMLのmetaタグはPDFに効きません。また、Googleの文書が扱うのは検索の索引付けと表示の制御であり、AIの提供者の利用制御とは区別して読む必要があります。

五つ目。robots.txtはアクセス制御ではありません。 従う相手にだけ効く申し入れです。

そして最後に、どちらに振るとしても、測ってからにしてください。 いま引かれているのか、引かれていないなら代わりに何が引かれているのか。それを知らずに設定だけを変えると、変化が起きても起きなくても、理由を説明できません。測ったうえでも、前後の差は観測できますが、その差を変更だけに帰属させるには、対照となる問いや複数時点での観測が要ります。

なお、上場会社のIRサイトについて生成AIのクローラーをどう設定すべきかを直接示した金融当局の公式文書は、2026年9月23日時点で、SECと金融庁のウェブサイトを対象にした検索と、本記事の出典に挙げた両機関の資料を確認した範囲では、見つかりませんでした。 証券取引所とIR業界団体の公開文書は、今回は確認できていません。存在しないと断定するものではありません。確認できなかった、という記載です。

9. よくある質問

Q1. 結局、止めるべきですか、通すべきですか。

本記事は、どちらにすべきかを指示しません。判断は三つの事実によって変わります。自社のIRドメインがいまAIの回答の中で出典として引かれているか。引かれていないなら、代わりに何が引かれているか。そして、説明会資料やよくある質問のように、自社サイトにしか置いていない説明がどれだけあるか、です。提出された開示には別の取得経路がありますが、自社サイトにしかない説明は、止めれば到達の機会そのものを失う場合があります。まず測ってください(§7)。

Q2. 「AIに学習されたくない」という方針は立てられますか。

立てられます。ただし、robots.txtで実現できるのは、そのクローラーによる今後の直接取得を減らすところまでです。すでに取得されたデータ、他者が収集した複製、契約に基づいて提供されたデータには及びません。また、提供者ごとに分け方が違います。OpenAIでは訓練用のGPTBotを個別に拒否できますが、GoogleのGoogle-ExtendedはGeminiの訓練と根拠付けを一つの名前で制御します。方針を立てたら、提供者ごとの公開文書に照らして書き方を確かめてください(§1、§6-3)。

Q3. GoogleとOpenAIで設定の書き方が違うのはなぜですか。

用途の分け方が違うためです。OpenAIは訓練用のGPTBotと検索用のOAI-SearchBotを別のクローラーとして公開しており、それぞれ別に指定できます。ただし、利用者の操作を起点とするChatGPT-Userには、robots.txtの規則が適用されない場合があると説明しています。GoogleのGoogle-Extendedは実際に取得しにくる別のクローラーではなく、robots.txtの中で制御に使われる名前で、Geminiの訓練と根拠付けを一つの名前で制御します(§1)。

Q4. 決算説明資料がPDFです。何に注意すべきですか。

HTMLのmetaタグはPDFに効きません。PDF自身にはHTMLのタグが無いためです。Googleの文書は、PDFなどHTML以外のリソースの索引付けを止めるには、HTTPのレスポンスヘッダ(X-Robots-Tag)を使うよう案内しています。ただし、これはGoogle検索での索引付けと表示の制御です。AIの提供者がその指定をどう扱うかは、提供者ごとの公開文書で確かめてください。「metaタグでnoindexを入れたから大丈夫」という理解でPDFを扱うと、意図した制御が掛かりません(§4)。

Q5. robots.txtを変更したのに結果が変わりません。効いていないのですか。

そう断定できません。OpenAIの文書は、robots.txtの変更が反映されるまで24時間ほどかかりうるとしています。また、ChatGPT-Userのようにrobots.txtの規則が適用されない場合がある取得や、すでに取得済みのデータもあります。IRでは、開示に別の取得経路が存在することも説明候補の一つです。これらは回答の観測だけからは区別できないため、「効かなかった」とも「別経路で届いている」とも決めつけないでください(§1-1、§3-1、§7-2)。

Q6. 本記事の内容は法的な助言ですか。

いいえ。§5-2で触れたEUと日本の制度は、条文と公的な資料を確認できた範囲の概観です。EUでは指令(EU)2019/790の第4条が、日本では著作権法第30条の4が関係しますが、具体的な扱いは各国の法令と個別の事情によって決まります。本記事は、ほかの国や地域の扱いを扱っていません。法的な評価が必要な場合は、個別に専門家へご確認ください。

Q7. Google-Extendedを拒否すると、Google検索での掲載や順位に影響しますか。

Googleの公式文書は、Google-ExtendedはGoogle検索への掲載に影響せず、Google検索の順位付けの要素としても使われないと明記しています。Google-Extendedは実際に取得しにくる別のクローラーではなく、取得そのものは既存のGoogleのクローラーが行います。Google-Extendedが制御するのは、GeminiアプリやVertex AIのGemini APIを支えるGeminiのモデルの訓練と、GeminiアプリおよびVertex AIでの根拠付けへの利用です。したがって、Geminiアプリなどでの利用と、Google検索での掲載とは、分けて確認することになります(§1-2)。

Q8. EDGARやEDINETに開示があるなら、自社IRサイトを止めても困らないのではありませんか。

提出された開示書類については、自社サイトとは別に機械が取得できる経路が存在するため、到達がすべて失われるとは限りません。ただし、経路が存在することと、ある提供者のAIがその経路から実際に取得していることとは別の問題です。また、説明会資料、よくある質問、事業説明のページのように自社サイトにしかない説明は、止めれば到達の機会そのものを失う場合があります。開示を制度上の経路で提出することと、AIの回答の中で自社ドメインが出典として引かれることは、別の目的です。自社ドメインが出典として引かれる機会と、情報への到達とを分けて確認してください(§3)。

Q9. 止めているのに引用されることがあるのはなぜですか。

理由は、公表されている観測からは特定できません。2026年5月に公表された観測では、robots.txtを取得できた引用のうち2.1%が、回答生成側のクローラーを拒否しているドメインからのものでした。ただし観測者自身が、契約による提供、第三者の索引、過去に取得済みのデータを区別できないと述べています。また、この標本では、拒否しているサイトの引用順位が自動的に後ろへ下がる現象は確認されていません。IRでは、開示に別の取得経路が存在することも説明候補の一つですが、どの経路が使われたかは、これらの観測からは分かりません(§2-3、§3-2)。

Q10. robots.txtでPDFのURLを拒否すれば、検索結果から消えますか。

消えるとは限りません。Googleの文書は、robots.txtで拒否したページでも、他のサイトからリンクされていれば索引に載りうるとしています。その場合、説明文の無いURLが検索結果に現れることがあります。さらに、metaタグやHTTPヘッダでの索引付けの指定はクロールの際に読まれるため、robots.txtで取得を拒否したURLでは読まれず、無視されます。取得を止めることと検索結果から消すことは、同じ操作では実現しません(§4-1)。

Q11. 研究の数字は、自社にも当てはまりますか。

そのまま当てはめることはできません。四つの研究は、それぞれ別のものを測っています。査読を経た研究はクローラーがrobots.txtに従うかを、未査読の研究はニュース発行元のトラフィックを、API観測はすでに現れた引用に拒否しているドメインがどれだけ含まれるかを、事業者による観測は拒否の状態と引用されやすさの2日間の相関を測りました。いずれも対象と期間が限られており、たとえば未査読の研究の因果推定は2024年5月より前の期間に限られています。自社への影響は、自社について測る必要があります(§2)。

Q12. robots.txtを変えた前後で測れば、変更の効果が分かりますか。

測定の条件を固定すれば、変更の前後の差は観測できます。ただし、その差だけからrobots.txtの変更の因果効果を特定することはできません。同じ期間に、モデルの更新、検索の索引の更新、報道、新しい開示などが重なりうるからです。設定を変えていないページや別の会社についての問いを対照として並べて測り、複数の時点で観測して、同時期の変化と区別してください(§7-4)。

10. 出典

  1. Google Search Central「List of Google's common crawlers」(2026年7月14日更新)。Google-Extendedが別個のHTTPユーザーエージェントを持たない制御用トークンであること、GeminiアプリとVertex AIのGemini APIを支える今後のGeminiのモデルの訓練と、GeminiアプリおよびVertex AIの「Grounding with Google Search」での根拠付けへの利用を制御すること、Google検索の掲載・順位に影響しないことの記載。https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
  2. OpenAI「Bots」開発者向け文書。GPTBot・OAI-SearchBot・ChatGPT-User・OAI-AdsBotの用途区分、各設定が別に扱われること、ChatGPT-Userは利用者の操作を起点とするためrobots.txtの規則が適用されない場合があること、OAI-AdsBotがランディングページの内容を広告の表示の判断に使う場合があること、robots.txt変更の反映に要する時間、OAI-SearchBotを拒否した場合でもナビゲーション用のリンクとしては現れうる旨の記載。https://developers.openai.com/api/docs/bots
  3. RFC 9309「Robots Exclusion Protocol」(2022年9月、Standards Track)。robots.txtが有効なコンテンツ保護の代替ではない旨、およびパスの列挙が発見可能性を生む旨の記載。https://www.rfc-editor.org/rfc/rfc9309.html
  4. 米国証券取引委員会「Accessing EDGAR Data」(2024年6月26日最終確認・更新)。「Fair access」の項で、現在の上限が毎秒10リクエストであること、効率的な取得を求めること、許容される方針の範囲外の自動化ツールによるリクエストは公平なアクセスを確保するよう管理されること。利用者を名乗るヘッダの送信を求めること、data.sec.govのAPIと自動処理向けの索引、当日分の索引の更新時刻についての記載。https://www.sec.gov/search-filings/edgar-search-assistance/accessing-edgar-data
  5. Enze Liu, Elisa Luo, Shawn Shan, Geoffrey M. Voelker, Ben Y. Zhao, Stefan Savage「Somesite I Used To Crawl: Awareness, Agency and Efficacy in Protecting Content Creators From AI Crawlers」ACM Internet Measurement Conference 2025(査読済み)。2024年9月から2025年3月までの6か月間に9種類のAIクローラーが訪れ、7種類がrobots.txtに従い、1種類はrobots.txtを取得したうえで従わず、ChatGPT-Userはrobots.txtを取得しなかったこと。2023年8月から2024年10月のあいだに484サイトがGPTBotへの明示的な制限を解除したこと。Common Crawlの各スナップショットに robots.txt が存在した40,455サイトを分析対象としていること。https://arxiv.org/abs/2411.15091
  6. Hangcheng Zhao, Ron Berman「Strategic Response of News Publishers to Generative AI」(未査読の作業論文。arXiv 2512.24968v4、2026年4月15日)。主分析は新聞発行元30ドメイン、拡張分析は上位500ドメイン。対象期間は2022年11月から2024年5月。制限開始後6週間の推定値は SimilarWeb −0.074[−0.141, −0.007]、Semrush −0.069[−0.145, 0.007]、Comscore −0.065[−0.150, 0.021]。因果分析は2024年5月より前に限定されている。https://arxiv.org/abs/2512.24968
  7. OpenAttribution「Measuring content influence in AI assistants」2026年5月公表。330件の問いから24,127件の引用、6,798の固有ドメインを収集。robots.txtを取得できた22,263件の引用を分母として、学習側のクローラーを拒否するドメインからの引用が7.8%、回答生成側を拒否するドメインからが2.1%。OpenAIについてはOAI-SearchBotを拒否するドメインからが1.1%(39/3,576)。引用順位の平均は拒否側4.1、許可側4.4。提供者の公開出力を観測した確率的な監査であり、内部の取得記録ではない旨を著者が明記している。https://openattribution.org/research/measuring-content-influence-in-ai-assistants
  8. cloro「Do Sites That Block GPTBot Get Cited Less by ChatGPT?」。1,058ドメイン、robots.txtの取得成功88%、2日間の引用観測。AI可視性のツールを提供する事業者による観測。「データは因果を証明できず、クローラーを拒否するドメインは他の点でも異なりうる」と著者が明記している。https://cloro.dev/research/ai-crawler-blocks/
  9. 金融庁 企画市場局 企業開示課「EDINET API 仕様書(Version 2)」2026年6月。EDINET APIがプログラムを介して開示情報を取得するためのAPIであること、接続にはAPIキーによる認証を用い、APIキーの取得にはアカウントの作成が必要であること、書類一覧APIと書類取得APIが提供されていることの記載。https://disclosure2dl.edinet-fsa.go.jp/guide/static/disclosure/download/ESE140206.pdf
  10. 日本取引所グループ「TDnet API」。上場会社関連の有料情報の区分に置かれている。https://www.jpx.co.jp/markets/paid-info-listing/tdnet/02.html
  11. Google Search Central「Robots meta tag, data-nosnippet, and X-Robots-Tag specifications」(2026年3月24日更新)。これらの規則がGoogle検索の結果での索引付けと表示を制御するものであること、PDFなどHTML以外のリソースの索引付けを止めるにはX-Robots-Tagを使うこと、robots.txtで取得を拒否したURLでは索引付けの指定が読まれず無視されること、有効な規則の一覧の記載。https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag
  12. Google Search Central「Introduction to robots.txt」(2025年12月10日更新)。robots.txtはページをGoogleから除外する仕組みではないこと、robots.txtで拒否したページでも他のサイトからリンクされていれば索引に載りうること、その場合は説明文の無いURLが検索結果に現れうることの記載。https://developers.google.com/search/docs/crawling-indexing/robots/intro
  13. Directive (EU) 2019/790 of the European Parliament and of the Council of 17 April 2019 on copyright and related rights in the Digital Single Market(EUR-Lex)。第4条(テキスト・データマイニングのための例外又は制限)第3項の、権利者が機械可読な手段などの適切な方法で明示的に留保していない場合に例外を適用する旨の規定。https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng
  14. 著作権法(昭和45年法律第48号)第30条の4(e-Gov法令検索)。情報解析の用に供する場合など、著作物に表現された思想又は感情の享受を目的としない利用についての規定と、著作権者の利益を不当に害することとなる場合を除くただし書。https://laws.e-gov.go.jp/law/345AC0000000048
  15. 文化審議会著作権分科会法制度小委員会「AIと著作権に関する考え方について」(2024年3月15日、文化庁)。著作権者が反対の意思を示していることそれ自体によって権利制限の対象から除外されると解釈するのは困難であること、robots.txtによるアクセス制限などの技術的な措置についての整理、本文書自体は法的な拘束力を持たないことの記載。https://www.bunka.go.jp/seisaku/bunkashingikai/chosakuken/pdf/94037901_01.pdf
  16. DeviantArt Team「UPDATE All Deviations Are Opted Out of AI Datasets」(2022年11月11日)。noaiとnoimageaiを、HTMLのmetaタグとHTTPヘッダで付与する仕組みについての記載。https://www.deviantart.com/team/journal/UPDATE-All-Deviations-Are-Opted-Out-of-AI-Datasets-934500371
  17. IETF「AI Preferences(aipref)」作業部会。AIによる利用についての意向を表す語彙と、robots.txtやHTTPヘッダなどを使って意向をコンテンツに結びつける方法を検討していること。https://datatracker.ietf.org/wg/aipref/about/

本記事の出典のうち、1から9、および11から17は、2026年9月23日に一次情報で直接確認した。9は同日に仕様書のPDF本文を機械的に読み取り、記載を確認した。14は同日、e-Gov法令検索のAPIから条文を取得して確認した。10は同日、当該ページが自動的な取得に対して応答を返さなかったため、機械による直接確認ができていない。10の記載は、日本取引所グループのサイト上の区分に基づく。

Vaipmの視点

Vaipmは、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定します。名指しで聞く、名前を出さずカテゴリで聞く、競合と並べて聞く、固有の施策名で聞く、の4通りの聞き方で、自社がAIの回答の中でどう説明されているかを記録します。robots.txtを変える前に、いまの説明のされ方を確かめる材料になります。

関連する記事

部門別ユースケース

AIは自社の財務情報をどう語っているか — IRのための実態と境界

生成AIはIR部門に急速に入ったが、測っている方向は自分が使うAIに向いている。日本IR協議会 第33回調査が示すこの非対称を起点に、AIが自社の決算数値を誤る4類型、実証研究が示すことと示さないこと、HTMLとPDFの違いの限界、露出量ではなく法定開示との一致を測る考え方、訂正時の法務上の境界までを整理する。

IR情報開示フェア・ディスクロージャーAI認知管理AIPM
詳しく見る
部門別ユースケース

IRサイトのJavaScriptはAIに読まれているか|IRのためのAIO・LLMO対策[技術編]

IRサイトの情報は、AIのクローラーに届いているのでしょうか。JavaScriptで表示している部分や、外部サービスを組み込んだ箇所は取得されているのでしょうか。41日間の制御実験と大規模ログ観測をもとに、IRサイト特有の構造がAIからどう見えるのかを整理し、自社で確かめる手順とベンダーへの依頼文の型までを示します。

IRオンサイトクローラー取得可能性AIPM
詳しく見る
部門別ユースケース

IRのためのAIO・LLMO対策|開示資料の中身はAIに読み取れているか — 決算短信PDFの表・脚注・単位

決算短信のPDFをAIが取得できても、中の数字が正しく取り出せているとは限りません。Googleの現行ドキュメントが示す形式の区別、有価証券報告書のインラインXBRLと決算短信のHTML提供、表・脚注・単位が壊れる八つの箇所、ベンダーへの依頼文、そして自社の資料を特別なツールなしで点検する手順を解説します。

IR開示資料機械可読XBRLAIPM
詳しく見る