部門別ユースケース

AIは自社の財務情報をどう語っているか — IRのための実態と境界

2026-08-08更新 2026-08-17読了目安 32分

著者: 株式会社Vaigate(AI上の認知を、複数のAIへの合計25回のステートレス計測で測定するVaipmを運営)

この記事のポイント

生成AIはIR部門に急速に入ったが、測っている方向は自分が使うAIに向いている。日本IR協議会 第33回調査が示すこの非対称を起点に、AIが自社の決算数値を誤る4類型、実証研究が示すことと示さないこと、HTMLとPDFの違いの限界、露出量ではなく法定開示との一致を測る考え方、訂正時の法務上の境界までを整理する。

結論サマリー

日本のIR部門は、生成AIを「自分が使う道具」として急速に導入した。日本IR協議会 第33回「IR活動の実態調査」(2026年5月14日公表)では、IR関連業務での生成AI利用について「業務で使用している」または「業務でトライアルしている」と答えた企業が、資料の要約・整理で80.5%(n=780)に達している。同時に、導入の課題として「情報の正確性に欠ける(いわゆるハルシネーション)」を挙げた企業が77.2%(n=917)で最多だった。

一方、同じ調査でIR活動の効果測定に用いる指標を尋ねた設問の選択肢は、株主構成・面談回数・時価総額・PBRといった従来指標で構成されている。調査票(202605_factfinding.pdf)のQ19-①には18の指標選択肢と「特に効果測定を行っていない」が並ぶが、本稿で確認した範囲では、AI上の自社認知に関する項目は選択肢に見当たらなかった。

つまり、「自分が使うAIの誤り」は課題として認識されたが、「投資家が見るAI回答の中の自社情報の誤り」はまだ測定対象になっていない。IRには法定開示という照合先が制度として存在するため、AI回答の誤りを評判の問題ではなく開示との矛盾として扱える。この点が、評判の評価が中心になる広報・人事の領域との相対的な違いである。

本稿は、この非対称がどこから来ているのか、生成AIは実際に何をどう間違えるのか、実証研究はどこまでを示していてどこからを示していないのか、そして企業として何をしてはいけないのかを整理する。測定を実際に設計する手順は、姉妹記事「AI回答の照合テストをどう設計するか」で扱う。

この記事で分かること

  • 日本IR協議会 第33回調査が示す、IR部門の生成AI利用と効果測定指標の非対称(母数を分けた正確な読み方)
  • IR領域でAI回答の「正誤」を判定できる理由と、そこから結論できないこと
  • 生成AIが財務数値を誤る4類型(決算期・会計基準・通貨/単位・連結範囲)と、それぞれが起きる理由
  • 実証研究が示していること/示していないこと(査読ステータスの確認、実験条件に基づく留保、ベンチマークと公開AIサービスの区別)
  • HTMLとPDFの違いについて、現時点で言えることと言えないこと
  • 何を測るべきか — 露出量ではなく一致を測るという考え方
  • 訂正時に踏み越えてはいけない、法務・開示ルール上の境界

対象読者

上場企業のIR実務担当者・IR部門長、および経営層。AI上の自社認知が現在どうなっているのかを把握したい人を想定している。測定の実装手順を探している場合は、姉妹記事「AI回答の照合テストをどう設計するか」から読むほうが早い。

1. IR部門の生成AI導入は進んだ。しかし測っている方向が逆である

1-1. 何が起きたか — 2024年調査からの跳ね上がり

日本IR協議会は2026年5月14日、第33回「IR活動の実態調査」の結果を公表した。調査対象は2026年1月時点の全上場会社4,088社、調査期間は2026年2月9日から3月25日、回答は948社(回収率23.2%)である。このうちIR活動を「実施している」と答えたのが917社(96.7%)だった。

生成AIに関する設問は、この調査で焦点の一つに置かれた。IR実施企業のうち80.3%が「1年前より利用頻度が増えた」と回答している。

具体的な業務別の使用状況は、下表のとおりである。数値は「業務で使用している」または「業務でトライアルしている」を選択した企業の割合であり、この設問の母数は n=780 である。

IR関連業務2026年(n=780)2024年
業務と関連した情報収集のための資料要約や整理80.5%13.8%
説明会やミーティングなどの議事録の作成65.8%8.1%
業務連絡(eメールなど)などの下書き65.1%8.7%
英文開示資料の作成(翻訳など)63.7%16.0%
説明会や報道用などのドキュメントの作成51.3%5.5%
投資家などからのQ&A対応37.3%3.5%
アニュアルレポートや統合報告書などの報告書の作成32.9%3.2%
業務マニュアルの作成26.5%2.5%
説明会や報道用などの画像や動画の作成19.1%1.7%

資料要約・整理は2年で66.7ポイント増えている。文章生成を中心とした業務では、生成AIはすでに例外的なツールではない。一方で画像・動画作成は19.1%にとどまり、用途による差がはっきりしている。

1-2. 課題として何が挙がったか

同じ調査で、IR関連業務への生成AI導入に向けた課題を尋ねた設問(母数 n=917、今回新設)では、次の順で回答が並んだ。

課題(n=917)割合
情報の正確性に欠ける(いわゆるハルシネーション)リスク77.2%
情報漏洩などセキュリティ面での懸念60.1%
著作権侵害や倫理的な問題(バイアス等)のリスク45.0%
従業員の活用スキル(プロンプト作成など)の不足34.8%
社内用語や業界独自の用語などに対応できないこと34.1%
専門性の高い業務を代替するには至らないこと33.3%

正確性が最大の課題である。ただし、この設問が問うているのは「自社が業務で使う生成AIの出力の正確性」である。設問文は「IR関連業務での生成AI導入に向けた課題」であり、選択肢も社内利用の文脈に置かれている。

母数の扱いに関する注意:本調査には複数の母数が混在する。全回答企業は948社、IR実施企業は917社、生成AIの業務別使用状況の設問は n=780、課題の設問は n=917 である。これらを合算したり、同一分母のように並べたりしてはならない。また「1年前より利用頻度が増えた 80.3%」と「資料要約や整理 80.5%」は別の設問であり、数値が近いため混同しやすい。

1-3. 効果測定の指標は、どこを向いているか

同じ調査で、IR実施企業に効果測定に用いる指標を尋ねた結果は次のとおりである。

効果測定に用いる指標(IR実施企業)2026年2024年
株主構成86.8%84.8%
アナリスト、投資家との面談回数の増減69.0%65.1%
説明会へのアナリスト・投資家の参加人数51.1%47.3%
時価総額47.0%39.0%
株式の売買高37.1%31.6%
PBRなど36.9%28.1%

時価総額・売買高・PBRはそれぞれ8.0ポイント、5.5ポイント、8.8ポイント増えており、株式関連指標の採用が進んでいる。結果概要によれば、上位6者以外の選択肢はいずれも30%を下回っている。

ここで確認すべきは、設問がどの選択肢を用意したかである。調査票のQ19-①は次の18指標と「特に効果測定を行っていない」を選択肢として提示している。

  1. アナリスト、投資家との面談回数の増減
  2. ターゲット投資家との面談回数
  3. アナリストレポートの数や品質
  4. アナリストカバー数
  5. 説明会へのアナリスト・投資家の参加人数
  6. 株式の売買高
  7. PBR(株価純資産倍率)など
  8. 時価総額
  9. 株主・投資家からの問い合わせ回数
  10. ウェブサイトへのアクセス数
  11. 株主構成
  12. 議決権の行使率、議案への賛成比率
  13. 報道機関の記事内容
  14. 投資家向けアンケート結果
  15. 経営トップや社内のIR活動への理解度合い
  16. ESG評価機関による評価
  17. 上記以外の第三者機関による評価結果(IR優良企業賞など)
  18. その他

本稿で確認した範囲では、この選択肢一覧に、AI上の自社認知・AI回答の正確性・生成AIからの参照に関する項目は見当たらなかった。近い性格を持つのは「報道機関の記事内容」と「ウェブサイトへのアクセス数」だが、前者は報道機関を対象とし、後者は自社サイトへの到達量を測る指標である。どちらも、AIが自社について何をどう述べているかを測るものではない。

なお、これは「日本のIR部門はAI上の自社認知を測っていない」という断定ではない。調査の選択肢に項目が無いことと、実務で測っていないことは別である。第33回調査の公表資料で確認した範囲では、効果測定指標の選択肢にAI上の認知に関する項目が見当たらない、という限定された事実である。

1-4. AIは「使うもの」の側に分類されている

この非対称は、別の設問にも表れている。IR支援会社の利用に関する設問では、今回「AIを活用した説明会・面談関連のサービス」という選択肢が新設された。現在利用中と答えた企業は5.0%、今後利用したいと答えた企業は10.0%である。ここでもAIは、自社が調達して使うサービスとして設問化されている。

同様の構図は国外にも見られる。米国のNIRI(National Investor Relations Institute)は、フロリダ大学との共同調査「2025 NIRI and University of Florida Research Survey on AI within IR」をResearchページに掲載している。公開されている説明文によれば、この調査の目的は、IR専門家が新しい技術を日々の業務に取り込むことをどう感じているかを理解することにある。調査結果の本文は会員限定であり、本稿は中身を参照していない。掲載されているという事実と、公開されている調査目的の記述のみを述べる。NIRIはまた、Policy Statementsページに「NIRI Policy Statement on Artificial Intelligence in IR」を掲載している。これも掲載の事実のみを記す。

効果測定を行っていない企業についても補足しておく。結果概要によれば、IR実施企業のうち8.9%(前回11.9%)が効果測定を行っておらず、その理由は「自社のIR活動は効果測定をする段階には至っていない」52.4%、「効果測定のための指標を特定するのが難しい」42.7%、「有効な効果測定の方法が分からない」36.6%だった。指標設計そのものが難しい、という認識が実務側にある。

この記事が扱うのは、その空白の一部である。 AI回答の中の自社情報を測る指標は、露出量ではなく一致率として設計できる。そして一致率は、IRにおいては照合先が存在するため、他の領域より定義しやすい。

2. 照合先が制度として存在する — 法定開示という参照点とその限界

2-1. 正解が機械取得可能であるということ

IR情報には、他の企業情報にはあまり見られない性質がある。何が正しいかを、企業の主観ではなく制度上の文書で決められることだ。

  • EDGAR(米国SEC)は、提出履歴とXBRL企業事実をJSON APIで提供している。10-K・10-Q・8-K・20-F・40-F・6-K等を扱い、SECは開発者向け資源として無償で公開している。
  • EDINET(金融庁)は有価証券報告書等を検索でき、API v2 が提供されている(APIキーが必要)。
  • TDnet(東京証券取引所)は適時開示をリアルタイムに公開する。公開閲覧は31日間、会社別検索は10年分である。
  • XBRLは、決算短信・業績/配当予想の修正・コーポレート・ガバナンス報告書等を機械可読形式で提供する。

つまり、AI回答の「答え合わせ」に使う正解値は、人手の記憶や社内資料ではなく、外部に固定された制度上の文書から取れる。これがIRにおける測定設計の出発点になる。

法的性格の区別:TDnetは取引所の制度であり、国の法令そのものではない。適時開示の枠組みは取引所規則に基づく。一方、有価証券報告書等の法定開示は金融商品取引法に基づく。両者を「法定開示」と一括りにすると、後述する§7の判断で誤る。

2-2. ここから結論できないこと

機械取得可能であることと、AIが実際にそれを参照していることは、まったく別の話である。

「ChatGPTは毎回EDINETを検索する」「Geminiは10-Kを最優先する」「PerplexityはTDnet公開直後に更新される」といった主張は、本稿で確認した範囲では結論できない。 各AIサービスの企業別回答の取得・順位付けの仕様は非公開であり、学習済み知識・一般ウェブ検索・提携データ・検索キャッシュ・ユーザーがアップロードした資料などを組み合わせている可能性がある。

したがって本稿の立場は次のとおりである。

法定開示という照合先は存在する。しかし、AIがそれを参照して正しい決算期・通貨・単位・会計基準で答える保証はない。だから測る。

2-3. 他の領域との相対的な違い

AI上の企業認知を扱う領域は、IRだけではない。採用(求人情報の誤り)、広報(過去の報道の残存)、法務(誤情報の訂正)でも、同じ問題が起きている。詳しくはAI上の誤情報とその対策およびAI回答の訂正はどこまで可能かを参照されたい。

IRとの相対的な違いは、正誤の判定基準を外部に置ける度合いにある。評判や印象の評価は、どこまでが誤りでどこからが解釈かの線引きが難しい。これに対して「2025年3月期の連結売上高」は、有価証券報告書と突き合わせれば一致か不一致かが決まる。この違いが、IRで一致率という指標が成立する理由である。

もちろん、IR領域にも判定が難しい部分はある。事業の見通し、経営陣の評価、競合との比較といった記述は、他の領域と同じく解釈の幅を持つ。本稿が扱うのは、判定が確定できる部分から先に測るという方針である。

3. 誤りの4類型 — 決算期・会計基準・通貨/単位・範囲

AI回答に現れる財務数値の誤りは、無秩序に散らばっているわけではない。実務上、次の4つの軸に整理できる。この4類型は本稿が実務上の便宜のために立てた整理であり、業界で確立した分類でも、標準として合意されたものでもない。 分類の目的は、検知した不一致から原因の所在をたどれるようにすることにある。

3-1. 決算期の取り違え

何が起きるか:「2025年の売上高」という質問に対して、暦年(2025年1月〜12月)、2025年3月期(2024年4月〜2025年3月)、直近12か月(LTM)、四半期実績の年率換算——のいずれかで答えが返る。どれも「2025年の売上高」と呼びうるため、回答文だけを見ると誤りに気づきにくい。

なぜ起きるか:日本企業の多くは3月決算だが、12月決算の企業も相当数ある。海外の投資家向け資料では暦年ベースの記載も併存する。学習データにも検索結果にも、複数の期間定義が同居している。

やっかいな点:期間を明示しても解消するとは限らない。後述するBeyond the Reported Cutoff(COLM 2025 採択)は、企業名・年・売上高を明示したプロンプトを用いてなお誤答を観測している。「決算期を指定すれば正しくなる」とは言えない。

3-2. 会計基準の取り違え

何が起きるか:IFRS、米国基準、日本基準のいずれで作成された数値かが混在する。営業利益に相当する概念が基準によって異なるため、「営業利益」という同じ語で異なる数値が返る。

なぜ起きるか:日本の上場企業でもIFRS任意適用は珍しくない。同一企業が過去に日本基準、現在はIFRSという場合、年度をまたぐ比較で基準が入れ替わる。外部データベンダーが独自に標準化した数値を経由すると、元の基準情報が落ちる。

実務上の帰結:AI回答の照合に用いる表(正解表。作り方は姉妹記事「AI回答の照合テストをどう設計するか」で扱う)には、「会計基準」列を必ず置く。この列が無いと、不一致を検知しても原因が特定できない。

3-3. 通貨・単位の取り違え

何が起きるか:百万円と千円、百万米ドルと十億米ドル、現地通貨建てと換算値が混ざる。桁が3桁ずれる誤りは、回答文が流暢であるほど見落とされる。

なぜ起きるか:決算短信は百万円単位、有価証券報告書は百万円または千円単位、英文資料は百万米ドル単位ということがある。為替換算のレートと基準日も、資料によって異なる。

やっかいな点:単位を統一しても解消するとは限らない。Beyond the Reported Cutoff は売上高を百万米ドルに統一したうえで、正解値との差が10%を超える回答をハルシネーションと定義し、それを実際に観測している。単位の統一は必要条件であって十分条件ではない。

3-4. 範囲の取り違え

何が起きるか:連結と単体、継続事業と全社、セグメント合計と全社合計が混同される。事業売却や組織再編を行った企業では、過年度数値が遡及修正されているかどうかで値が変わる。

なぜ起きるか:企業自身が複数の切り口で開示しているためである。決算説明資料では継続事業ベース、有価証券報告書では全社ベース、という併存は普通に起きる。

実務上の帰結:正解表には「連結/単体」と「継続事業範囲」を別の列として持つ。片方だけでは足りない。

3-5. 補足 — 書けないこと

同名・類似名企業の混同は、大規模言語モデルの既知のリスクとして一般に議論されている。ただし、IRに特化した公開の一次事例を、本稿で確認した範囲では確認できなかった。したがって本稿は、この類型の発生頻度を示す数値を提示しない。

同様に、「生成AIがA社の配当を誤答し、A社が公式に訂正した」という実名企業別の事故台帳も、本稿で確認した範囲では確認できなかった。実証されているのは、統制された実験とベンチマークの結果までである。実名の事故と実験結果を混ぜてはならない。

4. 実証研究は何を示しているか(そして何を示していないか)

4-1. 大規模な数値ハルシネーションの観測

Beyond the Reported Cutoff: Where Large Language Models Fall Short on Financial Knowledge(Shah, Ye, Jaskowski, Xu, Chava/Georgia Institute of Technology)は、COLM 2025(Conference on Language Modeling)に採択された査読付き論文である。本稿はarXiv版(arXiv:2504.00042)を参照している。

この研究は、Compustat由来の売上高データから197,011件の質問応答ペアを構築した。対象は13の取引所に上場する17,621社、期間は1980年から2022年の43年分である。プロンプトは定型で、「{企業名}の{会計年度}の売上高はいくらか」という形式である。回答から数値を抽出し、正解値との絶対誤差が10%未満なら正答、10%以上なら事実性ハルシネーション、数値回答が無い場合は無回答、と三値で判定している。

主な観測結果は次のとおりである。

  • 古い年度ほど答えられない。Llama-3-70B-Chatは2017年について54.17%の企業で正確に回答したが、1995年については6.32%にとどまった。米国では1995年以降、EDGARで財務情報が公開されているにもかかわらず、である。
  • 同研究では、より大きく新しい企業について、知識量が多い一方でハルシネーションも増える傾向が観測された。すなわち、時価総額が大きい企業ほど正答率が高く、同時に同じ企業について誤答も増える、という関係である。これは特定のモデル群を対象に、売上高を問う単一形式の質問で、Compustatの値を正解として測った実験の結果である。生成AI一般に成り立つ法則として読んではならない。
  • 検索・機関投資家の注目度・SEC提出書類のアクセス数・提出書類の読みやすさも、正答率と関連していた。

この研究から言えないこと:査読を経ているかどうかと、結果をどこまで一般化できるかは別の問題である。留保は査読ステータスではなく、実験条件に置く必要がある。

  • 売上高はCompustat由来で百万米ドルに換算されており、会計基準の差は統一されていない。したがって、この研究が測っているのは「特定の標準化データベースの値との一致」であって、各社の法定開示原文との一致ではない。
  • 質問は「{企業名}の{会計年度}の売上高はいくらか」という単一形式である。IR実務で投資家が投げる多様な質問を代表するものではない。
  • API実行は2025年2月に行われている。現在のモデルの性能を示す数値ではない。
  • 対象は米国上場企業である。日本企業についてそのまま当てはまるとは言えない。

4-2. 企業名が入るだけで評価が変わる(日本データ)

Evaluating Company-specific Biases in Financial Sentiment Analysis using Large Language Models(Nakagawa, Hirano, Fujimoto)は、2024 IEEE International Conference on Big Data(BigData)に収録された査読付き会議論文である(pp. 6614–6623、DOI: 10.1109/BigData62323.2024.10826008)。arXivにもpreprint版(2411.00420)がある。

出典の扱い:IEEE BigData 2024 収録の査読会議論文である。ただし、方法・数値の本文確認には著者が公開するarXiv版を使用しており、IEEE収録版との逐語的・方法論的差分は本稿では独立確認していない。

この研究の方法は明快である。同じ業績記述文について、プロンプトに企業名を含めた場合と含めなかった場合で、大規模言語モデルが返すセンチメントスコアを比較し、その差を「企業固有バイアス」と定義する。差が正なら、その企業に対してモデルは好意的な方向に評価をずらしていることになる。分析には日本の財務テキストデータが用いられている。

IR実務にとっての含意は、数値の正誤とは別の層にある。同じ開示文でも、企業名が付くことで解釈が変わりうるということだ。これは「事実として誤り」とは判定しにくい領域であり、一致率という指標では捕捉できない。本記事§6および姉妹記事「AI回答の照合テストをどう設計するか」の指標設計では、この層を別立てで扱う。

この研究から言えないこと:著者は野村アセットマネジメントおよびPreferred Networksに所属する実務者・研究者である。査読付き会議論文であり、特定サービスの販売を目的とした調査ではないが、金融実務側の視点から設計された研究であることは付記しておく。また、バイアスの方向が企業特性とどう対応するかについて、モデル間で一致した結論が得られているとは言えない。「大企業は好意的に評価される」といった一般則として引用してはならない。

4-3. 「自信があるのに間違っている」

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States(Richard Zhe Wang、2026年7月13日投稿)は、arXivのpreprintであり、本節で扱う4本のうち査読を経ていない1本である(arXiv:2607.11414、8ページ)。以下の数値は、その前提で読むこと。

この研究は、実際の提出書類から構築された2つの財務質問応答ベンチマーク、FinQAとTAT-QAを用いている。同一質問に対して8回の再サンプリングを行い、8回すべての回答が一致した状態を「高確信」と定義した。その結果、FinQAにおいて、高確信の回答のうち15〜23%が誤りだった。

対象モデルはQwen3-8B、Llama-3.1-8B、Gemma-2-9Bである。研究の主眼は、モデルの内部状態(残差ストリーム)に線形プローブを訓練することで、こうした誤りを検知できるかにある。プローブは0.68〜0.77のAUROCを保ち、トークンの対数確率やモデル自身の正誤自己申告といったベースライン(最良でも0.55〜0.63)を上回った。

IR実務にとっての含意:これは、本稿が反復計測を推奨する根拠の一つである。同じ質問を繰り返して同じ答えが返ってきても、それは正しさの証明にならない。 一貫性と正確性は別の性質である。

この研究から言えないこと:

  • 対象はオープンウェイトの基盤モデルであり、公開されているAI検索製品ではない。ChatGPTやGeminiのような、ウェブ検索と組み合わされた製品の誤答率を示す数字ではない。
  • FinQAとTAT-QAは、提出書類から作られたベンチマークであって、実サービスの利用実態を再現したものではない。
  • 15〜23%という値は「高確信の回答のうち」の割合であり、全回答に対する誤答率ではない。

4-4. 投資家側では何が起きているか

Blankespoor, Croom, Grant「Generative AI and Investor Processing of Financial Information」は、*Journal of Accounting and Economics* 第82巻第2号(2026年11月号)に採録された査読論文である(DOI: 10.1016/j.jacceco.2026.101908)。ワシントン大学の研究チームによる。

この研究は2種類のデータを用いている。大手証券会社の生成AIチャットボットに寄せられた40万件超の投資家クエリのアーカイブ分析と、2,000人超の個人投資家に対するサーベイである。サーベイではほぼ半数が生成AIを利用していると回答した。用途は主に、金融情報の解釈と市場の動きの文脈づけであり、銘柄スクリーニングや複雑な調査の効率化にも使われている。ツールの利用期間が長くなるにつれ、用途は高レベルのスクリーニングから、個別企業ニュースの詳細な監視と解釈へ移行するという。より洗練された個人投資家ほど導入が進んでいるとも報告されている。

機関投資家側では、Brunswick 2026 US Investor Survey(2026年2月9日公表)がある。n=100、米国の機関投資家(アクティブ・エクイティ)で、半数がロングオンリー運用者、半数がヘッジファンドである。Brunswickは企業のIR・コーポレートコミュニケーションを支援する会社であり、当事者による調査である点を明記しておく。

Brunswick 2026 US Investor Survey(n=100)割合
生成AIを投資リサーチ上「中程度に重要」以上と回答54%
新規投資候補の詳細調査でAIを主要ツールとして利用42%
AIによって決算説明会への取り組み方が変わった68%
より多くの情報を確認でき、高付加価値業務に時間を使え、カバレッジが広がったと同意84%
財務モデルの更新にAIを利用23%

情報源の重要度については、経営陣との人的接触を「重要」または「非常に重要」とした回答が77%、企業開示が66%、IRとの対話が63%、企業ウェブサイト・IRページが47%、生成AIの結果が24%である。設問と尺度が異なるため単純な利用率比較はできないが、少なくともAIが一次資料や人的対話を置き換えている状況ではないと読める。

同調査は、投資家がAIの弱点も認識していると報告している。古い情報が出てくること、頻繁なハルシネーション、数値の誤り、文脈の取りこぼしが挙げられている。財務予測というもっとも慎重を要する用途では、モデル更新にAIを使うと答えたのは23%にとどまり、半数超が留保を示した。

この2調査の含意:投資家は生成AIを「一次資料の代わり」ではなく「一次資料へ至る経路」として使っている。だからこそ、AI回答の中の自社情報が誤っていることの意味は、投資判断の全体を左右することではなく、一次資料への到達が歪むことにある。

4-5. 研究群を読むときの4つの規律

本節で挙げたAI研究3本のうち、査読を経ているのは Beyond the Reported Cutoff(COLM 2025)と Evaluating Company-specific Biases(IEEE BigData 2024 収録)の2本、preprint は Confidently Wrong の1本である(投資家側の Blankespoor ほかは *Journal of Accounting and Economics* の査読論文)。ただし、査読の有無は読み分けの主軸にならない。査読済みであることは、その結果を自社に当てはめてよいことを保証しないからである。 読み分けは次の4点で行う。

  1. 実験条件を見る。何を正解としたか(Compustatの標準化データか、提出書類そのものか)、質問はどの形式に限定されていたか、誤りの判定しきい値はいくつか。Beyond the Reported Cutoff の10%というしきい値も、この研究が置いた定義である。
  2. 対象モデルを見る。オープンウェイトの基盤モデルか、ウェブ検索と統合された公開AIサービスか。基盤モデルのベンチマーク結果を、公開AIサービスの性能として引用してはならない。
  3. データ由来を見る。米国上場企業か日本企業か、対象期間はいつか、実行時期はいつか。API実行が2025年2月であれば、それは当時のモデルの挙動である。
  4. 相関を因果として読まない。「HTMLだから正確」「大企業だから誤る」という因果的な読み方は、いずれの研究も支持していない。

5. HTMLとPDF — 何が言えて何が言えないか

5-1. GenAI as a Reader が観測したこと

GenAI as a Reader: How ChatGPT & Co. use Annual Reports は、USTP(ザンクト・ペルテン応用科学大学)、HHL Leipzig Graduate School of Management、および nexxar による共同研究である。

取り扱いの注意:本文書は査読論文ではなく実務者向けレポート(practitioner report)である(HHLのリポジトリ上の Document Type は Report)。また、nexxarはデジタルIRレポートを手がける事業者であり、当事者である。以下の数値は、独立した再現が必要な観測として読むこと。本稿は、発行者側が自ら述べる先行性や規模に関する評価を採用しない。

研究は2部構成である。

第1部:年次報告書のLLMにおける可視性

  • 欧州9か国・8業種の上場20社を対象とし、HTML形式の構造化オンライン年次報告書を持つ10社(グループA)と、主にPDFで年次報告書を公開する10社(グループB)に分けた。
  • ChatGPT(GPT-4oおよびGPT-5)に対し、2,500超の定型プロンプトを投入した。23名の学術テスターが分担し、相互検証を行っている。
  • 抽出・分類された引用は24,662件。このうち58.5%が各社の年次報告書への直接リンクだった。
  • グループA(HTML)の年次報告書コンテンツは、グループB(PDF)の3.05倍引用された。
  • 逆に、PDF中心の企業に関する回答は、外部情報源への引用が約2.7倍多かった。MarketScreener、Bloomberg、Reutersといった金融データアグリゲータが、企業自身の情報源の代替として現れている。
  • 回答の正確性については、部分標本 n=200 の分析で、グループA(HTML)が71%正答、グループB(PDF)が54%正答だった。

第2部:デジタル年次報告書のログ分析

  • DAX構成企業5社のサーバーログを、2025年8月29日から10月25日までの8週間にわたり取得した。
  • 記録された自動アクセスは4,838,833件。データクレンジング後、内容分析の対象となったのは759,226件のボットリクエストである。
  • 175を超える識別可能なボットが確認され、上位5ボットが全自動アクセスの48.8%を占めた。
  • 内訳は、ChatGPTが単独でボットトラフィックの30.3%、以下Bingbot 6.6%、Amazonbot 5.8%、Baiduspider 4.6%、Googlebot 4.6%である。
  • アクセス内容は、事業活動に関する記述が39.3%、財務報告・財務諸表が20.6%を占めた。直近の報告期間への偏りも観測されている。

5-2. ここから言ってはいけないこと

「HTML化すればAI回答は正しくなる」は、この研究からは導けない。

理由は3つある。

  1. HTML群でも29%が不正確である。正答率71%の裏側には、3割近い誤りが残っている。形式を変えても誤りは消えない。
  2. 相関に交絡が混在しうる。HTML年次報告書を用意している企業は、IR体制・更新頻度・開示品質の面でも異なる可能性がある。この研究は要因を分離した無作為化実験ではない。
  3. 対象は欧州20社である。日本企業、あるいは他の言語圏に一般化できる規模ではない。

同様に、「PDFは生成AIに読まれない」という主張も誤りである。Googleの公式ドキュメントは、テキストベースのPDFが検索インデックスに入りうることを述べている(画像ベースのPDFにはOCRが適用される場合がある)。GenAI as a Reader の研究でも、PDF年次報告書はすべての対象企業について引用されていた。引用の頻度が違うのであって、読まれるか否かの二択ではない。

さらに、ボットのユーザーエージェントは、最終的な利用や回答への採用を証明しない。ChatGPTを名乗るアクセスが30.3%を占めたという事実は、そのコンテンツが実際に回答へ反映されたことを意味しない。クロールと引用は別の工程である。

5-3. IFrame・別ドメイン・JavaScriptについて

IRサイトでは、株価情報や開示一覧をIFrameで埋め込む、IR専用に別ドメインを使う、Cookie同意画面を挟む、JavaScriptでのみコンテンツを描画する——といった構成がしばしば見られる。

これらがAI検索の回答にどう影響するかについて、IR企業群を対象に要因を分離した一次実証研究を、本稿で確認した範囲では確認できなかった。したがって本稿は「IFrameだからAIに読まれない」と断定しない。定量的な低下幅を示す数値も提示しない。

言えるのは、Googleの公式ドキュメントが述べている一般的な要件までである。

5-4. Google公式が述べていること

Google Search Centralの「AI features and your website」は、AI OverviewsおよびAI Modeについて次の趣旨を明記している(最終更新:2025年12月10日)。

  • AI Overviews / AI Modeに表示されるための追加要件や特別な最適化は必要ないと明記されている。 通常のSEOのベストプラクティスがそのまま当てはまる、としている。
  • 補足リンクとして表示される資格を得るには、ページがインデックスされ、スニペット付きで検索結果に表示されうる状態である必要がある。それ以外の技術要件は挙げられていない。
  • 重要なコンテンツはテキスト形式で提供すること。
  • 構造化データはページの可視テキストと一致させること。
  • AI向けの機械可読ファイル、AIテキストファイル、専用マークアップを新たに作る必要はないとされている。 特別なschema.org構造化データも不要である、としている。
  • AI機能経由の表示も、Search Consoleのパフォーマンスレポートの「ウェブ」検索タイプに含まれてカウントされる。

ここから導かれる実務上の結論は地味である。AI専用の施策を積むより、主要な事実がテキストとして取得可能で、過年度ページに年度が明示され、構造化データと可視テキストが一致していることのほうが効く。 llms.txt やFAQリッチリザルトを「Googleで効く施策」として位置づけるべきではない。llms.txt は Google Search が使用しておらず、可視性や順位に影響しない。FAQリッチリザルト(検索結果でのアコーディオン表示)は2026年5月7日に表示を終了し、5月8日に告知されている。AIO・GEO・LLMOといった呼称も、公式規格ではなく実務上の呼び名である。

あわせて、Googleの説明の射程を取り違えないこと。GoogleはAI Overviews/AI Mode向けの専用SEO要件や特別なマークアップは不要としている。ただし、これはAI機能に独自の検索・選択・生成処理が存在しないという意味ではない。 同じドキュメントは、AI OverviewsとAI Modeが関連する複数の検索を発行する query fan-out という手法を用いる場合があること、両者が異なるモデルと技術を用いうるため提示される回答とリンクの組み合わせは異なることを述べている。「専用の要件が無い」ことと「専用の処理が無い」ことは別である。

6. 何を測るべきか — 露出量ではなく一致を測る

6-1. 前提の確認

まず明確にしておく。AI上の露出量を「IRの正式なKPI」として推奨することは、本稿の立場ではない。

規制当局、職業団体、あるいは日本IR協議会が、AI上の企業認知を正式なIR効果測定指標として採用したという一次資料を、本稿で確認した範囲では確認できなかった。§1で見たとおり、第33回調査の効果測定設問の選択肢にも該当する項目は見当たらない。

したがって以下は、開示品質管理の内部指標(KPI/KRI)としての設計案である。取締役会に報告する正式なIR成果指標として位置づけることを推奨するものではない。

6-2. 露出量を目標にしない理由

AI上の「言及の多さ」や「肯定的な語調」を目標に据えると、2つの問題が起きる。

  1. 改善の手段が、開示品質の向上と一致しない。 露出量を増やす施策は、開示の正確性とは別の方向に働きうる。
  2. 誤った情報でも露出量は増える。 誤答が広く出回っている状態は、露出量の指標では改善に見える。

IRにおいては、§2で見たとおり照合先が制度として存在する。測るべきは、AIが自社について語る内容が、法定開示と一致しているかどうかである。

この考え方を実際の指標へ落とし込む手順——一致率の定義、分母の決め方、無回答率の併記、重大度の分け方、経営層への報告の形——は、姉妹記事AI回答の照合テストをどう設計するかで扱っている。

7. やってはいけない対応 — 法務・開示ルール上の境界

この節は、誤ると法的リスクを生む領域を扱う。本稿は法的助言ではない。個別の判断は、自社の法務部門および外部専門家に確認すること。

7-1. 未公表の重要情報でAI回答を訂正しない

AI回答が自社の業績を誤って述べているとき、正しい数値を知っている担当者が、それを訂正したくなるのは自然である。しかし、その数値が未公表の重要情報である場合、訂正してはならない。

訂正は、公表済み資料の再提示に限定する。 具体的には次のとおりである。

  • 公表済みの決算短信・有価証券報告書・適時開示資料の内容を、そのまま指し示す。
  • 未公表の数値、公表前の業績見通し、開示予定日前の情報を、いかなる形でも入力・提示しない。
  • 訂正が必要でも公表済み資料に該当箇所が無い場合は、先に適法な公表手続きを行う。

これは形式的な注意ではない。AI回答への訂正は、チャット、問い合わせフォーム、SNSでの補足投稿など、通常の開示フローの外側で行われがちである。開示フローの外で重要情報が出ることが、まさに規律の対象である。

7-2. 各制度の法的性格を取り違えない

制度・文書法的性格対象
米国 Regulation FDSECの最終規則(2000年採択)発行者による重要未公表情報の選択的開示
日本のフェア・ディスクロージャー・ルール金融商品取引法に基づく法律上の制度(2018年4月1日施行)。金融庁のガイドラインは一般的な解釈を示すもの上場会社等による重要情報の伝達
TDnetによる適時開示取引所の制度(国の法令そのものではない)投資判断に重要な情報の適時開示
ESMAのAI関連文書監督上の声明・初期ガイダンス(新たなEU法令ではない)投資サービス会社のAI利用
IOSCOのAI関連文書報告書および非拘束的な監督ツールキット(各国法への実装が必要)資本市場におけるAIの利用とリスク
金融庁 AIディスカッションペーパーディスカッションペーパー(法令でも監督指針でもない)金融分野におけるAI利用の論点整理

「規制」と一括りにしないこと。 法律・最終規則と、監督上の声明・ディスカッションペーパー・非拘束的ツールキットでは、遵守義務の性格がまったく異なる。社内資料でこれらを混同すると、対応の優先順位を誤る。

7-3. AIが未公表業績を推測しただけでは、それ自体はFD違反ではない

これは実務でしばしば誤解される点である。

第三者の生成AIが、公開情報から自社の未公表業績を推測して語ったとしても、それ自体は Regulation FD や日本のフェア・ディスクロージャー・ルールの違反にはならない。 両制度が対象とするのは、基本的に発行者側が重要な未公表情報を特定の市場関係者等へ伝達する行為である。第三者のモデルによる推測は、発行者による選択的伝達ではない。

したがって、AIが業績を推測している状態それ自体によって、企業に直ちに何らかの開示義務が生じるわけではない。問題になりうるのは、それに反応して企業側が未公表情報を出してしまう場合である。

7-4. 外部の生成AIへの入力は、別の論点である

第三者のAIが公開情報から独自に推測したこと自体は、FDルール上の伝達ではない。一方で、発行者側が未公表の重要情報をAI提供者等へ入力・提供する場合は、別の論点が発生する。

  • 情報漏えい:入力データが学習や運用に利用される可能性がある。
  • 守秘義務:取引先や従業員に関する情報を含む場合、契約上・法令上の義務に触れうる。
  • 内部統制:情報管理の統制が及ばない経路が生じる。
  • FDルール上の検討:相手方の法的地位や秘密保持義務等の事実関係によって、伝達行為としての評価が問題になり得る。

「外部のAI事業者へ未公表の重要情報を入力すれば自動的にFDルール違反になる」という理解は正確ではない。 米国のRegulation FDには対象となる受領者の限定と秘密保持義務を負う者等の除外があり、日本のフェア・ディスクロージャー・ルールにも取引関係者や守秘義務に関する要件がある。該当するかどうかは、相手方が誰で、どのような義務を負っているかという事実関係による。 いずれにせよ、情報漏えい・守秘義務・内部統制の観点からは、入力を避けることが実務上の原則である。

§1で見たとおり、第33回調査でも「情報漏洩などセキュリティ面での懸念」を60.1%(n=917)が課題として挙げている。同調査では、生成AIの使用について会社全体でガイドラインが策定されている企業が55.2%(前回32.1%)に達し、「策定されていない」は18.9%(前回53.3%)まで減った。ガイドラインの整備は急速に進んでいる。

照合テストの実務においても、この境界は守られる必要がある。 正解表に載せるのは公表済みの数値のみである。未公表の数値を「正解」として外部サービスへ投げてはならない。

7-5. AI出力を、説明の代替チャネルにしない

AI回答が自社について詳しく語っている状態を、「説明の一部が済んだ」とみなしてはならない。

  • AI出力を選択的説明の代替チャネルとして扱わない。 特定の投資家にAI回答を提示して説明に代えることは、開示の枠組みの外での情報伝達になる。
  • 法定開示の文言を、AIに好まれそうな形へ変えない。 開示書類の目的は投資家への正確な情報提供であり、機械可読性の最適化ではない。IRサイトでの補助的な提供方法(主要事実をHTMLテキストでも提示する、過年度ページに年度を明示する等)と、法定開示そのものの記載を変えることは、区別しなければならない。

7-6. 訂正制度について確認できていないこと

AI回答に誤りを見つけたとき、企業として何ができるか。

現時点で、主要なAIサービスに共通する企業向けの訂正制度や、訂正結果を保証する手続きを、本稿で確認した範囲では確認できなかった。個別サービスがフィードバック機能を提供している場合はあるが、処理期限や結果の保証を含む制度として整備されているとは言えない。

したがって、現実的な対応は次のようになる。「AI回答の訂正」は削除依頼を意味しない。開示品質管理の問題として扱う。

  1. 再現可能なプロンプトと日時を保存する。
  2. 公表済みの一次資料のどこと矛盾しているかを特定する。
  3. 自社IRサイト側の欠落・旧ページ・単位表示・法人識別(企業名の表記ゆれ、同名企業との区別)を修正する。
  4. 一定期間後に、複数のAIで再検証する。

削除を求めるのではなく、正しい情報が取得可能な状態を整え、その効果を測る。 これが本稿の推奨する対応である。口コミ操作や逆SEO的な手法、「時間が経てば消える」という前提での放置は、いずれも勧めない。

8. FAQ

Q1. なぜIR領域では、AI回答の「正誤」を判定できるのですか。

照合先が制度として存在するためです。有価証券報告書・決算短信・適時開示資料は、EDGAR・EDINET・TDnet・XBRLを通じて機械的に取得できます。「2026年3月期の連結売上高」であれば、AIの回答と公表済み資料を突き合わせれば一致か不一致かが決まります。評判や印象の評価では、どこまでが誤りでどこからが解釈かの線引きが難しいのに対し、この点が相対的な違いです。ただし、IR領域にも判定が難しい部分はあります。事業の見通し、経営陣の評価、競合との比較といった記述は、他の領域と同じく解釈の幅を持ちます。判定が確定できる部分から先に測る、というのが実務的な順序です。

Q2. IRサイトをHTML化すれば、AI回答は正しくなりますか。

現時点でそうは言えません。USTP・HHL・nexxarによる共同研究「GenAI as a Reader」では、HTML形式の年次報告書を持つ企業のほうが、PDF中心の企業よりChatGPTに3.05倍多く引用され、部分標本(n=200)での正答率も71%対54%と高い結果でした。ただしHTML群でも29%は不正確です。また対象は欧州20社で、無作為割付ではなく企業群そのものが違うため、企業規模やIR体制の違いが交絡している可能性があります。この文書は査読論文ではなく実務者向けレポートであり、デジタルIRレポート事業者であるnexxarが参加している点にも留意が必要です。独立した再現が必要な段階です。

Q3. 「PDFはAIに読まれない」というのは本当ですか。

正確ではありません。Googleの公式ドキュメントは、テキストベースのPDFが検索インデックスに入りうることを述べています(画像ベースのPDFにはOCRが適用される場合があります)。前述の研究でも、PDF形式の年次報告書はすべての対象企業について引用されていました。違いは引用の頻度であって、読まれるか否かの二択ではありません。ただし、ページをまたぐ表、脚注、二段組み、単位が本表から離れた位置にある表などは、抽出時に誤りが生じる余地があります。

Q4. AIが当社の未公表の業績を推測して語っています。これはフェア・ディスクロージャー違反ですか。

第三者の生成AIが公開情報から独自に推測して語っただけであれば、それ自体は原則として米国のRegulation FDや日本のフェア・ディスクロージャー・ルールにいう伝達にはあたりません。両制度が対象とするのは、基本的に発行者側が重要な未公表情報を特定の市場関係者等へ伝達する行為だからです。問題になりうるのは、これに反応して企業側が未公表情報を出してしまう場合です。なお、発行者側が未公表の重要情報をAI提供者等へ入力・提供する場合は別の論点となり、相手方の法的地位や秘密保持義務等の事実関係によってFDルール上の検討も必要になり得ます。本稿は法的助言ではありません。個別の判断は法務部門と外部専門家にご確認ください。

Q5. AI回答が間違っていたら、正しい数値を教えて訂正してもよいですか。

訂正する場合は、公表済み資料の再提示に限定してください。未公表の数値、公表前の業績見通し、開示予定日前の情報を、いかなる形でも提示してはなりません。公表済み資料に該当箇所が無い場合は、先に適法な公表手続きを行う必要があります。AI回答への訂正は、チャットや問い合わせフォームなど通常の開示フローの外側で行われがちであり、そこが最も注意を要する点です。

Q6. AI上の露出量を、IR活動の効果測定指標にすべきですか。

本稿はそれを推奨しません。規制当局や職業団体がAI上の企業認知を正式なIR効果測定指標として採用した一次資料を、本稿で確認した範囲では確認できませんでした。日本IR協議会 第33回調査の効果測定設問の選択肢にも、該当する項目は見当たりません。推奨するのは、開示品質管理の内部指標として、AIが自社について語る内容が法定開示と一致しているかを測ることです。露出量を目標にすると、誤った情報が広がっている状態も改善に見えてしまいます。具体的な指標の定義は、姉妹記事「AI回答の照合テストをどう設計するか」で扱っています。

Q7. 日本のIR部門は、AI上の自社認知を測っていないのですか。

そう断定することはできません。言えるのは、日本IR協議会 第33回「IR活動の実態調査」の公表資料で確認した範囲では、IR活動の効果測定に用いる指標を尋ねた設問の選択肢に、AI上の認知に関する項目が見当たらなかった、ということです。調査の選択肢に無いことと、実務で測っていないことは別です。ただし同じ調査で、IR関連業務での生成AI利用は大幅に増え(資料要約・整理で80.5%、n=780)、課題としてハルシネーションが77.2%(n=917)で最多に挙がっています。「自分が使うAIの正確性」は課題になり、「投資家が見るAI回答の正確性」はまだ設問化されていない、という非対称が見て取れます。

Q8. 誤りの類型を分けることに、どんな実務的な意味がありますか。

対処すべき箇所が特定できます。全体の一致率が80%だと分かっても、次に何をすべきかは決まりません。しかし不一致の内訳が「決算期の取り違えが6割」であれば、IRサイトの過年度ページに年度表記が無いことや、複数の期間定義が併存していることが疑われます。「通貨・単位の誤りが多い」のであれば、英文開示での単位表記を確認します。誤りの類型を、照合に使う表の列と一対一で対応させることで、検知から原因特定までが一続きになります。表の設計は姉妹記事で扱っています。

Q9. 投資家は本当にAIで企業を調べているのですか。

用途を限定して使っている、というのが調査から読み取れる姿です。ワシントン大学の研究チームによる査読論文(Journal of Accounting and Economics 2026年、第82巻第2号)は、大手証券会社の生成AIチャットボットへの40万件超のクエリと、2,000人超の個人投資家サーベイを分析し、ほぼ半数が生成AIを利用していると報告しています。用途は主に情報の解釈と文脈づけです。機関投資家側では、Brunswickの2026年調査(n=100、IR支援会社による当事者調査)で、情報源の重要度は経営陣との接触77%、企業開示66%、IRとの対話63%に対し、生成AIの結果は24%でした。AIは一次資料や人的対話を置き換えてはいません。

Q10. AIに読まれやすくするために、開示書類の書き方を変えるべきですか。

法定開示そのものの記載を、AIに好まれそうな形へ変えることは勧めません。開示書類の目的は投資家への正確な情報提供です。変えるべきはIRサイト側の提供方法です。主要な事実をテキスト形式でも提供する、過年度ページに年度を明示する、構造化データを可視テキストと一致させる——といった対応です。Googleの公式ドキュメントによれば、AI OverviewsやAI Modeに表示されるための追加要件や特別な最適化は必要なく、AI向けの機械可読ファイルや専用マークアップを新たに作る必要もないとされています。ただしこれは、AI機能に独自の処理が存在しないという意味ではありません。AIO・GEO・LLMOといった呼称が実務上の呼び名であり公式規格ではない点にもご注意ください。

Q11. 誤りの4類型は、業界で標準とされている分類ですか。

いいえ。決算期・会計基準・通貨/単位・範囲という4類型は、本稿が実務上の便宜のために立てた整理です。業界で確立した分類でも、標準として合意されたものでもありません。この整理を置いている目的は、検知した不一致から原因の所在をたどれるようにすることにあります。自社の開示内容によっては、別の軸を立てたほうが機能する場合もあります。たとえば海外売上比率が高い企業では為替換算の基準日を独立した軸にする、事業再編の多い企業では遡及修正の有無を独立した軸にする、といった調整が考えられます。

9. まとめと次のアクション

9-1. 要点

  1. IR部門の生成AI導入は進んだが、測っている方向は「自分が使うAI」に向いている。 日本IR協議会 第33回調査では、資料要約・整理での利用が80.5%(n=780)、課題としてハルシネーションが77.2%(n=917)で最多だった。一方、効果測定指標を尋ねた設問の選択肢には、本稿で確認した範囲ではAI上の認知に関する項目が見当たらなかった。
  2. IRには法定開示という照合先が制度として存在する。 EDGAR・EDINET・TDnet・XBRLから正解値を取得できる。ただし、AIが常にそれを参照しているとは、本稿で確認した範囲では結論できない。
  3. 誤りは4類型に整理できる。 決算期・会計基準・通貨/単位・範囲。ただしこれは本稿の整理であり、業界標準の分類ではない。
  4. 実証研究は査読ステータスではなく実験条件で読む。 対象企業群、質問形式、対象モデル、実行時期。査読済みであることは、その結果を自社に当てはめてよいことを保証しない。
  5. HTML化は万能ではない。 HTML群でも29%が不正確であり、無作為割付ではなく企業群そのものが違う調査である。
  6. 測るのは露出量ではなく一致である。 露出量を目標にすると、誤った情報が広がっている状態も改善に見える。
  7. 訂正は公表済み資料の再提示に限定する。 未公表の重要情報でAI回答を訂正してはならない。

9-2. 次のアクション

今週できること:主要な生成AIサービスに、自社の直近通期の売上高・営業利益・1株当たり配当を尋ねてみる。このとき、履歴を持ち越さない状態で、同じ質問を複数回投げること。 1回の回答で判断しない。

今月できること:返ってきた回答と、有価証券報告書・決算短信の該当箇所を突き合わせる。不一致があれば、それが決算期・会計基準・通貨/単位・範囲のどれに起因するかを分類する。

次の決算発表で試せること:発表当日と2週間後に同じ質問を投げ、回答の変化を記録する。開示が更新された時点から、AI回答がいつどう変わるかを観測するには、このタイミングが適している。

これらを継続的な仕組みにする手順——正解表の作り方、記録すべき項目、測定条件の揃え方、指標の定義と経営層への報告の形——は、姉妹記事「AI回答の照合テストをどう設計するか」で扱っている。

9-3. 測定を継続する体制について

ここまでの内容は、内製でも実行できる。ただし、複数のAIサービスに対して反復・ステートレスな計測を定例化し、条件を揃えて記録し続けるには、それなりの運用コストがかかる。四半期ごとの単発調査ではなく、開示のたびに追随する形にするなら、なおさらである。

Vaipmは、AI上の認知を複数のAIへの合計25回のステートレス計測によって測定している。これはAIO対策のためのツールではなく、AI上の認知を継続的に管理する(AI Perception Management)ための仕組みである。AI上の認知を測るという領域そのものについてはAIPMとは何かを、AI上の情報がどれくらいの期間残るのかについてはAIに残る情報の期間を参照されたい。誤情報の一般的な対策と訂正についてはAI上の誤情報とその対策およびAI回答の訂正はどこまで可能かで扱っている。

出典一覧

調査・統計

  1. 一般社団法人 日本IR協議会「第33回『IR活動の実態調査』結果まとまる」(2026年5月14日公表)— ニュースリリース https://www.jira.or.jp/download/survey/202605_newsrelease.pdf / 調査対象: 全上場会社4,088社、回答948社(回収率23.2%)、IR実施企業917社。生成AI使用状況設問 n=780 は同PDF 6/9ページ「グラフ 2. IR 関連業務での生成 AI の使用状況(n=780)」に、課題設問 n=917 は 7/9ページ「グラフ3. 生成AIのIR関連業務導入に向けた課題(n=917)」に記載
  1. 同「第33回『IR活動の実態調査』調査結果要約」 https://www.jira.or.jp/download/survey/202605_summary.pdf
  1. 同「IR活動の実態調査」調査票(2026年2月)— 効果測定設問(Q19-①)の選択肢を含む https://www.jira.or.jp/download/survey/202605_factfinding.pdf
  1. 同 調査・研究インデックス https://www.jira.or.jp/activity/research.html
  1. NIRI(National Investor Relations Institute)Research ページ — 「2025 NIRI and University of Florida Research Survey on AI within IR」の掲載を確認。調査結果本文は会員限定であり、本稿は内容を参照していない https://www.niri.org/publications/research/
  1. NIRI Policy Statements ページ — 「NIRI Policy Statement on Artificial Intelligence in IR」の掲載を確認。本文は会員限定であり、本稿は内容を参照していない https://www.niri.org/resources/policy-statements/
  1. Brunswick Group「Brunswick's 2026 US Investor Survey」(2026年2月9日公表)— n=100、米国機関投資家(アクティブ・エクイティ)。IR・コーポレートコミュニケーション支援会社による当事者調査 https://review.brunswickgroup.com/article/investor-survey-2026/

学術研究

  1. Agam Shah, Liqin Ye, Sebastian Jaskowski, Wei Xu, Sudheer Chava「Beyond the Reported Cutoff: Where Large Language Models Fall Short on Financial Knowledge」(Georgia Institute of Technology)— COLM 2025(Conference on Language Modeling)採択。本文はarXiv版(arXiv:2504.00042)を参照。197,011件のQAペア、17,621社、1980〜2022年、Compustat由来・百万米ドル換算。質問形式は単一。API実行は2025年2月 https://arxiv.org/html/2504.00042v2
  1. Kei Nakagawa, Masanori Hirano, Yugo Fujimoto「Evaluating Company-specific Biases in Financial Sentiment Analysis using Large Language Models」— 2024 IEEE International Conference on Big Data (BigData), pp. 6614–6623、査読付き会議論文。DOI: 10.1109/BigData62323.2024.10826008。preprint版: arXiv:2411.00420。方法・数値の本文確認には著者が公開するarXiv版を使用しており、IEEE収録版との逐語的・方法論的差分は本稿では独立確認していない。著者は野村アセットマネジメントおよびPreferred Networks所属 https://arxiv.org/abs/2411.00420
  1. Richard Zhe Wang「Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States」(2026年7月13日投稿)— arXiv preprint、8ページ。FinQAおよびTAT-QAベンチマーク。対象モデルはQwen3-8B、Llama-3.1-8B、Gemma-2-9B。基盤モデルのベンチマークであり、公開されているAI検索製品の評価ではない https://arxiv.org/abs/2607.11414
  1. Elizabeth Blankespoor, Joe Croom, Stephanie M. Grant「Generative AI and Investor Processing of Financial Information」— ***Journal of Accounting and Economics*、第82巻第2号(2026年11月号)採録の査読論文**。DOI: 10.1016/j.jacceco.2026.101908。ワシントン大学。40万件超のチャットボットクエリ、2,000人超の個人投資家サーベイ https://doi.org/10.1016/j.jacceco.2026.101908
  1. Monika Kovarova-Simecek, Henning Zülch, Leon Kirschbaum, Konstantin Klammer, Eloy Barrantes, Alexandra Horváthová, Christina Schilling「GenAI as a Reader: How ChatGPT & Co. use Annual Reports」(USTP・HHL Leipzig・nexxar)— 査読論文ではなく実務者向けレポート(practitioner report。HHLリポジトリ上の Document Type: Report)。nexxarはデジタルIRレポート事業者であり当事者である。本稿は、発行者側が自ら述べる先行性や規模に関する評価を採用していない。第1部: 欧州20社(HTML 10社/PDF 10社)、2,500超プロンプト、GPT-4o/GPT-5、24,662引用、正答率は部分標本 n=200。第2部: DAX 5社、2025年8月29日〜10月25日、4,838,833件の自動アクセス、分析対象759,226件 https://digital-investor-relations.com/_assets/downloads/DIR_GenAI-as-Reader.pdf?h=E0wP6LL9

一次・技術資料

  1. U.S. Securities and Exchange Commission「EDGAR Application Programming Interfaces」 https://www.sec.gov/search-filings/edgar-application-programming-interfaces
  1. 金融庁 EDINET https://disclosure2.edinet-fsa.go.jp/week0020.aspx
  1. 日本取引所グループ「TDnet(適時開示情報伝達システム)」— 取引所の制度であり、国の法令そのものではない。公開閲覧31日・会社別検索10年 https://www.jpx.co.jp/english/equities/listing/disclosure/tdnet/
  1. 日本取引所グループ「XBRL」 https://www.jpx.co.jp/english/equities/listing/disclosure/xbrl/03.html
  1. Google Search Central「AI features and your website」(最終更新: 2025年12月10日)— AI Overviews / AI Modeに追加の技術要件は無い、専用マークアップは不要、構造化データは可視テキストと一致させる https://developers.google.com/search/docs/appearance/ai-features
  1. Google Search Central Blog「PDFs in Google search results」— テキストベースのPDFはインデックス可能 https://developers.google.com/search/blog/2011/09/pdfs-in-google-search-results

規制・制度(法的性格を併記)

  1. U.S. SEC「Selective Disclosure and Insider Trading(Regulation FD)」— SECの最終規則(2000年採択) https://www.sec.gov/rule-release/33-7881
  1. 金融庁「フェア・ディスクロージャー・ルールに関する内閣府令等の公表について」— 日本のフェア・ディスクロージャー・ルールは金融商品取引法に基づく法律上の制度(2018年4月1日施行)。金融庁のガイドラインは一般的な解釈を示すもの https://www.fsa.go.jp/news/29/syouken/20180206.html
  1. ESMA「ESMA provides guidance to firms using artificial intelligence in investment services」— 監督上の声明・初期ガイダンス(新たなEU法令ではない) https://www.esma.europa.eu/press-news/esma-news/esma-provides-guidance-firms-using-artificial-intelligence-investment-services
  1. IOSCO「Artificial Intelligence in Capital Markets」— 報告書(直接の法的拘束力なし) https://www.iosco.org/library/pubdocs/pdf/IOSCOPD788.pdf
  1. IOSCO「AI Supervisory Toolkit」— 非拘束的な監督ツールキット(各国法への実装が必要) https://www.iosco.org/library/pubdocs/pdf/IOSCOPD823.pdf
  1. 金融庁「AIディスカッションペーパー」— ディスカッションペーパーであり、法令でも監督指針でもない https://www.fsa.go.jp/news/r7/sonota/20260303/aidp.html

免責: 本稿は開示品質管理および制度の整理に関する実務情報であり、法的助言ではない。また、特定の銘柄に関する投資判断の推奨、株価予測、投資助言のいずれも行っていない。個別の法的判断は、自社の法務部門および弁護士等の専門家に相談されたい。

関連する記事

部門別ユースケース

AI回答の照合テストをどう設計するか — 正解表・記録・KPIと、越えてはいけない線

生成AIが自社の決算数値を誤っていないかを継続的に確かめるための実務手順。正解表に持たせるべき列と許容誤差の決め方、反復・ステートレスな計測の記録項目と揃えるべき測定条件、露出量ではなく法定開示との一致率を測る指標の定義、経営層への報告の形、そして未公表の重要情報で訂正しないという境界までを実務手順として示す。

IR測定設計照合テスト効果測定AIPM
詳しく見る
部門別ユースケース

IRのためのAIO・LLMO対策|AIはどの版の開示を語るのか — 予想・実績・訂正開示の管理

AI回答の照合では、値が合っているかだけでなく、その数字が当初予想か修正予想か実績か訂正開示後かという状態を管理する必要がある。東証が業績予想や配当予想の修正を独立した適時開示の区分としている点を起点に、正解表へ状態と版の列を足す設計、一次資料が矛盾したときの優先順位、開示イベントを再計測の起点にする運用を整理する。

IR情報開示正解表版管理AIPM
詳しく見る
部門別ユースケース

決算説明会の内容はAIに届いているか|IRのためのAIO・LLMO対策[動画・書き起こし編]

決算説明会で話した内容の多くは動画とスライドの中にしかなく、質疑応答は書き起こされなければどこにも残りません。日本IR協議会の第33回調査と東証・金融庁の一次資料をもとに、話した内容とテキストの間にある欠落を棚卸しし、それがAIに届いているかを自社で確かめるための測定の手順まで、IR担当者向けに解説します。

IR決算説明会書き起こし情報開示AIPM
詳しく見る
部門別ユースケース

IRのためのAIO・LLMO対策|AIが自社を別会社と取り違えるとき — 商号変更・組織再編・識別子

AIが自社を語るとき、数字が正しいかの前に「その会社は自社か」という問いがあります。商号変更・合併・会社分割・事業譲渡・公開買付けで主体がずれる5つの場面を整理し、証券コード・ISIN・法人番号・LEIがそれぞれ何を識別しているかを付番機関の一次資料で確認したうえで、正しく特定されているかを測る手順まで解説します。

IR主体の同定識別子商号変更AIPM
詳しく見る
部門別ユースケース

IRサイトのJavaScriptはAIに読まれているか|IRのためのAIO・LLMO対策[技術編]

IRサイトの情報は、AIのクローラーに届いているのでしょうか。JavaScriptで表示している部分や、外部サービスを組み込んだ箇所は取得されているのでしょうか。41日間の制御実験と大規模ログ観測をもとに、IRサイト特有の構造がAIからどう見えるのかを整理し、自社で確かめる手順とベンダーへの依頼文の型までを示します。

IRオンサイトクローラー取得可能性AIPM
詳しく見る
部門別ユースケース

IRのためのAIO・LLMO対策|開示資料の中身はAIに読み取れているか — 決算短信PDFの表・脚注・単位

決算短信のPDFをAIが取得できても、中の数字が正しく取り出せているとは限りません。Googleの現行ドキュメントが示す形式の区別、有価証券報告書のインラインXBRLと決算短信のHTML提供、表・脚注・単位が壊れる八つの箇所、ベンダーへの依頼文、そして自社の資料を特別なツールなしで点検する手順を解説します。

IR開示資料機械可読XBRLAIPM
詳しく見る
部門別ユースケース

AIは何を見て自社を語るのか — 広報・PRのためのレピュテーション供給源

AI回答に引用として表示されるのは何か。国内広報部門の生成AI導入率は2回の調査で37.2%から77.0%へ。McKinsey分析では自社サイトはAI検索の情報源の5〜10%程度という参考値にとどまり、引用元は検索上位とも一致しません。AMECのGEO原則を含む最新の枠組みと測定の考え方を広報向けに整理します。

広報・PRAI認知管理AIPM引用元AMEC
詳しく見る
リスク・論点

AI誤情報・誤帰属対策とは|自社が誤って説明されるリスクの検知・訂正・予防

AI誤情報・誤帰属対策とは、生成AIや回答エンジンが自社を誤って説明・帰属・要約するリスクを、検知・訂正・予防の三層で継続的に管理する実務領域である。「AIに引用されない(不在)」問題とは別に、「引用はされるが内容が誤っている(誤在)」問題が存在する。AIの引用は運用の巧拙ではなく構造として不完全であり(Tow Center・ALCE・CiteFix)、引用元リンクの存在は正確性を保証しない。日本の企業担当者の87.3%は誤在を目撃し、76.7%は「測っている」と答えるが、それでも誤在は止まっていない。問題は測定の不在ではなく、測り方が状態を証明していないことである。誤在にどう向き合うかは、①法的に争えるか、②消せるか、③どう測るか——本記事はその入口であり、各問いは別稿で深掘りする。

AI誤情報誤帰属AI回答 誤情報対策生成AI 風評レピュテーションAIPMAI認知管理効果測定
詳しく見る