4-1. 大規模な数値ハルシネーションの観測
Beyond the Reported Cutoff: Where Large Language Models Fall Short on Financial Knowledge(Shah, Ye, Jaskowski, Xu, Chava/Georgia Institute of Technology)は、COLM 2025(Conference on Language Modeling)に採択された査読付き論文である。本稿はarXiv版(arXiv:2504.00042)を参照している。
この研究は、Compustat由来の売上高データから197,011件の質問応答ペアを構築した。対象は13の取引所に上場する17,621社、期間は1980年から2022年の43年分である。プロンプトは定型で、「{企業名}の{会計年度}の売上高はいくらか」という形式である。回答から数値を抽出し、正解値との絶対誤差が10%未満なら正答、10%以上なら事実性ハルシネーション、数値回答が無い場合は無回答、と三値で判定している。
主な観測結果は次のとおりである。
- 古い年度ほど答えられない。Llama-3-70B-Chatは2017年について54.17%の企業で正確に回答したが、1995年については6.32%にとどまった。米国では1995年以降、EDGARで財務情報が公開されているにもかかわらず、である。
- 同研究では、より大きく新しい企業について、知識量が多い一方でハルシネーションも増える傾向が観測された。すなわち、時価総額が大きい企業ほど正答率が高く、同時に同じ企業について誤答も増える、という関係である。これは特定のモデル群を対象に、売上高を問う単一形式の質問で、Compustatの値を正解として測った実験の結果である。生成AI一般に成り立つ法則として読んではならない。
- 検索・機関投資家の注目度・SEC提出書類のアクセス数・提出書類の読みやすさも、正答率と関連していた。
この研究から言えないこと:査読を経ているかどうかと、結果をどこまで一般化できるかは別の問題である。留保は査読ステータスではなく、実験条件に置く必要がある。
- 売上高はCompustat由来で百万米ドルに換算されており、会計基準の差は統一されていない。したがって、この研究が測っているのは「特定の標準化データベースの値との一致」であって、各社の法定開示原文との一致ではない。
- 質問は「{企業名}の{会計年度}の売上高はいくらか」という単一形式である。IR実務で投資家が投げる多様な質問を代表するものではない。
- API実行は2025年2月に行われている。現在のモデルの性能を示す数値ではない。
- 対象は米国上場企業である。日本企業についてそのまま当てはまるとは言えない。
4-2. 企業名が入るだけで評価が変わる(日本データ)
Evaluating Company-specific Biases in Financial Sentiment Analysis using Large Language Models(Nakagawa, Hirano, Fujimoto)は、2024 IEEE International Conference on Big Data(BigData)に収録された査読付き会議論文である(pp. 6614–6623、DOI: 10.1109/BigData62323.2024.10826008)。arXivにもpreprint版(2411.00420)がある。
出典の扱い:IEEE BigData 2024 収録の査読会議論文である。ただし、方法・数値の本文確認には著者が公開するarXiv版を使用しており、IEEE収録版との逐語的・方法論的差分は本稿では独立確認していない。
この研究の方法は明快である。同じ業績記述文について、プロンプトに企業名を含めた場合と含めなかった場合で、大規模言語モデルが返すセンチメントスコアを比較し、その差を「企業固有バイアス」と定義する。差が正なら、その企業に対してモデルは好意的な方向に評価をずらしていることになる。分析には日本の財務テキストデータが用いられている。
IR実務にとっての含意は、数値の正誤とは別の層にある。同じ開示文でも、企業名が付くことで解釈が変わりうるということだ。これは「事実として誤り」とは判定しにくい領域であり、一致率という指標では捕捉できない。本記事§6および姉妹記事「AI回答の照合テストをどう設計するか」の指標設計では、この層を別立てで扱う。
この研究から言えないこと:著者は野村アセットマネジメントおよびPreferred Networksに所属する実務者・研究者である。査読付き会議論文であり、特定サービスの販売を目的とした調査ではないが、金融実務側の視点から設計された研究であることは付記しておく。また、バイアスの方向が企業特性とどう対応するかについて、モデル間で一致した結論が得られているとは言えない。「大企業は好意的に評価される」といった一般則として引用してはならない。
4-3. 「自信があるのに間違っている」
Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States(Richard Zhe Wang、2026年7月13日投稿)は、arXivのpreprintであり、本節で扱う4本のうち査読を経ていない1本である(arXiv:2607.11414、8ページ)。以下の数値は、その前提で読むこと。
この研究は、実際の提出書類から構築された2つの財務質問応答ベンチマーク、FinQAとTAT-QAを用いている。同一質問に対して8回の再サンプリングを行い、8回すべての回答が一致した状態を「高確信」と定義した。その結果、FinQAにおいて、高確信の回答のうち15〜23%が誤りだった。
対象モデルはQwen3-8B、Llama-3.1-8B、Gemma-2-9Bである。研究の主眼は、モデルの内部状態(残差ストリーム)に線形プローブを訓練することで、こうした誤りを検知できるかにある。プローブは0.68〜0.77のAUROCを保ち、トークンの対数確率やモデル自身の正誤自己申告といったベースライン(最良でも0.55〜0.63)を上回った。
IR実務にとっての含意:これは、本稿が反復計測を推奨する根拠の一つである。同じ質問を繰り返して同じ答えが返ってきても、それは正しさの証明にならない。 一貫性と正確性は別の性質である。
この研究から言えないこと:
- 対象はオープンウェイトの基盤モデルであり、公開されているAI検索製品ではない。ChatGPTやGeminiのような、ウェブ検索と組み合わされた製品の誤答率を示す数字ではない。
- FinQAとTAT-QAは、提出書類から作られたベンチマークであって、実サービスの利用実態を再現したものではない。
- 15〜23%という値は「高確信の回答のうち」の割合であり、全回答に対する誤答率ではない。
4-4. 投資家側では何が起きているか
Blankespoor, Croom, Grant「Generative AI and Investor Processing of Financial Information」は、*Journal of Accounting and Economics* 第82巻第2号(2026年11月号)に採録された査読論文である(DOI: 10.1016/j.jacceco.2026.101908)。ワシントン大学の研究チームによる。
この研究は2種類のデータを用いている。大手証券会社の生成AIチャットボットに寄せられた40万件超の投資家クエリのアーカイブ分析と、2,000人超の個人投資家に対するサーベイである。サーベイではほぼ半数が生成AIを利用していると回答した。用途は主に、金融情報の解釈と市場の動きの文脈づけであり、銘柄スクリーニングや複雑な調査の効率化にも使われている。ツールの利用期間が長くなるにつれ、用途は高レベルのスクリーニングから、個別企業ニュースの詳細な監視と解釈へ移行するという。より洗練された個人投資家ほど導入が進んでいるとも報告されている。
機関投資家側では、Brunswick 2026 US Investor Survey(2026年2月9日公表)がある。n=100、米国の機関投資家(アクティブ・エクイティ)で、半数がロングオンリー運用者、半数がヘッジファンドである。Brunswickは企業のIR・コーポレートコミュニケーションを支援する会社であり、当事者による調査である点を明記しておく。
| Brunswick 2026 US Investor Survey(n=100) | 割合 |
| 生成AIを投資リサーチ上「中程度に重要」以上と回答 | 54% |
| 新規投資候補の詳細調査でAIを主要ツールとして利用 | 42% |
| AIによって決算説明会への取り組み方が変わった | 68% |
| より多くの情報を確認でき、高付加価値業務に時間を使え、カバレッジが広がったと同意 | 84% |
| 財務モデルの更新にAIを利用 | 23% |
情報源の重要度については、経営陣との人的接触を「重要」または「非常に重要」とした回答が77%、企業開示が66%、IRとの対話が63%、企業ウェブサイト・IRページが47%、生成AIの結果が24%である。設問と尺度が異なるため単純な利用率比較はできないが、少なくともAIが一次資料や人的対話を置き換えている状況ではないと読める。
同調査は、投資家がAIの弱点も認識していると報告している。古い情報が出てくること、頻繁なハルシネーション、数値の誤り、文脈の取りこぼしが挙げられている。財務予測というもっとも慎重を要する用途では、モデル更新にAIを使うと答えたのは23%にとどまり、半数超が留保を示した。
この2調査の含意:投資家は生成AIを「一次資料の代わり」ではなく「一次資料へ至る経路」として使っている。だからこそ、AI回答の中の自社情報が誤っていることの意味は、投資判断の全体を左右することではなく、一次資料への到達が歪むことにある。
4-5. 研究群を読むときの4つの規律
本節で挙げたAI研究3本のうち、査読を経ているのは Beyond the Reported Cutoff(COLM 2025)と Evaluating Company-specific Biases(IEEE BigData 2024 収録)の2本、preprint は Confidently Wrong の1本である(投資家側の Blankespoor ほかは *Journal of Accounting and Economics* の査読論文)。ただし、査読の有無は読み分けの主軸にならない。査読済みであることは、その結果を自社に当てはめてよいことを保証しないからである。 読み分けは次の4点で行う。
- 実験条件を見る。何を正解としたか(Compustatの標準化データか、提出書類そのものか)、質問はどの形式に限定されていたか、誤りの判定しきい値はいくつか。Beyond the Reported Cutoff の10%というしきい値も、この研究が置いた定義である。
- 対象モデルを見る。オープンウェイトの基盤モデルか、ウェブ検索と統合された公開AIサービスか。基盤モデルのベンチマーク結果を、公開AIサービスの性能として引用してはならない。
- データ由来を見る。米国上場企業か日本企業か、対象期間はいつか、実行時期はいつか。API実行が2025年2月であれば、それは当時のモデルの挙動である。
- 相関を因果として読まない。「HTMLだから正確」「大企業だから誤る」という因果的な読み方は、いずれの研究も支持していない。