ここが本稿の中核です。特別なツールを前提にしません。閲覧ソフトのテキスト選択と、表計算ソフトがあれば足ります。
なお、生成AIに質問を投げて回答を確かめる手順は、IRサイトのJavaScriptはAIに読まれているかに置いています。本稿が扱うのは、その手前で、自社の資料そのものを開いて数える工程です。資料側の状態を先に把握しておくと、回答側で不一致が出たときに、内容の問題なのか抽出の問題なのかを切り分けられるようになります。
7-0. 測定の考え方
一度の確認で終わらせないでください。開示資料は四半期ごとに作られ、制作の担当者も組版の設定も変わりえます。ある期の資料で直したことが、次の期の資料に反映されているとは限りません。
また、AI上の認知そのものは一回の質問では測れません。同じ質問でも実行ごとに回答が揺れるため、単発の結果を恒常的な状態とみなせないからです。
Vaipmは、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定している。
これは研究から導かれた最適値ではなく、Vaipmの運用設計である。
ステートレスとは、前の会話の文脈を持ち越さない状態です。会話を続けたまま追加で尋ねると前の回答に引きずられ、そのAIが本来どう答えるかが見えなくなります。
以下の手順は、資料側(抽出できる状態にあるか)を確かめるものです。回答側と合わせて見ることで、はじめて切り分けができます。
7-1. 手順1: テキストを選択して、コピーする
最も費用がかからず、最も効きます。自社の直近の決算短信のPDFを開き、財務表をドラッグして選択してください。観察は三つに分かれます。文字が選択されないなら、選択可能なテキストを確認できません(手順2で数えます)。選択できるがコピーすると崩れるなら、テキストはあるが構造は保たれていません(手順5で確かめます)。選択でき、貼り付けても表の形が保たれるなら、閲覧ソフト上で構造が保たれている手がかりが得られます(手順6へ進みます)。
Googleが示している目安は、PDFから標準的なテキスト文書へ文字をコピーして貼り付けられるなら、その文字は索引の対象にできるはずだというものでした。これは順方向の目安です。逆に「選択できないから索引されない」とまでは述べられていません。それでも、選択できるかどうかは、自社の資料を仕分ける手がかりにはなります。
7-2. 手順2: テキスト選択できない財務表・グラフを数える
数えてください。「いくつかある」ではなく、数です。
- 直近1年分の決算短信、決算説明会資料、統合報告書を開く
- 数値が載っている表とグラフを順に見て、テキストが選択できるかを試す
- 選択できないものを、資料名とページ番号で記録する
- 合計を出す
ここが最も直しやすい箇所です。記録した一覧は、そのまま第6節の依頼文の別紙になります。実際に画像として配置されているかどうかは、その依頼のなかで制作側に確認してもらいます。手元でできるのは、選択できるかどうかの仕分けまでです。
7-3. 手順3: ページをまたぐ表を数える
同じ資料群について、表が次のページに続いている箇所を探します。見るのは2ページ目以降に項目名の列(見出し行)があるかどうかです。無い場合、その後半は数値の羅列として存在していることになります。
「またぐ表の数」と「そのうち後続ページに見出しが無いものの数」を数えてください。前者は減らせないことがありますが、後者は組版の設定で直せることが多い箇所です。
7-4. 手順4: 脚注と単位の位置を見る
脚注については、注記の記号(※1、注1など)とその注記本文が同じページにあるかを見ます。単位については、「(単位:百万円)」のような表記が表の枠の内側にあるか外側にあるかを見ます。外側にある場合、表だけを取り出したときに単位が一緒に取り出されません。
あわせて、負の値がどの記号(△、▲、括弧、マイナス記号)で表記されているかを記録しておいてください。この記号がどう解釈されるかを本稿は断定しません。次の手順で自分で確かめます。
7-5. 手順5: 表を貼り付けて、行と列が保たれるかを見る
第2節の「第二の性質」——テキストはあるが関係が失われうる——を直接確かめる手順です。
- 財務表をドラッグして選択し、コピーする
- 表計算ソフトの空のシートに貼り付ける
- 次の四点を見る
| 見る点 | 崩れている状態の例 |
| 行と列の対応 | すべてが一列に縦に並ぶ。見出しと数値の対応が失われている |
| 見出しの位置 | 結合セルの見出しが片方の列にだけ入る、または消える |
| 負の値の符号 | △や▲が文字として残り、マイナスの数値にならない |
| 数値の形式 | 桁区切りや全角文字が残り、そのままでは計算に使えない |
表計算ソフトへの貼り付けは、抽出そのものではありません。閲覧ソフトの実装に依存する挙動であり、AIの処理と同じではありません。しかし、その表が構造の情報を持っているかを手元で観察する方法にはなります。結果を「AIがこう読む」と読み替えず、「この表は構造の情報を伴わずに取り出されうる形になっている」までにとどめてください。
二段組みの本文にも同じ方法が使えます。本文をコピーして貼り付け、左右の段の文がつながっていないかを見ます。
7-6. 手順6: PDFにしかない数字を仕分ける
ここまでで資料側の状態が分かります。次に同じ事実がどこに存在するかを仕分けます。主要な事実を一覧にして、それぞれについて存在する場所に印を付けてください。
| 事実 | 決算短信PDF | TDnetのXBRL・HTML | IRサイトの本文テキスト |
| 直近通期の売上高 | — | — | — |
| 直近通期の営業利益 | — | — | — |
| 通期業績予想 | — | — | — |
| 1株当たり配当(予想・実績) | — | — | — |
| セグメント別の売上高 | — | — | — |
| 決算発表の予定日・説明会の開催実績 | — | — | — |
| 会計基準・連結の範囲 | — | — | — |
上表は記入用の型です。自社の開示内容に合わせて行を足してください。いちばん左の列にしか印が付かない行が、優先して手を入れる対象です。その事実は、PDFの抽出が失敗した場合、どこからも取れないことになります。
7-7. 手順7: 記録の型
一度きりで終わらせないために、記録の形を決めておきます。
| 項目 | 内容 |
| 確認日 | 年月日 |
| 対象資料 | 資料名と対象期 |
| テキスト選択できない表・グラフ | 件数と、資料名・ページ番号の一覧 |
| ページをまたぐ表 | 件数、うち後続ページに見出しが無いものの件数 |
| 本表と別ページにある脚注/枠外にある単位表記 | それぞれの件数と箇所 |
| 貼り付け時の崩れ | 行と列/見出し/符号/数値形式のそれぞれについて、保持・崩れ |
| PDFにしかない主要な事実 | 手順6の表で左端にしか印が付かなかった行 |
| 委託先への依頼状況 | 依頼した内容と、反映予定の期 |
四半期ごとに同じ表を埋めてください。件数が減っているかどうかが、そのまま進捗になります。
7-8. やってはいけない読み方
- 改善率を約束しない。「画像をテキストにすればAIの正答率が何パーセント上がる」と社内で説明しないでください。その因果は、本稿で確認した範囲では確認できませんでした。説明できるのは「抽出が失敗しうる箇所を、いくつ減らした」までです
- 閲覧ソフトの挙動を、AIの処理と同じものとして扱わない。また、資料が抽出できる状態にあることと、AIがその資料を参照していることも別です
- 未公表の情報でAIの誤りを訂正しない。訂正は公表済み資料の再提示に限定してください。開示ルールの境界はAIは自社の財務情報をどう語っているかが扱っています
7-9. 照合の設計へつなぐ
資料側の点検が済んだら、次は回答の内容が公表済みの資料と一致しているかを継続的に測る段階です。正解表の設計と指標の定義は、姉妹記事AI回答の照合テストをどう設計するかで扱っています。
本稿の点検結果は、その正解表に一列足す形で使えます。「その数値は、PDFの中にしか存在しないか」という列です。不一致が出たときに、内容の問題なのか、そもそも取り出せない場所に置いてあったのかを切り分けられるようになります。