部門別ユースケース

IRのためのAIO・LLMO対策|開示資料の中身はAIに読み取れているか — 決算短信PDFの表・脚注・単位

2026-09-04読了目安 20分

著者: 株式会社Vaigate(AI上の認知を、複数のAIへの合計25回のステートレス計測で測定するVaipmを運営)

この記事のポイント

決算短信のPDFをAIが取得できても、中の数字が正しく取り出せているとは限りません。Googleの現行ドキュメントが示す形式の区別、有価証券報告書のインラインXBRLと決算短信のHTML提供、表・脚注・単位が壊れる八つの箇所、ベンダーへの依頼文、そして自社の資料を特別なツールなしで点検する手順を解説します。

結論サマリー

生成AIに自社の決算について尋ねたとき、数字が微妙にずれている。あるいは、決算短信に確かに書いてあるはずの数字を「確認できない」と返される。このとき多くの担当者は、まず「AIが自社の資料を見ていないのではないか」と考えます。

しかし、その手前にもう一段あります。取得できたファイルの中から、意味のある文字列と構造を取り出せているかです。ページをまたいだ表は見出しとの対応を失うことがあり、脚注は本表から切り離されることがあります。画像として貼り込まれた財務表は、別の処理をかけない限り文字として取り出せません。本稿はこの一段だけを扱います。

Googleの現行のドキュメントは、索引の対象となるファイル形式を二つに分けています。内容がそのままテキストとして置かれている形式と、人間が読める文字を取り出すために専用のパーサーを必要とする形式です。PDFは後者に分類されています。抽出という工程が挟まることが、形式の分類として明示されているわけです。

一方で、日本の開示制度は、既に機械可読な形式を持っています。有価証券報告書はインラインXBRLという形式で提出され、決算短信はTDnetでXBRLデータとHTMLデータの両方が提供されています。「開示資料はPDFしかない」というのは、多くの場合、自社のIRサイトに置いてあるファイルについての話であって、制度の側の話ではありません。

本稿の立場は次のとおりです。PDFをやめる必要はありません。中の構造を直し、主要な事実をテキストでも置く。そして、自社の資料のどこで抽出が壊れうるかを、推測ではなく自分で開いて数える。

この記事で分かること

  • 取得と抽出が別の工程であること、そしてそれがGoogleの現行ドキュメントの形式分類に現れていること
  • 開示資料のどこで抽出が壊れうるのか。日本の開示資料に固有の要因を含む八つの箇所
  • 有価証券報告書・決算短信が制度としてどこまで機械可読になっているか
  • タグ付きPDFとPDF/UAについて、規格として言えることと、言えないこと
  • 法定開示そのものを変えずに、IRサイト側でできること
  • 外部に委託している場合の、ベンダーへの依頼文の型
  • 自社の開示資料が読み取れる状態にあるかを、特別なツールなしで確かめる手順

対象読者

上場企業のIR担当者を想定しています。とくに、開示資料の制作を外部に委託している会社——印刷会社、ディスクロージャー実務の代行会社、IR支援会社に発注している会社——を中心に置いています。自分で組版を直せない立場でも動けるよう、確認の手順と依頼の形まで落とし込みます。

エンジニアであることは前提にしません。技術用語は初出で説明します。

押さえておきたい事実

  • Google Search Centralの「File types indexable by Google」(最終更新: 2026年2月3日)は、索引対象の形式を、内容がプレーンなテキストとして置かれている形式(HTML、XML等)と、人間が読める文字を取り出すために専用のパーサーを要する形式(PDF、Word、Excel等)に区別している
  • TDnetは、決算短信の目次以降のページについてHTMLデータを提供している(2024年4月1日以降に開始する四半期会計期間を含む事業年度等から適用。日本取引所グループ「XBRLデータの仕様」2026年7月1日更新)
  • EDINETのXBRL対象様式は65様式。有価証券報告書(通常方式)は提出書類本文全体が対象である(金融庁「EDINETタクソノミの概要説明」2023年12月)

1. 取得されることと、読み取られることは別である

1-1. 本稿がどこを引き受けるか

AIのクローラーが自社のIRサイトまで到達しているか、JavaScriptで表示している部分が取得されているかは、IRサイトのJavaScriptはAIに読まれているかの領分です。また、形式の違いによって引用のされ方に違いが観測されるか、その観測から何が言えないかは、親記事AIは自社の財務情報をどう語っているかが扱っています。

本稿が引き受けるのは、到達したあと、自社の資料の作りを自分で点検して直すという一段です。

1-2. 「取得」と「抽出」は違う工程である

用語を先に置きます。

取得とは、クローラーがサーバーからファイルを受け取ることです。成功したか失敗したかがサーバー側の記録に残ります。抽出とは、受け取ったファイルの中から、意味のある文字列と、その文字列同士の関係を取り出すことです。この工程は取得の記録には残りません。ファイルは確かに届いているのに、中身が取り出せていない、あるいは違う形で取り出されている——という状態が起こりえます。

この区別は抽象的な整理ではありません。Googleの現行のドキュメントが、形式の分類としてこれを示しています。

1-3. Googleの現行ドキュメントが形式をどう分けているか

Google Search Centralの「File types indexable by Google」は、索引の対象になるファイル形式を二つの群に分けています。一つは、内容がプレーンな、符号化されていないテキストとして保存されている形式です。HTML、XML、CSV、テキストファイルなどがここに入ります。もう一つは、バイナリファイル、または複雑なコンテナであって、人間が読める文字を取り出すために特定のパーサーを必要とする形式です。PDFはこちらで、Word、Excel、PowerPoint、EPUB、RTFなども同じ群に置かれています。

ここから読み取れることは限定的ですが、確かです。PDFが索引の対象であることは明記されている。同時に、そこから文字を取り出すには専用の処理が要る、という位置づけも明記されている。つまり「PDFは読まれない」は誤りですが、「PDFでもテキストと同じように読める」もこの記述からは出てきません。抽出という工程が挟まる、というところまでが書いてあることです。

PDFに特化した記述として、Googleは以前から一つの目安を示しています。PDFの文書から標準的なテキスト文書へ文字をコピーして貼り付けられるなら、その文字は索引の対象にできるはずだ、という趣旨です。文字が画像として埋め込まれている場合には、光学的文字認識の処理をかけることがあるとも述べられています。

素朴な目安ですが、実務には都合がよいものです。特別なツールを買わなくても、閲覧ソフトのテキスト選択だけで自社の資料を点検する足がかりになります。第7節はここを起点に組み立てます。

1-4. ここで書けないこと

生成AIの各サービスが、取得したPDFの中身をどう解釈し回答の生成にどう用いているかは公開されていません。AIのクローラーがPDF本文をどう扱うかを直接検証した公開実験を、本稿で確認した範囲では確認できませんでした。したがって本稿は「この形式にすればAIの正答率が何パーセント上がる」とは書きません。書けるのは抽出が失敗しうる箇所を減らすまでです。確認できなかったことの一覧は第8節に置きます。

2. 開示資料のどこで抽出が壊れうるか

ここが本稿の入口です。ただし列挙して終わりにはしません。それぞれについて何が失われうるのかを示し、第7節の確かめ方に対応づけます。直し方は第4節と第5節です。

2-1. 八つの箇所

#箇所何が失われうるか確かめ方
1画像として貼り込まれた財務表・グラフ文字データが無く、画像の中の模様として置かれている。文字にするには別の処理が要る手順1・2
2ページをまたぐ表表が分断され、後半のページに見出し行が無いと、見出しとの対応が失われうる手順3
3本表から離れた位置にある脚注指示先が別ページにあると、注記と本表の対応が失われうる手順4
4表の外に書かれた単位・通貨単位表記が表の外にあると、数値と単位の対応が失われうる手順4
5二段組み・多段組みの本文左右の段が誤った順序でつながることがある手順5
6結合セルと入れ子の見出し二段見出しで、どの数値がどの列かの対応が崩れうる手順5
7負の値の記号と全角文字(△・▲・括弧・全角数字)記号がマイナスとして解釈されないと符号が失われうる。全角数字が半角と別の文字として扱われうる。日本の開示資料に固有の要因手順4・5
8図やチャートの中に置かれた文字数値ラベルがグラフの一部として描画されていると、文字データが無い手順1・2

「確かめ方」欄の手順番号は、第7節に対応します。

2-2. この八箇所は、二つの性質に分かれる

第一の性質は、テキストがそもそも存在しないというものです。1と8がこれにあたります。画像の中の文字は、その画像に対して別の処理をかけない限り文字になりません。もとの表計算データやグラフ作成データが手元にあるなら、画像で貼るのをやめて組み直せば済みます。

第二の性質は、テキストは存在するが、関係が失われうるというものです。2から7がこれにあたります。「1,234」という文字は取り出せる。しかしそれが何の数字で、どの期のもので、単位が何で、正負がどちらかという情報が、その文字と一緒には取り出せないことがある。

この区別には実務上の意味があります。前者は「無い」ので足せば直ります。後者は「離れている」ので、近づけることで関係が失われる余地を減らせます。ただし後者は完全に無くせないこともあります。ページの物理的な制約がある以上、長い表はどこかで分断されるからです。だからこそ第5節が意味を持ちます。

2-3. 日本の開示資料に固有の要因

上記のうち、7は日本の開示実務に特有の論点です。

減少や損失を表すのに△や▲を使う慣行は、日本の財務諸表で広く定着しています。これらがマイナス記号として解釈されるかどうかは、抽出を行う側の処理に依存します。本稿は「解釈されない」とも「される」とも断定しません。確かめる方法は第7節に置きます。

単位も同様です。決算短信は百万円単位が一般的で、有価証券報告書では百万円または千円、英文資料では別の単位が使われることもあります。単位の取り違えだけで同じ数値が三桁ずれるという事態は、回答文が流暢であるほど気づきにくくなります。

なお、AIの回答に現れる財務数値の誤りを決算期・会計基準・通貨や単位・範囲の四つの型に整理する見方は、親記事AIは自社の財務情報をどう語っているかが扱っています。本稿が扱うのは、その誤りが自社の資料の作りに由来しうる箇所です。両者は対にして使えます。

3. 機械可読な開示は、既に制度として存在する

第2節を読むと、開示資料の全体が抽出しにくい塊であるかのように見えるかもしれません。しかし、実際にはそうではありません。日本の開示制度は、機械可読な形式を早い段階から制度に組み込んでいます。

ここを押さえておかないと、社内の議論が「PDFをやめるかどうか」という粗い二択になってしまいます。

3-1. 有価証券報告書はインラインXBRLで提出されている

金融商品取引法に基づく開示書類の電子開示システムであるEDINETでは、開示書類がXBRLという形式で提出されます。現在用いられているのはインラインXBRLという方式です。金融庁の説明によれば、これはXBRLで表現する要素をXHTMLファイルに直接埋め込むことができる形式で、ブラウザで表示できる一方、XBRLのデータとして取り出すこともできます。平成25年度から適用が開始されています。

対象範囲も具体的に定められています。XBRLの対象様式は65様式あり、提出書類の本文全体(および独立監査人の報告書)が対象である様式と、財務諸表本表のみが対象である様式に分かれます。有価証券報告書(通常方式・第三号様式)は本文全体が対象です。財務諸表本表は個々の勘定科目まで詳細にタグ付けされ、主要な経営指標等の推移、従業員の状況、大株主の状況、配当政策、役員の状況、監査の状況なども詳細タグ付けの範囲に指定されています。

つまり、有価証券報告書は「PDFの見た目」として存在しているのではありません。構造を持った文書として提出され、その構造ごと公開されています。

3-2. 決算短信はXBRLとHTMLの両方で提供されている

適時開示の側も同様です。日本取引所グループの「XBRLデータの仕様」(2026年7月1日更新)によれば、TDnetでは、上場会社の決算短信等——決算短信、業績予想の修正、配当予想の修正——およびコーポレート・ガバナンス報告書について、XBRLデータが提供されています。そして、本稿にとって重要なのは次の一行です。

決算短信における目次以降のページについては、HTMLデータも提供されている。

適用範囲も明記されています。2024年4月1日以降に開始する四半期会計期間を含む事業年度、中間会計期間、四半期累計期間から適用される、とされています。

なお東京証券取引所の電子開示の沿革では、2008年にXBRL化された適時開示情報の提供が本格導入され、2010年に通期財務諸表のXBRLデータ提供、2014年にインラインXBRLの導入が続いています。機械可読な開示は、生成AIが議論される前から積み上げられてきた制度です。

3-3. 何が、どの形式で存在するか

書類提供元機械可読な形式範囲
有価証券報告書(通常方式)EDINET(金融庁)インラインXBRL提出書類本文全体、および財務諸表本表と独立監査人の報告書
決算短信のサマリー・四半期財務諸表TDnet(東京証券取引所)XBRL作成要領・タクソノミ・項目リストが公開されている
決算短信の目次以降のページTDnet(東京証券取引所)HTML2024年4月1日以降に開始する四半期会計期間を含む事業年度等から適用
業績予想・配当予想の修正、CG報告書TDnet(東京証券取引所)XBRL決算短信等とあわせて提供されている
説明会資料・統合報告書・IRサイト本文各社各社の判断制度が形式を定めているものではない

3-4. ここから言ってはいけないこと

この表を見て「制度が機械可読なデータを出しているのだから、AIはそれを読んでいるはずだ」と考えたくなるかもしれません。これは結論できません。機械的に取得できることと、各AIサービスが実際にそれを参照し、優先し、正しく計算することは別の事柄です。この点は親記事AIは自社の財務情報をどう語っているかが整理しています。なお、XBRLは開示データの形式であり、ウェブページに付けるマークアップとは別のものです。後者は求人票の構造化データはAIに効くのかの領分です。

そして最も重要な区別が、次です。制度が機械可読なデータを提供していることと、自社のIRサイトに置いてあるPDFが読み取れる状態にあることは、別の事柄です。投資家がIRサイトを見に来たとき、そこにあるのは各社が作ったファイルです。統合報告書も、決算説明会資料も、事業計画の資料も、制度が形式を定めているものではありません。

本稿の残りは、この「各社の判断」の側を扱います。

4. PDF側でできること

PDFをやめる必要はありません。制度上の提出物にも、投資家が読む資料にも、PDFには固有の役割があります。本節は、PDFのまま何ができるかを扱います。

4-1. まず、画像をやめる

第2節で分けた二つの性質のうち、「テキストがそもそも存在しない」ほうから手を付けるのが順序です。

財務表を画像として貼り込むことは実務では珍しくありません。表計算ソフトで作った表を画像として書き出し、組版のソフトに配置する。レイアウトが崩れず罫線も意図どおりに出るため、制作の効率としては合理的な選択です。しかし、こうして作られた表には文字データがありません。文字にするには、光学的文字認識のような別の処理が要ります。グラフも同じで、数値ラベルが画像の一部として描かれているなら、その数値の文字データは存在しません。

直し方は単純です。もとのデータがあるなら、テキストとして組み直す。グラフそのものは画像のままでよく、同じ数値を表としても併記する対応がとれます。多くの決算説明会資料は既にこれを行っています。行っていない資料がどれかを自社で数えるのが第7節です。

4-2. タグ付きPDFとPDF/UAという規格

PDFには、見た目とは別に構造の情報を持たせる仕組みがあります。PDF Associationの説明によれば、文書のアクセシビリティは、ページの内容がどのような節、段落、リスト、表などに組織されているかという論理構造の意味情報に依存します。この意味情報を表現するPDFの機能が「タグ付きPDF」と呼ばれます。

これを規格として定めているのが、ISO 14289(PDF/UA)の系列です。現行は、ISO 32000-1:2008(PDF 1.7)に適合するファイルでのタグ付きPDFの使用を定めるISO 14289-1:2014(PDF/UA-1)と、PDF 2.0(ISO 32000-2)に対応して全面的に改訂・拡張されたISO 14289-2:2024(PDF/UA-2)です。

PDF/UAは、ISO 32000と併せて用いる補完規格として機能し、W3CのWebコンテンツ・アクセシビリティ・ガイドライン(WCAG)に適合するPDFファイルを作る手段を提供するものと位置づけられています。

本稿がここから書けるのは、次の一段までです。

見出し、段落、リスト、表といった論理構造と、ページに書き込まれた順序とは独立した読み上げ順を、文書自体が持つ形式が、規格として存在する。

4-3. 「タグ付きにすればAIが正しく読む」とは書けない

ここで線を引いておきます。

PDF/UAはアクセシビリティの規格です。支援技術を使う人が文書を読み、操作できるようにするために作られました。AIの読み取り精度を上げるための規格ではありません。そして、タグ付けがAIの読み取りに効くという実証を、本稿で確認した範囲では確認できませんでした。

なお、PDF Associationのサイトには、2026年8月13日付で「タグ付きPDFは支援技術のために作られたが、機械にも同じものが必要だった」という趣旨の論説が掲載されています。ただし三つの留保が要ります。記載された見解は著者のものでありPDF Associationの方針や立場を反映しないという免責が同記事に明記されていること。著者がPDF技術のベンダーに所属する当事者であること。統制された実験ではなく論説であること。本稿はこれを「タグ付けの効果が実証された」根拠としては用いません。

規格の側にも限界の記述があります。PDF Associationは、PDF/UAに適合すること自体は、その文書の内容がアクセシブルであることを必ずしも保証しないと明記しています。形式の適合と、内容が理解可能であることは別だという限定が、規格を作る側から示されています。

4-4. ベンダーに何を言えばよいか

以上を踏まえると、外部の制作会社に伝えられるのは資料の作りについての要望までです。一方、効果についての断定は伝えません。「そうすればAIの正答率が上がる」「タグを付ければAIが正しく読む」——いずれも本稿で確認した範囲では裏付けが確認できませんでした。依頼文の型は第6節に置きます。

5. IRサイト側でできること

PDFの中を直すことには限界があります。ページの物理的な制約がある以上、長い表はどこかで分断されます。ここで効いてくるのが、同じ事実をテキストでも置いておくという設計です。

5-1. 主要な事実を、PDFの外にも置く

主要な事実をIRサイトのテキストとしても提供する、過年度ページに年度を明示する——という一般的な方針そのものは、親記事AIは自社の財務情報をどう語っているかが扱っています。本稿が付け加えるのは、その手前の「仕分け」です。

投資家が知りたい主要な事実——直近の通期業績、業績予想、配当予想、決算発表の予定日、説明会の開催実績——のうち、PDFの中にしか存在しないものがどれかを先に確定させてください。すべてを二重に持つ必要はなく、財務諸表の全体をHTMLで作り直す必要もありません。PDFからの抽出に失敗したとき、どこからも取れなくなる事実はどれか。その一覧が、手を入れる範囲を決めます(手順6)。

版についても同じことが言えます。同じ「売上高1,000億円」でも、当初予想か、修正予想か、実績か、訂正開示後かで、投資判断上はまったく別の情報になります。この点はAIはどの版の開示を語るのかの領分ですが、その版の別が資料の中にしかないのか、ページ本文のテキストとしても読めるのかという違いは、本稿の仕分けの対象です。

5-2. 法定開示そのものは、変えない

ここに一線があります。本稿は、法定開示の記載そのものを、AIに読み取られやすい形へ変えることを推奨しません。開示書類の目的は投資家への正確な情報提供であり、機械可読性の最適化ではありません。

変える対象は、資料の作りと、IRサイト側の提供の仕方です。同じ事実を、法定開示の記載を変えずに、ページのテキストとしても置く。これは開示内容の変更ではなく、提供経路を一つ足すことです。

5-3. 隣接する二つの論点

資料の中身が取り出せても、その数値がどの会社のものとして結び付けられるかは別の問題です。商号変更や組織再編があった企業では、数値と主体の対応そのものが揺れます。この論点はAIが自社を別会社と取り違えるときの領分です。

また、「画像の中の文字はテキストではない」という指摘は、動画と音声についても同じ形で成り立ちます。この論点は決算説明会の内容はAIに届いているかが扱っています。

6. ベンダーへの依頼文の型

開示資料の制作を外部に委託している場合、ここまでの内容は依頼の形にしないと動きません。そのまま送れる文面として置きます。先に施策名を出さないでください。「AI対応をお願いします」と書くと、確認ではなく提案が返ってきます。目的は現状把握です。

【開示資料の機械可読性に関する確認のお願い】

お世話になっております。IR部門の(氏名)です。

生成AI上での当社情報の扱われ方を確認する取り組みの一環として、
当社の開示資料について、下記の点をご確認いただけますでしょうか。

■ 対象
 直近1年分の以下の資料
  ・決算短信(  期分)
  ・決算説明会資料(  期分)
  ・統合報告書(  年度版)
  ・その他(           )

■ ご確認いただきたい点

 1. 財務表・数値表、およびグラフの数値ラベルが
   画像として配置されていないか
   該当がある場合、資料名とページ、および
   テキストまたは表として併記できるかをご教示ください

 2. ページをまたぐ表について、後続ページに見出し行が置かれているか
   置かれていない箇所があれば、その一覧をご教示ください

 3. 単位・通貨の表記が、表の枠内に置かれているか
   枠外にある箇所があれば、枠内へ移せるかをご教示ください

 4. 脚注が、対応する本表と同じページに置かれているか
   別ページにある箇所があれば、その一覧をご教示ください

 5. テキスト選択で本文と表をコピーしたとき、
   表の行と列の対応が保たれる状態か
   (二段組み部分で、左右の段の文がつながらないかを含みます)

 6. 決算短信について、TDnetで提供される
   目次以降のページのHTMLデータの扱いをご教示ください

■ あわせてご相談したい点

 ・PDFの書き出し設定について、
  文書の論理構造(見出し・表・読み上げ順)を保持する形式
  (タグ付きPDF)での書き出しが可能かどうか
  ※効果を保証するものとしてではなく、
   選択肢として可能かどうかの確認です

 ・上記1から5(資料の作りに関する項目)について、
  次回制作分から反映できる範囲と、
  制作コスト・スケジュールへの影響

なお、本件は特定の施策を前提としたものではなく、
現状把握を目的としたものです。
また、開示内容そのものの変更を求めるものではありません。

末尾の二行を必ず残してください。開示内容の変更ではなく資料の作りの話である、という前提を共有しないと、法務や経理との調整が必要な話として止まることがあります。

7. 自社の開示資料が読み取れているかを確かめる

ここが本稿の中核です。特別なツールを前提にしません。閲覧ソフトのテキスト選択と、表計算ソフトがあれば足ります。

なお、生成AIに質問を投げて回答を確かめる手順は、IRサイトのJavaScriptはAIに読まれているかに置いています。本稿が扱うのは、その手前で、自社の資料そのものを開いて数える工程です。資料側の状態を先に把握しておくと、回答側で不一致が出たときに、内容の問題なのか抽出の問題なのかを切り分けられるようになります。

7-0. 測定の考え方

一度の確認で終わらせないでください。開示資料は四半期ごとに作られ、制作の担当者も組版の設定も変わりえます。ある期の資料で直したことが、次の期の資料に反映されているとは限りません。

また、AI上の認知そのものは一回の質問では測れません。同じ質問でも実行ごとに回答が揺れるため、単発の結果を恒常的な状態とみなせないからです。

Vaipmは、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定している。

これは研究から導かれた最適値ではなく、Vaipmの運用設計である。

ステートレスとは、前の会話の文脈を持ち越さない状態です。会話を続けたまま追加で尋ねると前の回答に引きずられ、そのAIが本来どう答えるかが見えなくなります。

以下の手順は、資料側(抽出できる状態にあるか)を確かめるものです。回答側と合わせて見ることで、はじめて切り分けができます。

7-1. 手順1: テキストを選択して、コピーする

最も費用がかからず、最も効きます。自社の直近の決算短信のPDFを開き、財務表をドラッグして選択してください。観察は三つに分かれます。文字が選択されないなら、選択可能なテキストを確認できません(手順2で数えます)。選択できるがコピーすると崩れるなら、テキストはあるが構造は保たれていません(手順5で確かめます)。選択でき、貼り付けても表の形が保たれるなら、閲覧ソフト上で構造が保たれている手がかりが得られます(手順6へ進みます)。

Googleが示している目安は、PDFから標準的なテキスト文書へ文字をコピーして貼り付けられるなら、その文字は索引の対象にできるはずだというものでした。これは順方向の目安です。逆に「選択できないから索引されない」とまでは述べられていません。それでも、選択できるかどうかは、自社の資料を仕分ける手がかりにはなります。

7-2. 手順2: テキスト選択できない財務表・グラフを数える

数えてください。「いくつかある」ではなく、数です。

  1. 直近1年分の決算短信、決算説明会資料、統合報告書を開く
  2. 数値が載っている表とグラフを順に見て、テキストが選択できるかを試す
  3. 選択できないものを、資料名とページ番号で記録する
  4. 合計を出す

ここが最も直しやすい箇所です。記録した一覧は、そのまま第6節の依頼文の別紙になります。実際に画像として配置されているかどうかは、その依頼のなかで制作側に確認してもらいます。手元でできるのは、選択できるかどうかの仕分けまでです。

7-3. 手順3: ページをまたぐ表を数える

同じ資料群について、表が次のページに続いている箇所を探します。見るのは2ページ目以降に項目名の列(見出し行)があるかどうかです。無い場合、その後半は数値の羅列として存在していることになります。

「またぐ表の数」と「そのうち後続ページに見出しが無いものの数」を数えてください。前者は減らせないことがありますが、後者は組版の設定で直せることが多い箇所です。

7-4. 手順4: 脚注と単位の位置を見る

脚注については、注記の記号(※1、注1など)とその注記本文が同じページにあるかを見ます。単位については、「(単位:百万円)」のような表記が表の枠の内側にあるか外側にあるかを見ます。外側にある場合、表だけを取り出したときに単位が一緒に取り出されません。

あわせて、負の値がどの記号(△、▲、括弧、マイナス記号)で表記されているかを記録しておいてください。この記号がどう解釈されるかを本稿は断定しません。次の手順で自分で確かめます。

7-5. 手順5: 表を貼り付けて、行と列が保たれるかを見る

第2節の「第二の性質」——テキストはあるが関係が失われうる——を直接確かめる手順です。

  1. 財務表をドラッグして選択し、コピーする
  2. 表計算ソフトの空のシートに貼り付ける
  3. 次の四点を見る
見る点崩れている状態の例
行と列の対応すべてが一列に縦に並ぶ。見出しと数値の対応が失われている
見出しの位置結合セルの見出しが片方の列にだけ入る、または消える
負の値の符号△や▲が文字として残り、マイナスの数値にならない
数値の形式桁区切りや全角文字が残り、そのままでは計算に使えない

表計算ソフトへの貼り付けは、抽出そのものではありません。閲覧ソフトの実装に依存する挙動であり、AIの処理と同じではありません。しかし、その表が構造の情報を持っているかを手元で観察する方法にはなります。結果を「AIがこう読む」と読み替えず、「この表は構造の情報を伴わずに取り出されうる形になっている」までにとどめてください。

二段組みの本文にも同じ方法が使えます。本文をコピーして貼り付け、左右の段の文がつながっていないかを見ます。

7-6. 手順6: PDFにしかない数字を仕分ける

ここまでで資料側の状態が分かります。次に同じ事実がどこに存在するかを仕分けます。主要な事実を一覧にして、それぞれについて存在する場所に印を付けてください。

事実決算短信PDFTDnetのXBRL・HTMLIRサイトの本文テキスト
直近通期の売上高———
直近通期の営業利益———
通期業績予想———
1株当たり配当(予想・実績)———
セグメント別の売上高———
決算発表の予定日・説明会の開催実績———
会計基準・連結の範囲———

上表は記入用の型です。自社の開示内容に合わせて行を足してください。いちばん左の列にしか印が付かない行が、優先して手を入れる対象です。その事実は、PDFの抽出が失敗した場合、どこからも取れないことになります。

7-7. 手順7: 記録の型

一度きりで終わらせないために、記録の形を決めておきます。

項目内容
確認日年月日
対象資料資料名と対象期
テキスト選択できない表・グラフ件数と、資料名・ページ番号の一覧
ページをまたぐ表件数、うち後続ページに見出しが無いものの件数
本表と別ページにある脚注/枠外にある単位表記それぞれの件数と箇所
貼り付け時の崩れ行と列/見出し/符号/数値形式のそれぞれについて、保持・崩れ
PDFにしかない主要な事実手順6の表で左端にしか印が付かなかった行
委託先への依頼状況依頼した内容と、反映予定の期

四半期ごとに同じ表を埋めてください。件数が減っているかどうかが、そのまま進捗になります。

7-8. やってはいけない読み方

  • 改善率を約束しない。「画像をテキストにすればAIの正答率が何パーセント上がる」と社内で説明しないでください。その因果は、本稿で確認した範囲では確認できませんでした。説明できるのは「抽出が失敗しうる箇所を、いくつ減らした」までです
  • 閲覧ソフトの挙動を、AIの処理と同じものとして扱わない。また、資料が抽出できる状態にあることと、AIがその資料を参照していることも別です
  • 未公表の情報でAIの誤りを訂正しない。訂正は公表済み資料の再提示に限定してください。開示ルールの境界はAIは自社の財務情報をどう語っているかが扱っています

7-9. 照合の設計へつなぐ

資料側の点検が済んだら、次は回答の内容が公表済みの資料と一致しているかを継続的に測る段階です。正解表の設計と指標の定義は、姉妹記事AI回答の照合テストをどう設計するかで扱っています。

本稿の点検結果は、その正解表に一列足す形で使えます。「その数値は、PDFの中にしか存在しないか」という列です。不一致が出たときに、内容の問題なのか、そもそも取り出せない場所に置いてあったのかを切り分けられるようになります。

8. 本稿で確認できなかったこと

確認できなかったことを明示します。以下はいずれも、本稿で確認した範囲では確認できませんでした。存在しないと断定するものではありません。

項目状況
生成AIのクローラーが、取得したPDF本文の表や注記をどこまで解釈し、回答の生成にどう用いているかを直接検証した公開実験確認できなかった
タグ付きPDF・PDF/UAへの適合が、AIの読み取りの正確さをどう変えるかを測った公開の実証確認できなかった。規格はアクセシビリティのために定められている
財務表を画像からテキストへ改めたことによるAI回答の正確さの変化、および抽出の失敗箇所を日本の開示資料で分類・集計した公開調査いずれも確認できなかった
△・▲・全角数字といった日本の開示資料に固有の表記が、抽出時にどう扱われるかを要因分離して測った公開実験確認できなかった
統合報告書のHTML版提供について、日本での提供率を示す公開統計確認できなかった。発行企業数の統計は存在するが、提供形式の内訳は確認できなかった
TDnetで提供される決算短信のHTMLデータが、生成AIの回答にどう用いられているか確認できなかった。提供されている事実までが確認できた範囲である

この空白は、自社で測るしかないことを意味します。第7節が本稿の中核である理由です。

9. FAQ

Q1. PDFはAIに読まれないのですか。

そうは言えません。Google Search Centralの現行のドキュメントは、PDFを索引の対象となる形式として明記しています。ただし同じドキュメントは、PDFを「人間が読める文字を取り出すために専用のパーサーを必要とする形式」の側に分類し、内容がそのままテキストとして置かれているHTMLやXMLと区別しています。読まれるか否かの二択ではなく、抽出という工程が挟まるという理解が正確です。なお、生成AIのクローラーがPDF本文をどう扱うかを直接検証した公開実験は、本稿で確認した範囲では確認できませんでした。

Q2. 決算短信はHTMLでも提供されていると聞きました。自社で何かする必要がありますか。

日本取引所グループの「XBRLデータの仕様」によれば、TDnetでは決算短信における目次以降のページについてHTMLデータが提供されています。2024年4月1日以降に開始する四半期会計期間を含む事業年度等から適用されています。これはTDnetが配信するデータの仕様であり、各社が任意でHTML版を作るかどうかという話ではありません。一方、自社IRサイトに置いているファイルは各社が作ったものです。制度が提供しているデータと、自社サイトのファイルは別のものである点を、社内の議論で混同しないでください。なお、形式をHTMLに改めれば回答が正しくなるとは現時点では言えません。この点は親記事「AIは自社の財務情報をどう語っているか」が扱っています。

Q3. タグ付きPDFにすれば、AIは正しく読みますか。

本稿はそう書きません。タグ付きPDFとPDF/UA(ISO 14289)はアクセシビリティの規格であり、支援技術を使う人が文書を読めるようにするために定められています。AIの読み取りに効くという実証を、本稿で確認した範囲では確認できませんでした。規格の側にも限定があり、PDF Associationは、PDF/UAへの適合それ自体が文書内容のアクセシビリティを必ずしも保証しないと明記しています。書けるのは表の構造と読み上げ順を文書自体が持つ形式が、規格として存在するまでです。

Q4. 有価証券報告書はPDFではないのですか。

EDINETに提出される有価証券報告書は、インラインXBRLという形式で提出されます。金融庁の説明によれば、これはXBRLで表現する要素をXHTMLファイルに直接埋め込む形式で、ブラウザで表示でき、同時にXBRLのデータとして取り出すこともできます。XBRLの対象様式は65様式あり、有価証券報告書(通常方式)は提出書類の本文全体が対象です。つまり構造を持った文書として提出されています。ただし、そこから「AIが正しく読んでいる」を導くことはできません。

Q5. 財務諸表の△や▲は、マイナスとして解釈されますか。

本稿は断定しません。これを要因分離して測った公開の実験を、本稿で確認した範囲では確認できませんでした。ただし自社の資料について確かめる方法はあります。財務表をコピーして表計算ソフトに貼り付け、減少や損失を示す行が負の数値として入るか、記号が文字として残るかを見てください(第7節の手順5)。観察できるのは閲覧ソフトの挙動でありAIの処理そのものではありませんが、その数値が符号の情報を伴って取り出されうる形かの手がかりにはなります。

Q6. 画像になっている財務表を直すのは、どれくらい効果がありますか。

効果の大きさを数値で示すことはできません。示せるのはそこにテキストが存在するかどうかという区別です。画像として貼り込まれた表からは、その画像に別の処理をかけない限り文字が取り出せません。他の箇所(ページをまたぐ表、脚注や単位の位置)が「テキストはあるが関係が失われうる」問題であるのに対し、画像化は「テキストが無い」問題です。この違いから、最初に手を付ける箇所として合理的だ、というところまでが本稿の主張です。

Q7. 開示資料の制作は外部に委託しています。何から頼めばよいですか。

まず現状把握を頼んでください。施策名を先に出すと、確認ではなく提案が返ってきます。第6節にそのまま送れる依頼文の型を置いています。依頼の中身は、財務表が画像になっていないか、表がページをまたいでいないか、脚注が本表と同じページにあるか、単位が表の枠内にあるか、テキスト選択で行と列が保たれるか——という資料の作りについての確認です。あわせて、次回制作分から反映できる範囲とコスト・スケジュールへの影響を聞いておくと、社内の稟議が組みやすくなります。

Q8. 法定開示の書き方を、AIに読まれやすい形に変えるべきですか。

勧めません。開示書類の目的は投資家への正確な情報提供であり、機械可読性の最適化ではありません。本稿が扱うのは記載内容ではなく資料の作りです。同じ内容を画像ではなくテキストとして組む、ページをまたぐ表で見出し行を繰り返す、単位を表の枠内に置く——これらは記載内容の変更ではありません。IRサイト側で主要な事実をテキストとしても提供することも、開示経路を一つ足すことであって開示内容を変えることではありません。

Q9. 統合報告書もHTML版を作るべきですか。

本稿は一律に推奨しません。統合報告書・アニュアルレポートのHTML版提供について、日本での提供率を示す公開統計を、本稿で確認した範囲では確認できませんでした。判断材料が足りない状態で「作るべき」とは書けません。先に測れることがあります。統合報告書の中に、他のどこにも存在しない主要な事実がいくつあるか(手順6)、そのうちテキスト選択できないものがいくつあるか(手順2)を数えることです。その結果次第で必要な範囲が決まります。

Q10. 直したかどうかを、どう社内に報告すればよいですか。

件数で報告してください。「画像になっていた財務表12件のうち9件をテキストに改めた」「ページをまたぐ表のうち、後続ページに見出しが無かった7件を修正した」という形です。これらは検証可能な事実です。一方「これによりAIの正答率が向上する」は書かないでください。因果は確認できていません。効果を報告したい場合は、資料側の件数とは別に回答側の照合結果を並べて示す形になります。その設計は姉妹記事「AI回答の照合テストをどう設計するか」で扱っています。

10. まとめ

開示資料は、届いていても読めているとは限りません。クローラーがPDFを取得したことと、その中の数字が正しく取り出せていることは別の工程です。Googleの現行のドキュメントが、索引対象の形式を「内容がそのままテキストとして置かれている形式」と「文字を取り出すために専用のパーサーを要する形式」に分けていることは、この区別が形式の分類として存在することを示しています。

一方で、日本の開示制度は既に機械可読な形式を持っています。「開示資料はPDFしかない」というのは、多くの場合、自社サイトに置いてあるファイルの話です。

本稿が示した順序は四つです。画像をやめる(そこには文字データが無い。足せば直る)。離れているものを近づける(またぐ表の見出し、本表と脚注、表と単位。近づけて、関係が失われる余地を減らす)。PDFの外にも置く(主要な事実と、その前提を、ページ本文のテキストとしても読める状態にする)。法定開示そのものは変えない(変える対象は資料の作りと、IRサイト側の提供の仕方である)。

そして、最初にやるべきことは改修ではなく点検です。テキストを選択してコピーする。テキスト選択できない表を数える。ページをまたぐ表を数える。脚注と単位の位置を見る。表を貼り付けて行と列が保たれるかを見る。PDFにしかない数字を仕分ける。この六つは、今日から始められます。

効果について書けることには限りがあります。書けるのは抽出が失敗しうる箇所を、いくつ減らしたかまでです。それでも件数は検証できます。四半期ごとに同じ表を埋め、数が減っているかを見る——これは推測ではなく観察です。

AI上の企業認知を継続的な管理対象として扱う考え方はAIPMとは何かで、IRにおける誤りの意味と全体像はAIは自社の財務情報をどう語っているかで、取得可能性の技術的な確認はIRサイトのJavaScriptはAIに読まれているかで、照合の設計はAI回答の照合テストをどう設計するかで扱っています。

免責: 本稿は開示資料の制作実務および制度の整理に関する実務情報であり、法的助言ではない。また、特定の銘柄に関する投資判断の推奨、株価予測、投資助言のいずれも行っていない。個別の法的判断は、自社の法務部門および弁護士等の専門家に相談されたい。

出典一覧

  1. Google Search Central「File types indexable by Google」— 索引対象の形式を、内容がプレーンなテキストとして保存されている形式(HTML・XML・CSV等)と、人間が読める文字を取り出すために専用のパーサーを要するバイナリ・複雑なコンテナ形式(PDF・Word・Excel・PowerPoint等)に区別している。最終更新: 2026年2月3日。本稿確認日: 2026年9月2日 https://developers.google.com/search/docs/crawling-indexing/indexable-file-types
  2. Google Search Central Blog「PDFs in Google search results」(2011年9月)— テキストで構成されたPDFの索引可能性、画像として埋め込まれた文字への光学的文字認識の適用、およびコピー&ペーストの可否を目安とする記述を含む。2011年公表のブログ記事であり、本稿は公表年を付して参照している https://developers.google.com/search/blog/2011/09/pdfs-in-google-search-results
  3. Google Search Central「AI features and your website」— AI Overviews / AI Modeに追加の技術要件は無く専用マークアップは不要であること、重要な内容をテキストで提供すること、構造化データを可視テキストと一致させること https://developers.google.com/search/docs/appearance/ai-features
  4. 日本取引所グループ「XBRLデータの仕様」(適時開示情報のXBRL化)— TDnetにおける決算短信等およびコーポレート・ガバナンス報告書のXBRLデータ提供、ならびに決算短信における目次以降のページのHTMLデータ提供(2024年4月1日以降に開始する四半期会計期間を含む事業年度、中間会計期間、四半期累計期間から適用)。ページ更新: 2026年7月1日。本稿確認日: 2026年9月2日 https://www.jpx.co.jp/equities/listing/disclosure/xbrl/03.html
  5. 日本取引所グループ「東証の電子開示の取組み」— 2008年のXBRL本格導入、2010年の通期財務諸表XBRLデータ提供開始、2014年のインラインXBRL導入等の沿革。ページ更新: 2021年12月20日 https://www.jpx.co.jp/equities/listing/disclosure/xbrl/index.html
  6. 金融庁 企画市場局 企業開示課「EDINETタクソノミの概要説明」(2023年12月)— インラインXBRL方式の定義(XBRLで表現する要素をXHTMLファイルに直接埋め込むインスタンス形式であり、ブラウザ表示とXBRLインスタンスへの変換の双方が可能であること)、平成25年度からの適用開始、XBRL対象様式65様式、提出書類本文全体が対象である様式と財務諸表本表のみが対象である様式の区別、および詳細タグ付けの範囲 https://www.fsa.go.jp/search/20231211/1b-1_GaiyoSetsumei.pdf
  7. 日本取引所グループ「XBRLのメリット」— XBRLにより財務データをシステムや表計算ソフトへ直接取り込めること等。ページ更新: 2021年10月25日 https://www.jpx.co.jp/equities/listing/disclosure/xbrl/02.html
  8. PDF Association「ISO 14289-1」— タグ付きPDFがアクセシビリティに必要な意味情報(節・段落・リスト・表等への論理構造の組織化)を表現するPDFの機能であること、ISO 14289(PDF/UA)系列の構成(ISO 14289-2:2024/ISO 14289-1:2014/ISO 14289-1:2012)、ISO 32000との補完関係、およびPDF/UAへの適合それ自体は文書内容のアクセシビリティを必ずしも保証しないという限定。本稿確認日: 2026年9月2日 https://pdfa.org/resource/iso-14289-pdfua/
  9. PDF Association「ISO 14289-2」— PDF/UA-2(ISO 14289-2:2024)がISO 32000-2(PDF 2.0)に適合するファイルでのタグ付きPDFの使用を定めること https://pdfa.org/iso-14289-2-pdfua-2/
  10. Benson Hendall「You tagged PDFs for screen readers. Turns out the machines needed it too.」PDF Association、2026年8月13日 — タグの無いPDFが見た目の記述であること、タグ付きPDFが論理構造ツリーとページ上の記述順とは独立した読み上げ順を持つことの説明を含む論説。同記事には、記載された見解は著者のものでありPDF Associationの方針や立場を反映しないという免責が明記されている。著者はPDF技術のベンダーに所属する当事者であり、統制された実験や測定データを提示した研究ではない。本稿は、タグ付けの効果が実証されたという根拠としては用いていない https://pdfa.org/you-tagged-pdfs-for-screen-readers-turns-out-the-machines-needed-it-too/
  11. 株式会社宝印刷D&IR研究所「統合報告書発行状況調査2025 最終報告」(2026年2月25日公表)— 2025年1月から12月末時点の統合報告書発行企業数1,214社(前年同時期1,150社)。提供形式(PDF版・HTML版)の内訳は本調査では確認できなかった。発行元は開示書類の制作を事業とするグループの研究機関であり、当事者による調査である https://www.dirri.co.jp/res/report/cat1/2026/post2291.html

出典確認日: 2026年9月2日(上記すべてのURLについて、本稿執筆時点で内容を確認した)

関連する記事

部門別ユースケース

AIは自社の財務情報をどう語っているか — IRのための実態と境界

生成AIはIR部門に急速に入ったが、測っている方向は自分が使うAIに向いている。日本IR協議会 第33回調査が示すこの非対称を起点に、AIが自社の決算数値を誤る4類型、実証研究が示すことと示さないこと、HTMLとPDFの違いの限界、露出量ではなく法定開示との一致を測る考え方、訂正時の法務上の境界までを整理する。

IR情報開示フェア・ディスクロージャーAI認知管理AIPM
詳しく見る
部門別ユースケース

IRサイトのJavaScriptはAIに読まれているか|IRのためのAIO・LLMO対策[技術編]

IRサイトの情報は、AIのクローラーに届いているのでしょうか。JavaScriptで表示している部分や、外部サービスを組み込んだ箇所は取得されているのでしょうか。41日間の制御実験と大規模ログ観測をもとに、IRサイト特有の構造がAIからどう見えるのかを整理し、自社で確かめる手順とベンダーへの依頼文の型までを示します。

IRオンサイトクローラー取得可能性AIPM
詳しく見る
部門別ユースケース

AI回答の照合テストをどう設計するか — 正解表・記録・KPIと、越えてはいけない線

生成AIが自社の決算数値を誤っていないかを継続的に確かめるための実務手順。正解表に持たせるべき列と許容誤差の決め方、反復・ステートレスな計測の記録項目と揃えるべき測定条件、露出量ではなく法定開示との一致率を測る指標の定義、経営層への報告の形、そして未公表の重要情報で訂正しないという境界までを実務手順として示す。

IR測定設計照合テスト効果測定AIPM
詳しく見る