実務ガイド

画像検索・音声検索とAI|写真や声で問うと、AIには何が伝わるのか

2026-09-27読了目安 23分

著者: 株式会社Vaigate(AI上の認知を、複数のAIへの合計25回のステートレス計測で測定するVaipmを運営)

この記事のポイント

写真や声で問うと、AIには何が伝わるのか。Googleレンズ、かこって検索、AI Modeの数字を母数とともに整理し、画像が対象を、言葉が条件を運ぶという見方を本記事の分析として示します。音声の数字の読み違いと反証、Googleの画像のガイダンスに書かれた用意、Search Consoleでの測り方まで解説します。

結論サマリー

写真や声で問う検索は、規模のある数字が公表されている入力の形です。 Googleは、Google レンズ(以下、Lens)での画像による検索が2024年10月の時点で月に200億回近くあったと書き、2025年4月の社内データとして月250億回を超える問いがあったとしています。かこって検索(Circle to Search)は、2026年2月の時点で5億8,000万台を超えるAndroid端末で使えるとされています。

ただし、数字ごとに母数が違います。 「AI Modeの問いの6件に1件近くが音声か画像」という数字はAI Modeの中の話で、Google検索全体の内訳ではありません。Siriの「1日15億回」は音声のリクエストの回数で、検索の回数ではありません。

写真で問うと何が伝わるかについて、Googleは仕組みの一部を説明しています。 AI Modeでは、Lensが画像の中の物体を一つずつ識別し、画像全体とそれぞれの物体について複数の問いが発行されます。Lensは、写真の物体を他の画像と比べ、画像が載っているページの言葉やメタデータを使うこともあります。

本記事は、写真と言葉を一緒に使う問いを、「画像が対象を運び、言葉が条件を運ぶ」と整理して読みます。 これは本記事の整理であって、Googleの定義ではありません。

声については、言えることが少なくなります。 声で問うと問いが長く自然な文になりやすいという研究はありますが、同じ研究は、長くなっても検索の成果は有意には上がらなかったと報告しています。Googleが音声だけの割合を示したのは、本記事の調査範囲では2016年(米国のモバイルのアプリの問いについての割合)が最後でした。

企業が用意しておくものとして本記事が書くのは、Googleの画像のガイダンスに書かれていることだけです。 Googleは、画像と動画のSEOのガイダンスに従っていれば、生成AIの検索への最適化もすでにできていると書いています。声で問われることに向けた一般企業向けのガイダンスは、本記事の調査範囲では見つかりませんでした。

この記事で分かること

  • Lens、かこって検索、AI Modeについて公表されている数字と、それぞれの母数
  • 写真で問うとき、GoogleのAI ModeとLensが画像をどう扱うと説明しているか
  • 写真と言葉を一緒に使う問いで、何が何を運ぶのか(本記事の整理)
  • 声で問うことについて、数字と研究から言えることと言えないこと
  • 「音声検索が半分になる」という予測の出所と、確かめられない理由
  • Googleの画像のガイダンスに書かれている、企業の側で用意できること
  • 画像を使った検索での表示を、Search Consoleで見られるようになったこと。そこで見えないもの

対象読者

EC、ブランド、マーケティングの実務担当者。自社の商品や店舗が、写真や声で問われたときにAIの回答の中でどう扱われるかを、伝聞ではなく一次の資料で把握したい方を想定しています。

最初に置く数字

Googleは2026年2月4日の決算説明で、AI Modeの問いの6件に1件近くが、音声か画像を使った文字以外の入力だと述べました。 同じ説明で、かこって検索が5億8,000万台を超えるAndroid端末で使えるとしています。

一方で、米国のウェブブラウザのパネルでは、2026年1〜4月のGoogle検索のうちAI Modeに到達したのは0.34%でした(SparkToro、ベンダーによる分析)。このパネルはGoogleのモバイルアプリを含みません。二つの数字は母数が違うため、掛け合わせることはできません(§5)。

1. 本記事が扱う範囲 — 「画像を探す」と「画像で問う」

1-1. 「画像検索」という言葉は二つのことを指す

最初に、言葉を分けます。「画像検索」と言うとき、二つの違う行動が混ざります。

一つは、言葉で検索して、結果の画像を見る行動です。もう一つは、写真や画面の一部を入力にして問う行動です。本記事が主に扱うのは後者です。

この区別は、実際の利用の数字にも表れています。SEO支援会社の株式会社PLAN-Bが2025年3月に行ったインターネット調査では、画像検索を使ったことがある150人のうち、最もよく使う方法が「キーワードを入力して検索し、画像タブを開く」だった人が64.0%、「画像をアップロードして検索(Google Lens など)」だった人が28.0%でした。ベンダーによる小さな標本の調査ですが、「画像検索を使う人」の多くが、写真で問う人とは限らないことを示しています。

1-2. 声で問う

声で問う行動は、端末に話しかけて答えを得るものすべてを含みます。ただし、以下で見るとおり、声のリクエストの数と、声による検索の数は同じではありません。 本記事は、この二つを分けて扱います。

1-3. 親記事との関係

写真や声で問うことは、ロングクエリマーケティングの全体像を扱う記事の「声と画像で問うようになった」の章で概観しています。そこでは、入力の形が変わると問いの形も変わりうる、という見方を示しました。本記事は、その論点を主題にして、何が伝わるのかと、企業の側で何を用意できるのかまで掘り下げます。

2. 写真と声で問う検索は、どれくらい使われているか

2-1. 公表されている数字と、その母数

表1:写真と声で問うことについて公表されている数字
数字何の数か(母数)国・範囲時点と出所
月に200億回近くLensでの画像による検索の回数記載なし2024年10月3日・Google
2024年10月から月50億回の増加Lensでの画像による検索の月間回数の増加記載なし2025年4月24日・Alphabetの決算説明
月250億回超Lensの問いの回数(2025年4月の社内データ)記載なし2025年12月・Think with Google
月15億人超Lensで見たものを検索する人の数記載なし2025年5月20日・Google
5億8,000万台超かこって検索が使えるAndroid端末の数。使った人の数ではない記載なし2026年2月4日・Alphabetの決算説明
6件に1件近くAI Modeの問いのうち、音声か画像を使ったもの記載なし2026年2月4日・Alphabetの決算説明
6件に1件以上「米国の検索」のうち、音声か画像を使ったもの。AI Modeについての知見の一覧の中に置かれた一文米国2026年5月19日・Google
1日15億回Siriへの音声のリクエスト。検索に限らない記載なし2024年6月・Apple WWDC24の基調講演
5倍Gemini Liveでの会話の長さ(文字での対話との比)。問いの長さではない記載なし2025年5月20日・Google
9%生成AIの利用者のうち「音声入力をして使うことが多い」人日本・15〜69歳2026年2月調査・モバイル社会研究所

表の「何の数か」の列を、必ず一緒に読んでください。 同じ「6件に1件」でも、母数がAI Modeの問いなのか、検索全体なのかで意味がまったく変わります。

2-2. Lensとかこって検索

Googleは2024年10月3日の記事で、Lensが月に200億回近くの画像による検索に使われていると書いています。2025年4月24日の決算説明では、Lensでの月間の画像による検索が2024年10月から50億回増えたと述べました。Think with Googleの2025年12月の記事は、2025年4月の社内データとして、Lensの問いが月250億回を超え、そのうち5件に1件が商業的な意図を示すとしています。いずれもGoogle自身の公表で、算出の方法は示されていません。

かこって検索が使える端末は、1億5,000万台超(2024年10月)、2億5,000万台超(2025年4月)、5億8,000万台超(2026年2月)と公表されています。これは使える端末の数であって、使った人の数や検索の回数ではありません。 2026年2月には、一つの画像の中の複数の物をまとめてかこって問えるようになった、とGoogleは書いています。

2-3. AI Modeの「6件に1件」は、二つの言い方がある

ここは母数を取り違えやすいところです。

2026年2月4日の決算説明は、「Nearly one in six AI Mode queries are now non-text, using voice or images」と述べています。AI Modeの問いの6件に1件近くです。国の限定は書かれていません。

2026年5月19日のGoogleの記事は、「米国のAI Modeについての主な知見」という前置きの下に、次の一文を置いています。

More than one in six searches in the U.S. now use voice or images, with image searches growing over 40% month-over-month.

一文だけを読むと、米国の検索全体の話にも読めます。しかし、置かれている場所はAI Modeの知見の一覧です。 本記事は、この文面からは母数を確定できないと考えます。2月の数字はAI Modeの問いの数字として扱い、5月の数字は母数を確定しないまま扱います。どちらも、Google検索全体の内訳としては使いません。

画像による検索が前月比で40%以上伸びた、という部分も同じ一文の中にあります。何月から何月への比較かは書かれていません。

2-4. 日本について言えること

GoogleのAI Modeは、2025年9月9日に日本語での提供が始まりました。日本語の発表は、マイクのアイコンから口頭で問えること、写真を撮ったり画像を上げたりして問えることを書いています。

ただし、日本でAI Modeの問いのうち何割が音声や画像かを示す一次の数字は、本記事の調査範囲では見つかりませんでした。 表1の数字の多くは、国の範囲が書かれていないか、米国のものです。

日本の声については、NTTドコモのモバイル社会研究所が2026年2月に行った調査があります。全国の15〜69歳のうち生成AIの利用者3,669人に使い方を聞いたところ、「音声入力をして使うことが多い」は9%でした。年代が上がるほど高く、60代の女性で14%だったとしています。これは生成AIへの話しかけ方の調査で、検索の入力の内訳ではありません。

3. 写真で問うと、何が伝わるのか

3-1. Lensは、写真を他の画像と比べる

Lensの説明のページ(How Lens works)は、仕組みを次のように書いています。

  • 写真の中の物体を他の画像と比べ、似ている度合いと関連の強さで順位をつける
  • 写真の中の物体についての理解を使って、ウェブから関連する結果を探す
  • 画像が載っているページの言葉、言語、その他のメタデータといった信号を使うこともある
  • 画像の中にバーコードや文字(商品名や書名など)を見つけた場合は、その物についての検索結果を返すことがある
  • 商品であれば、利用者の評価などの信号に頼ることもある

写真そのものだけが比べられるわけではない、ということです。 画像が載っているページの言葉も、結果の順位や関連の判断に使われうる、とGoogleは書いています。ただし、どの信号がどれだけ効くかは書かれていません。

3-2. AI Modeは、画像の中の物体ごとに検索を広げる

Googleは2025年4月7日の記事で、AI Modeに画像で問う仕組みを三つの段で説明しています。

  1. 画像の場面全体を理解する。物どうしの関係や、素材、色、形、配置を含めて
  2. Lensが、画像の中の物体を一つずつ識別する
  3. クエリファンアウトの手法で、画像全体と、画像の中のそれぞれの物体について、複数の問いを発行する

例として挙げられているのは本棚の写真です。棚の本を一冊ずつ識別し、それらの本と、評価の高い似た本について問いを発行する、とされています。このときの対応は、2025年4月の時点で米国のLabsの利用者向けと書かれています。

その後Googleは、2025年9月30日の記事で、クエリファンアウトを土台にした新しい手法として「visual search fan-out」を挙げ、画像の主な対象だけでなく、細かな特徴や副次的な物体も読み取ったうえで、背後で複数の検索を行うと説明しました(このときの新しい体験は米国の英語で提供)。2026年7月14日の記事は、一つの画像による検索を数十の下位の問い(dozens of sub-queries)に分けると書いています。同じ記事によると、かこって検索で複数の物をまとめて問う機能も、この手法を使います。

2026年3月5日に公開されたGoogleの技術者へのインタビューでは、AIのモデルが画像を「見る」頭脳で、画像検索の仕組みが何十億ものウェブの結果を持つ書庫だ、という説明がされています。写真で問われたとき、ウェブ上のページや画像は、答えを組み立てる情報源の一つになります。 ただし、AI Mode全体について、Googleは2025年3月5日の記事で、質の高いウェブの内容に加えて、ナレッジグラフ、現実の世界についての情報、数十億の商品についてのショッピングのデータといった情報源も使うと説明しています。問いを広げて探す仕組みについては、クエリファンアウトを扱う記事で詳しく書いています。

3-3. 写真と言葉を一緒に使う

写真と言葉を一緒に使う問いについて、Googleは2022年4月7日の記事でmultisearchという機能を紹介しています。挙げられている例は三つです。

  • おしゃれなオレンジ色のドレスのスクリーンショットに「green」を添えて、別の色のものを探す
  • 手元のダイニングセットの写真に「coffee table」を添えて、合うテーブルを探す
  • ローズマリーの写真に「care instructions」を添えて、手入れの方法を知る

同じ記事は、目の前の物について質問することも、色やブランド、見た目の特徴で絞り込むこともできる、と書いています。このときの提供は、米国の英語でのベータ版でした。

日本語の例もあります。2025年9月9日のAI Modeの日本語の発表は、スペイン語のメニューの写真を撮り、「どれがベジタリアン向けか教えて」と尋ねる例を挙げています。Lensについても、写真を撮りながら声で質問できることを、Googleは2024年10月に書いています(当時は英語の問いが対象)。

研究の側にも、同じ形の課題があります。2019年のCVPRに採択された論文は、画像と、その画像への変更を言葉で述べたものを組み合わせて問いにする画像の検索を扱っています。エッフェル塔の画像に「昼ではなく夜に撮ったもの」という言葉を添える、という例です。

3-4. 本記事の整理 — 画像が対象を運び、言葉が条件を運ぶ

ここからは本記事の整理です。Googleの定義ではありません。

上の例を並べると、写真と言葉は別々のものを運んでいるように読めます。

表2:写真と言葉が運んでいるもの(本記事の整理)
例写真が運ぶもの言葉が運ぶもの出所
ドレスの画像+「green」そのドレス(形や作り)色を変えるという条件Google(2022年)
ダイニングセットの写真+「coffee table」手元の家具の見た目探したい品目Google(2022年)
ローズマリーの写真+「care instructions」植物が何か知りたいことGoogle(2022年)
メニューの写真+「どれがベジタリアン向けか」メニューの中身当てはまる料理を選ぶ条件Google(2025年・日本語)

写真は、言葉にしにくい対象を一度で渡します。ドレスの形を言葉で言い切るのは難しくても、画像なら一枚で済みます。言葉は、写真に写っていないことを渡します。色を変えたい、別の品目がほしい、自分に合うものを選びたい、といった条件です。

この整理には限界があります。 写真も条件を運ぶことがあります。写っている色や素材が、そのまま条件になる場合です。言葉も対象を名指しできます。商品名を言えば、写真は要りません。整理は一つの読み方であって、すべての問いがこの形になるわけではありません。

3-5. 企業にとって、この整理が意味するところ

これも本記事の読み方です。

写真で問われるとき、自社の商品が何であるかを画像から正しく識別できることは、重要な手がかりの一つです。 ただし§3-1のとおり、Lensは画像そのものだけでなく、画像が載っているページの言葉やメタデータ、画像の中の文字なども使うことがあります。

言葉で添えられるのは条件です。色、価格、在庫、使い方、合うかどうか。その条件に答える情報を自社のページに文字で書いておけば、Googleが参照できる情報の一つになります。 ただし、AI Modeが使うのは自社のページだけではありません。他社のページや、Googleが持つ商品の情報も使われえます。Googleは2025年9月30日の記事で、ショッピンググラフ(Shopping Graph)が商品ごとにレビュー、最新のセール、色の展開、在庫の状況といった情報を持つと説明しています。条件に答える情報がどこにあるかという問いは、ロングクエリマーケティングの記事が扱った「条件に答える情報があるか」という問いと同じ形です。

ただし、写真で識別されることや、条件に答える情報があることが、回答の中で自社が選ばれることを保証するわけではありません。 その因果を確かめた一次の資料を、本記事は持っていません。

3-6. 写真について、言えること・言えないこと

表3:写真で問うことについて、一次の資料で言えること
言えること言えないこと
AI Modeは画像の中の物体を識別し、画像全体とそれぞれの物体について複数の問いを発行する、とGoogleは説明している発行された問いの中身を、サイトの側から見られる
Lensは画像が載っているページの言葉やメタデータを使うことがあるどの信号がどれだけ効くか
写真に言葉を添えて、色や見た目の特徴で絞り込める添えた言葉の条件が、回答の中で必ず守られる
AI Modeの問いの6件に1件近くが音声か画像Google検索全体の6件に1件が音声か画像

4. 声で問うと、何が伝わるのか

4-1. 声の数字は、何を数えているか

Appleは2024年6月のWWDC24の基調講演で、Siriの利用者が1日に15億回の音声のリクエストをしていると述べました。これは音声のリクエストの数として示されたもので、検索の回数として示されたものではありません。

Googleは2025年5月20日の記事で、Gemini Liveでの会話が、文字での対話にくらべて平均で5倍長いと書いています。長いとされているのは会話であって、ひとつひとつの問いではありません。 何をもって長さとしたかも示されていません。

4-2. 声で検索と話すSearch Live

Googleは2025年6月18日に、AI Modeで声のやりとりができるSearch Liveを米国のLabsで始めました。記事によると、声で問うと音声で答えが返り、続けて問うことができ、ウェブのリンクが画面に表示されます。ここでもクエリファンアウトの手法を使い、幅広いウェブの情報を示すとしています。答えの文字起こしを表示して、文字で問いを続けることもできます。

2026年3月26日には、AI Modeが提供されているすべての言語と地域へSearch Liveを広げたとGoogleは書いています。日本語が含まれるかは、その記事では名指しされていません。 AI Modeは日本語で提供されているため、対象に含まれると読めますが、本記事は日本語での動作を確かめていません。

4-3. 声で問うと、問いは長くなるが

声で問う問いについては、査読付きの研究があります。2006年に学術誌JASISTに掲載されたCrestaniとDuの研究は、同じ課題について利用者に書いた問いと話した問いを作ってもらい、比べました。

結果は二つです。声で問うと、情報の求めを自然に言い表せ、問いが長くなりやすかった。 一方で、長くなった話し言葉の問いは、書いた問いにくらべて検索の成果を有意には高めなかった、と報告されています。

この研究は2006年の実験で、いまのAIの検索を対象にしたものではありません。ここから本記事が読み取るのは、「声で問うと問いが長くなる」ことと「長くなった分だけ条件が伝わる」ことは別だ、という点までです。 親記事が、長さではなく条件の数で読むことを分析として示したのと同じ注意が、声にも当てはまります。

4-4. 声で何が伝わるかについて、分からないこと

声で問われたとき、AIの側でその声がどのような文字や問いに置き換えられるのかについて、提供元の詳しい説明を、本記事の調査範囲では見つけられませんでした。 Search Liveで文字起こしが見られることは書かれていますが、それは答えの側の文字起こしとして説明されています。

したがって、本記事は、声で問うときに何が伝わるかを、写真の場合ほど書けません。確かめられるのは、声で問うたときの回答を記録することまでです(§7)。

5. 反証 — 写真と声の話が弱いところ

ここを飛ばさないでください。

表4:反証と、その出所
反証内容出所
音声の割合は、2016年のあと単独で公表されていない2016年の基調講演で、米国のモバイルのアプリについて「問いの5件に1件が音声」とされた。そのあとの公表は音声と画像をまとめた数字で、音声だけの割合は本記事の調査範囲では見つからない第三者が公開した講演の書き起こし(映像では未確認)/Google公式
「半分が声と画像になる」予測は、出所と対象が限られる2014年に百度の研究者が、百度の問いについて述べたもの。「2020年に50%が音声」という形でcomScoreのものとされる言い方は、出所をたどれないと報じられている業界メディアの報道
AI Modeに届いた検索は、まだ小さい米国のウェブブラウザのパネルで、2026年1〜4月のGoogle検索のうちAI Modeに到達したのは0.34%。Googleのアプリは含まないベンダー分析(SparkToro)
Siriの数字は検索の数ではない1日15億回は音声のリクエストの数Apple公式
Gemini Liveの5倍は問いの長さではない長いとされているのは会話Google公式
長い話し言葉は、成果を有意には上げなかった声の問いは長くなったが、書いた問いにくらべて検索の成果は有意に高くならなかった(2006年の実験)査読付き論文
日本の数字が乏しい日本でAI Modeの問いのうち音声や画像が何割かを示す一次の数字は見つからない。画像検索の利用者の多くは、言葉で検索して画像タブを開いている確認できず/ベンダー調査(PLAN-B)

5-1. 音声の割合は、どこまで公表されているか

2016年5月のGoogle I/Oの基調講演で、スンダー・ピチャイ氏は、米国で問いの5件に1件、20%が音声だと述べた、と講演の書き起こしは伝えています。範囲を示す部分は、書き起こしでは「on our mobile app in Android」です。モバイルのアプリの問いについての数字で、Google検索全体の数字ではありません。 アプリだけを指すのか、Android上の検索を広く含むのかは、この一文からは確定できません。本記事は、第三者が公開した書き起こしで確認しました。講演の映像の該当箇所は確認していません。

そのあとGoogleが公表した数字は、本記事が確認した範囲では、音声と画像をまとめたものでした(§2-3)。AI Modeの問いの6件に1件近く、という数字も、音声と画像の内訳を示していません。音声による検索が増えたのか、減ったのか、変わらないのかは、この公表からは判断できません。

5-2. 「半分が声と画像になる」という予測

「検索の半分が音声になる」という言い方は、実務の記事でよく引かれてきました。本記事は、この言い方を出所まで遡れるときだけ扱います。

たどれた出所は、2014年9月の講演です。当時、百度のチーフサイエンティストだったアンドリュー・ン氏は、5年後には問いの50%が音声か画像になると考えている、と述べました(2014年9月20日のVentureBeatの報道)。同じ報道によると、ン氏は当時、百度が受ける問いの10件に1件がすでに音声だとしています。予測の対象は百度の問いで、声だけではなく声と画像を合わせたものでした。

一方、「2020年までに検索の50%が音声になる」という形でcomScoreのものとされる言い方については、2018年8月23日のEconsultancyの記事が、出所を見つけられないと書いています。

予測が当たったかどうかは、本記事では判断できません。 百度の問いに占める音声と画像の割合を示す、その後の一次の数字を、本記事は見つけられませんでした。Googleの公表とは母数が違うため、比べることもできません。本記事自身も、この先の割合について予測はしません。

5-3. 反証を並べたうえで、何が残るか

残るのは、写真で問う入力の形について、Googleが規模のある数字と仕組みの一部を公表していること、そして声については言えることが少ないこと、までです。 「これから声と画像が主流になる」とは、本記事は書きません。

6. 企業が用意しておくもの — Googleの画像のガイダンスに書かれていること

6-1. なぜ画像のガイダンスなのか

この章は、Googleの公式のガイダンスに書かれていることだけを書きます。 本記事の推測は足しません。

Googleの生成AI向けの最適化ガイド(最終更新2026年7月10日)は、ページに質の高い関連する画像や動画を置き、文字の内容を支えることを勧めたうえで、画像のSEOのベストプラクティスと動画のSEOの文書に従っていれば、生成AIの検索への最適化もすでにできていると書いています。

別のページ(AI features and your website、最終更新2025年12月10日)は、AI OverviewsとAI Modeのために特別な最適化は要らないとしたうえで、従来の基本として、重要な内容を文字の形で用意すること、文字の内容を質の高い画像や動画で支えることを挙げています。新しい機械可読のファイルや、AI向けのテキストファイル、マークアップを作る必要はない、とも書かれています。

ここで断っておくことがあります。 画像のSEOのガイド(Google image SEO best practices、最終更新2026年3月2日)は、検索結果の画像、Discover、Google画像検索を対象にしたものです。Lens、かこって検索、AI Modeの画像による問いを名指ししてはいません。 §3-1のとおり、Lensはページの言葉やメタデータを使うことがあると説明していますが、ガイドの各項目がLensにそのまま効くとは、Googleは書いていません。

6-2. 画像を見つけて、索引に入れてもらう

ガイドの前半は、画像を見つけてもらうための技術的な要件です。

  • 標準のHTMLの画像要素を使う。 Googleは要素のsrc属性にある画像を見つけられる。CSSの背景画像は索引に入れない
  • 画像のサイトマップを使う。 通常のサイトマップと違い、他のドメインのURLも含められるため、CDNで配信する画像も扱える
  • レスポンシブ画像には、srcで代わりのURLを必ず書く。 srcsetやを理解しないクローラーがあるため
  • 対応する形式を使う。 BMP、GIF、JPEG、PNG、WebP、SVG、AVIF。ファイル名の拡張子を形式と合わせる
  • 速さと画質を両立させる。 鮮明な画像は利用者に好まれる一方、画像はページを重くしやすい

ガイドの例をもとに、本記事が商品の画像と日本語の代替テキストに置き換えて示します。

<!-- 良い例:img要素のsrcに画像がある -->
<img src="navy-linen-shirt.jpg" alt="紺色のリネンの半袖シャツ、前立てにボタン5つ">

<!-- 避ける例:CSSの背景画像は索引に入らない -->
<div style="background-image:url(navy-linen-shirt.jpg)">紺色のリネンシャツ</div>

<!-- picture要素でも、代わりのimgとsrcを置く -->
<picture>
  <source type="image/webp" srcset="navy-linen-shirt.webp">
  <img src="navy-linen-shirt.jpg" alt="紺色のリネンの半袖シャツ">
</picture>

6-3. 画像が載っているページを整える

ガイドの後半は、画像が載っているページの側の話です。ページの内容とメタデータは、画像が検索結果のどこにどう出るかに大きく影響しうる、とガイドは書いています。

  • 説明的なファイル名にする。 例としてmy-new-black-kitten.jpgはIMG00023.JPGよりよいとされる。画像を各国向けに用意するなら、ファイル名も訳す
  • 代替テキスト(alt)を書く。 ガイドは、画像に追加の情報を与える属性の中で最も重要なのがaltだとしている。Googleはaltを、コンピュータビジョンのアルゴリズムやページの内容と合わせて、画像の主題を理解するのに使う
  • altにキーワードを詰め込まない。 利用者の体験を損ない、スパムと見なされるおそれがある
  • 画像を関連する文章の近くに置く。 Googleは、キャプションや画像のタイトルを含むページの内容から、画像の主題を読み取る
  • ページのタイトルと説明を整える。
  • 構造化データを入れる。 入れた場合、Google画像検索でバッジなどのリッチリザルトに画像が出ることがある。そのためには各タイプでimageの属性が必須
  • ページで優先したい画像を示す。 ガイドは、Googleがページのどの画像を表示に選ぶかは自動で決まるとしたうえで、primaryImageOfPage、主たる対象に付けたimage、og:imageのいずれかで選ばれる画像に影響を与えられると書いている。示す画像は、ロゴのような汎用の画像や文字入りの画像、極端な縦横比の画像を避け、できれば高い解像度にする
  • 同じ画像は、どのページからも同じURLで参照する。
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "WebPage",
  "url": "https://example.com/url",
  "primaryImageOfPage": "https://example.com/images/cat.png"
}
</script>

altについては、実際に抜けやすいことも分かっています。 WebAIMが2026年2月に世界の上位100万サイトのトップページを調べた結果では、53.1%のページに代替テキストの無い画像があり、画像全体の16.2%に代替テキストがありませんでした。日本のサイトに限った数字ではありません。

6-4. 選べること

ガイドは、サイトの側で選べることも書いています。

  • Google画像検索の結果で、原寸の画像を表示させないこともできる。 リクエストのリファラーを見て、Googleのドメインからなら200か204を返す。この場合、クロール時に作られたサムネイルが表示される
  • セーフサーチのために、ページの性質をGoogleが理解できるようにする

6-5. 声について、ガイダンスに書かれていること

声で問われることに向けて、一般の企業が用意するものを示したGoogleのガイダンスは、本記事の調査範囲では見つかりませんでした。

近いものとして、speakableという構造化データの説明(最終更新2026年9月8日)があります。ただし、これはベータ版で、ニュースの発行者の記事をGoogleアシスタントが読み上げるためのものです。 対象は、米国の利用者の英語に設定したGoogle Homeの端末と、英語で発行する発行者に限られています。

本記事は、声のために特別に用意するものを勧めません。 勧められる根拠を持っていないからです。§6-1のとおり、Googleは重要な内容を文字の形で用意することを基本に挙げています。Search Liveも、ウェブの情報を探すためにクエリファンアウトを使うと説明されています(§4-2)。ただし、AI Mode全体の情報源はウェブのページだけではありません(§3-2)。

関連する論点として、決算説明会のように話した内容そのものが文字になっていない場合の扱いは、説明会の動画と書き起こしを扱う記事で、画像の中にしか無い数字の扱いは開示資料のPDFを扱う記事で扱っています。

6-6. 確認の一覧

表5:Googleの画像のガイダンスに沿った確認の一覧
確認することガイドの記述
商品の画像は、img要素のsrcにあるかCSSの背景画像は索引に入らない
画像のサイトマップを出しているか見つかりにくい画像のURLを知らせられる
ファイル名は、画像の中身を短く表しているか汎用のファイル名を避ける
altは、中身を説明しているか。詰め込んでいないか最も重要な属性。詰め込みはスパムと見なされうる
画像の近くに、関連する文章があるかページの内容から画像の主題を読み取る
重要な情報は、画像の中だけでなく文字でもあるか重要な内容を文字の形で用意する(AI featuresのページ)
ページで優先したい画像を示しているかprimaryImageOfPage、image、og:imageで、選ばれる画像に影響を与えられる
同じ画像を、同じURLで参照しているかキャッシュして再利用できるようにする

この一覧は、Googleの検索への対応です。 Google以外のAI製品が画像をどう扱うかは、本記事は一般化しません。

7. 測定 — 写真や声で問われたとき、自社はどう扱われるか

この章を厚く書きます。 写真と声には、文字の問いの測り方をそのまま当てはめられないところがあります。この章は、その違いに絞って書きます。

7-1. Search Consoleの「Web: multimodal」で見えるもの

2026年9月24日、GoogleはSearch Consoleに、画像を使った検索での成果を見る区分を加えたと発表しました。検索の種類の絞り込みに「Web: multimodal」が加わり、検索結果の成果のレポートと、生成AI機能の成果のレポートの両方で使えます。

対象として挙げられているのは、Lens、Androidのかこって検索、Google検索への画像のアップロード、Chromeで画像を右クリックして検索する機能(Search this image)です。発表は、スマートフォンのカメラで検索する場合などを例に挙げています。同日から世界で順に展開するとされ、そうした検索から流入がある場合に数字が出る、と書かれています。

表6:Search Consoleで見えるもの、見えないもの
知りたいことSearch Consoleで
画像を使った検索で、自社のページが表示された回数(検索結果の成果)見える(Web: multimodal)
画像を使った検索で、AI OverviewsとAI Modeに自社へのリンクが表示された回数見える(生成AI機能のレポートのWeb: multimodal)。分類の軸は、ページ、国、日付、端末
画像を使った検索で、利用者が添えた言葉(問い)見えない。文字の問いのデータが無いため、この区分では問いの軸が使えない
利用者が使った画像そのもの見えるとは書かれていない
Google画像検索の結果ページでの表示Imageという別の検索の種類として記録される
声で問われた検索だけ分けて見る区分は、本記事が確認した説明には無い
Search Labsの実験での表示生成AI機能のレポートには含まれない
Google以外のAI製品での扱われ方対象外

§1-1の区別が、ここで効きます。 Search Consoleは検索の種類ごとにデータを分けて記録します。言葉で検索してGoogle画像検索の結果を見る行動と、写真で問う行動は、別の種類として数えられます。

そして、写真で問われたときに何という言葉が添えられたかは、Search Consoleでは分かりません。 Googleの説明では、画像を使った検索は主に文字ではなく画像を使うため、文字の問いのデータが無く、この種類を選ぶと問いの軸が使えません。本記事が「言葉が条件を運ぶ」と整理した、その言葉の側が見えないということです。

7-2. Web: multimodalの読み方 — 本記事の手順

ここからは、読者が自社で試せる一般的な手順です。当社の製品の機能を説明するものではありません。

  • 同じ期間で、検索の種類を「Web: text-based」と「Web: multimodal」に切り替えて、ページごとの表示回数を並べる。 画像を使った検索でだけ出てくるページや、逆に文字の検索でしか出てこないページが分かります
  • 生成AI機能のレポートでも、同じ切り替えをする。 画像を使った検索のうち、AI OverviewsやAI Modeに自社へのリンクが表示されたものを、ページ、国、日付、端末で見られます
  • 国と端末で絞る。 日本の利用者の数字だけを見たいなら国で絞ります

読み方の限界もはっきりさせておきます。 問いの軸が使えないため、どのページが出たかから、どんな写真で問われたかを推し量ることになります。それは推し量りであって、観測ではありません。 また、発表は、いつからの期間の数字を見られるかを書いていません。数字はGoogleの検索についてのもので、他社のAI製品は含みません。

7-3. 決めた写真と声で問う — 本記事が示す一般的な手順

Search Consoleの数字は、実際の利用者に表示された回数です。一方で、自社が写真や声でどう問われうるかを決めて、そのときの回答を記録することもできます。これも一般的な手順で、当社の製品の機能を説明するものではありません。

表7:写真と声で問うときの測り方(本記事の手順)
測ること問いの形分かること分からないこと
写真だけで識別されるか自社の商品の写真を、言葉を添えずに入れる自社の商品として識別されたか。何として識別されたか。何のページが引かれたか内部で発行された問い
条件を添えると変わるか同じ写真に、色、価格帯、用途などの言葉を一つずつ添えるどの条件を加えた試行で、自社の表示や扱われ方が変化したか変化の原因がその条件だったかどうか
他社の写真から自社に届くか競合の商品の写真に「似たもの」「別の選択肢」などを添える代わりの候補として自社が挙がるか挙がらない理由
声で同じことを問う文字で打った問いと同じ内容を、決めておいた台本どおりに声で問う入力の形によって、回答がどう変わったか声がどう聞き取られ、どんな問いに置き換えられたか

写真に固有の注意が三つあります。

  • 写真の選び方。 自社のサイトに載せている画像をそのまま入れると、同じ画像が見つかるだけかもしれません。店頭で撮った写真や、利用者が撮りそうな角度の写真も使うと、実際に近い条件で読めます
  • 写っている文字。 §3-1のとおり、Lensは画像の中の文字やバーコードを手がかりにすることがあります。商品名やラベルが写っている写真と、写っていない写真を分けて試すと、画像そのものから識別されたのか、写っている文字から識別されたのかを分けて読めます
  • 写っている物の数。 §3-2のとおり、AI Modeは画像の中の物ごとに問いを広げます。棚や部屋の写真のように複数の物が写っていると、自社の商品はその中の一つとして扱われえます。写す範囲を変えて試してください

声に固有の注意が二つあります。

  • 話した言葉は、自分で記録する。 §4-4のとおり、Search Liveで見られる文字起こしは答えの側のものとして説明されており、話した言葉がどう聞き取られたかが画面に出るとは書かれていません。台本を決めて、そのとおりに話してください
  • 使えるかどうかを確かめる。 Search Liveの日本語での動作は、本記事では確かめていません(§4-2)。使った製品と、声での入力ができたかどうかを記録してください

7-4. 何を記録するか

表8:写真と声で問うときに記録すること
記録すること理由
入れた画像ファイルそのもの写真が変われば結果も変わりうる。あとで同じ条件を作れない
写真に写っていた文字やラベルの有無、写っていた物の数識別の手がかりが画像か文字か、自社の商品が一つの物として扱われたかを分けて読むため
添えた言葉、または声で話した台本話した言葉の聞き取りが画面に出るとは限らない
何として識別されたか別の商品や他社の商品として識別されることがありうる
回答の中での扱われ方と、引かれたページ候補の一つか、条件に合う例か。自社のページか、他社のページか
製品とモデルの名前、日時、言語、地域、ログインの状態同じ製品でも時期や条件で中身が変わりうる

AIの回答の原文は、書き換えずに残してください。 要約して記録すると、あとで何が書かれていたかを確かめられなくなります。

7-5. 本記事の測定方針

本記事の測定では、一回の回答を、その写真や声の問いに対する固定的な結果とは扱いません。同じ写真と同じ言葉で複数回記録し、過去のやりとりを引き継がない状態で比べます。 写真と声では、撮り方、写っている範囲、話し方も結果に関わりうるため、それらも固定して記録します。条件を書き添えずに出した数字は、あとで読み返せません。

7-6. 当社の測り方

ここは当社の立場です。

当社、株式会社Vaigate(ヴァイゲート)が運営するVaipm(ヴァイピム)は、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定しています。ステートレスとは、ログインの状態や過去のやりとりを引き継がずに測るという意味です。複数のAIへの合計25回のステートレス計測は、当社が採用している観測の設計であり、研究から導かれた最適な値ではありません。

Vaipmは、対象について4通りの聞き方をします。名指しで聞く。名前を出さずカテゴリで聞く。競合と並べて聞く。固有の施策名で聞く。聞き方によって、AIの答えは変わります。

§7-3で示した、写真や声を入力にして聞く手順は、本記事が示す一般的な測り方であり、Vaipmの聞き方と同じものではありません。 当社が測定で引き受けているのは、自社がAIの回答の中でどう扱われているかを、聞き方を変えて繰り返し記録するところまでです。

7-7. この測定が答えない問い

写真で問われたときにAIが内部で発行した問いそのものは見えません。実際の利用者がどんな写真を撮り、どんな言葉を添えたかは、決めた問いを測る方法では分かりません。実際の利用に近い数字は§7-1のSearch Consoleの側にあり、二つは見ているものが違います。ページや画像を整えたことが、いつ回答に反映され、事業の成果にどう結びつくかも、この測定では分かりません。

8. よくある誤解

表9:よくある誤解と、一次の資料で言えること
誤解一次の資料で言えること
Google検索の6件に1件が音声か画像になった2026年2月の公表はAI Modeの問いについての数字。2026年5月の一文は字面では「米国の検索」だが、AI Modeの知見の一覧の中に置かれている。本記事は母数を確定せず、検索全体の数字としては使わない(§2-3)
Siriで1日15億回、音声で検索されている15億回は音声のリクエストの数で、検索に限らない(§4-1)
声で問うと、問いが5倍長くなる5倍はGemini Liveでの会話の長さ(§4-1)
音声の問いは平均29語29語は、Google Homeの音声の答えの平均の長さとして報告されたもの(ベンダーの2018年の分析)。問いの長さではない
検索の半分が音声になると予測されていたたどれた出所は、百度の問いについての2014年の発言で、声と画像を合わせたもの(§5-2)
画像検索への対応とは、画像タブに出ること写真で問う検索は別の行動で、Search Consoleでも別の区分(§1-1、§7-1)
AIのために特別な画像のマークアップが要るGoogleは特別なマークアップは要らないとし、画像のSEOのベストプラクティスと動画のSEOの文書に従っていれば生成AIの検索への最適化もできているとしている(§6-1)
speakableを付ければ、声の検索で読み上げられるspeakableはベータ版で、ニュースの発行者、米国、英語、Google Homeに限られる(§6-5)

9. まとめ

写真で問う検索には、規模のある数字が公表されています。 Lensの問いは2025年4月の社内データで月250億回を超え、かこって検索は5億8,000万台を超える端末で使えます。ただし、数字ごとに母数が違います。 AI Modeの問いの6件に1件近くが音声か画像、という数字は、Google検索全体の内訳ではありません。

写真で問うと、画像の中の物体が識別され、それぞれについて検索が広げられる、とGoogleは説明しています。 Lensは画像が載っているページの言葉やメタデータも使うことがあります。写真と言葉を一緒に使う問いは、画像が対象を運び、言葉が条件を運ぶと読めます。これは本記事の整理です。

声については、言えることが少なくなります。 Siriの数字は検索の数ではなく、Gemini Liveの5倍は会話の長さです。声で問うと問いは長くなりやすい一方、長さは成果に結びつかなかったという研究もあります。音声だけの割合は、本記事の調査範囲では2016年のあと公表されていません。

企業の側で用意できることとして、Googleは画像のSEOのベストプラクティスを挙げています。 img要素、画像のサイトマップ、説明的なファイル名、中身を説明するalt、関連する文章の近くに置くこと、重要な内容を文字でも用意すること。声のための特別な用意は、勧める根拠が見つかりませんでした。

画像を使った検索での表示は、Search Consoleで見られるようになりました。 声だけの区分は見当たりません。決めた写真や声で問うたときの扱われ方は、条件を固定して繰り返し記録すれば残せます。予測は書きません。いまの扱われ方は、測れば記録として残せます。

10. よくある質問

Q1. 写真で問う検索は、どれくらい使われていますか。

Googleの公表では、Lensでの画像による検索が2024年10月の時点で月に200億回近くあり、2025年4月の社内データでLensの問いは月250億回を超えています。月に15億人を超える人がLensを使っているともしています(2025年5月)。かこって検索は、2026年2月の時点で5億8,000万台を超えるAndroid端末で使えます。いずれもGoogle自身の数字で、算出方法は示されていません(§2-1、§2-2)。

Q2. AI Modeの6件に1件が音声か画像というのは、検索全体の話ですか。

2026年2月の決算説明の数字は、はっきりとAI Modeの問いについてのもので、検索全体の数字ではありません。2026年5月の記事は字面では「米国の検索の6件に1件以上」と書いていますが、その一文は米国のAI Modeについての知見の一覧の中に置かれています。検索全体の数字なのか、AI Modeの数字なのかは、この文面からは確定できません。本記事は母数を確定せず、検索全体の数字としては使いません(§2-3)。

Q3. 写真で問うと、AIには何が伝わるのですか。

Googleの説明では、AI Modeは画像の場面全体を理解し、Lensが画像の中の物体を一つずつ識別し、画像全体とそれぞれの物体について複数の問いを発行します。Lensは写真の物体を他の画像と比べ、画像が載っているページの言葉やメタデータを使うこともあります。どの信号がどれだけ効くかは公開されていません(§3-1、§3-2)。

Q4. 写真に言葉を添えると、何が変わりますか。

Googleは、写真に言葉を添えて色やブランド、見た目の特徴で絞り込めると説明しています。オレンジのドレスの画像に「green」を添える例が挙げられています。本記事は、画像が対象を運び、言葉が条件を運ぶと整理していますが、これは本記事の読み方で、写真が条件を運ぶことも、言葉が対象を名指しすることもあります(§3-3、§3-4)。

Q5. 声で問うと、問いは長くなりますか。

声で問うと、情報の求めを自然に言い表せ、問いが長くなりやすいという査読付きの研究があります(2006年)。同じ研究は、長くなった話し言葉の問いが、書いた問いより検索の成果を有意に高めなかったと報告しています。Gemini Liveの「5倍」は会話の長さで、問いの長さではありません(§4-1、§4-3)。

Q6. 日本でも、写真や声で問う人は多いのですか。

日本でAI Modeの問いのうち音声や画像が何割かを示す一次の数字は、本記事の調査範囲では見つかりませんでした。モバイル社会研究所の2026年2月の調査では、生成AIの利用者のうち「音声入力をして使うことが多い」は9%でした。ベンダーの調査では、画像検索を使う人の多くが、言葉で検索して画像タブを開いていました(§1-1、§2-4)。

Q7. 音声検索は、検索の半分になると言われていませんでしたか。

たどれた出所は、2014年9月に百度のチーフサイエンティストだったアンドリュー・ン氏が、百度の問いについて、5年後に50%が音声か画像になると述べたものです。「2020年に50%が音声」をcomScoreのものとする言い方は、出所をたどれないと報じられています。結果を確かめる一次の数字は見つからず、本記事は当たったかどうかを判断しません(§5-2)。

Q8. 写真で問われることに向けて、企業は何を用意すればよいですか。

Googleは、画像のSEOのベストプラクティスと動画のSEOの文書に従っていれば、生成AIの検索への最適化もすでにできていると書いています。そのガイドは、img要素のsrcで画像を置くこと、画像のサイトマップ、説明的なファイル名、中身を説明するalt、画像を関連する文章の近くに置くこと、代表の画像の指定などを挙げています。ただし、ガイドはLensやAI Modeを名指ししていません(§6)。

Q9. altには何を書けばよいですか。

Googleのガイドは、altを画像に追加の情報を与える属性の中で最も重要なものとし、ページの内容に沿った、情報の多い説明を勧めています。キーワードを詰め込むことは、利用者の体験を損ない、スパムと見なされるおそれがあるとしています。WebAIMの2026年の調査では、世界の上位100万サイトのトップページの53.1%に、代替テキストの無い画像がありました(§6-3)。

Q10. 声で問われることに向けて、特別に用意するものはありますか。

一般の企業向けにGoogleが示したガイダンスは、本記事の調査範囲では見つかりませんでした。speakableという構造化データはベータ版で、ニュースの発行者の記事を、米国の英語設定のGoogle Homeで読み上げるためのものです。本記事は、声のための特別な用意を勧めません。Googleは、重要な内容を文字の形で用意することを基本に挙げています(§6-5)。

Q11. Search Consoleで、写真で問われた検索を見られますか。

2026年9月24日から、検索の種類の絞り込みに「Web: multimodal」が加わり、Lens、かこって検索、画像のアップロード、Chromeで画像を右クリックして検索する機能などからの検索での成果を見られるようになりました。検索結果の成果のレポートと、生成AI機能の成果のレポートの両方が対象です。ただし、この種類では文字の問いのデータが無く、利用者が添えた言葉は見えません。声だけの区分は、本記事が確認した説明には見当たりません(§7-1)。

Q12. 自社で試すときは、何に気をつければよいですか。

自社のサイトの画像をそのまま入れると、同じ画像が見つかるだけのことがあります。店頭で撮った写真なども使い、商品名やラベルが写っている写真と写っていない写真を分けて試してください。入れた画像ファイルそのもの、添えた言葉、声で話した台本、引かれたページを記録します。画面に出るのは答えの文字起こしで、話した言葉の聞き取りが出るとは限らないためです。本記事の測定方針では、一回の回答を固定的な結果とは扱わず、同じ条件で複数回記録します。この手順は一般的なもので、Vaipmの聞き方と同じものではありません(§7-3〜§7-6)。

11. 出典

  1. Google(Shivani Mohan)「How AI Mode is changing the way people search in the U.S.」2026年5月19日。「Here are some of the key insights about AI Mode in the U.S. one year since launch」の下に、米国の検索の6件に1件以上が音声か画像を使い、画像による検索が前月比40%以上伸びたとする一文。https://blog.google/products-and-platforms/products/search/ai-mode-us-insights/
  2. Google「Alphabet earnings, Q4 2025: CEO's remarks」2026年2月4日。AI Modeの問いの6件に1件近くが音声か画像を使った文字以外の入力であること、かこって検索が5億8,000万台超のAndroid端末で使えること、AI Modeの問いが通常の検索の3倍の長さであること。https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q4-2025/
  3. Google(Elizabeth Reid)「Google updates: AI-Organized Search, Google Lens, and more」2024年10月3日。Lensが月に200億回近くの画像による検索に使われていること、Lensで写真を撮りながら声で問えること(英語の問い)、かこって検索が1億5,000万台超のAndroid端末で使えること。https://blog.google/products-and-platforms/products/search/google-search-lens-october-2024-updates/
  4. Google「Alphabet Q1 2025 earnings call: CEO Sundar Pichai's remarks」2025年4月24日。かこって検索が2億5,000万台超の端末で使えること、Lensでの月間の画像による検索が2024年10月から50億回増えたこと。https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q1-2025/
  5. Think with Google Editorial Team「What the breakout Search trends of 2025 mean for your marketing strategy in 2026」2025年12月。Lensの問いが月250億回を超え、5件に1件が商業的な意図を示すこと(Google Internal Data, April 2025)。https://business.google.com/ca-en/think/search-and-video/search-trends-marketing-takeaways/
  6. Google(Elizabeth Reid)「AI Mode in Google Search: Updates from Google I/O 2025」2025年5月20日。月に15億人を超える人がLensで見たものを検索していること、カメラで検索と話せるSearch Liveの予告。https://blog.google/products-and-platforms/products/search/google-search-ai-mode-update/
  7. Google(Harsh Kharbanda)「Circle to Search gets updated to search multiple things at once」2026年2月25日。一つの画像の中の複数の物をまとめてかこって問えるようになったこと。https://blog.google/products-and-platforms/products/search/circle-to-search-february-2026/
  8. Google(Belinda Zeng)「Go beyond the search box: Introducing multisearch」2022年4月7日。画像と文字を同時に使うmultisearchの例(ドレスの画像と「green」、ダイニングセットの写真と「coffee table」、ローズマリーの写真と「care instructions」)、色やブランド、見た目の特徴で絞り込めること、米国の英語でのベータ版であること。https://blog.google/products/search/multisearch/
  9. Google 日本版ブログ(Robby Stein)「Google 検索の AI モードを日本語で提供開始します」2025年9月9日。AI Modeで口頭や写真で問えること、スペイン語のメニューの写真でベジタリアン向けの料理を尋ねる例。https://blog.google/intl/ja-jp/products/explore-get-answers/ai-mode-search/
  10. Google(Robby Stein)「AI Mode in Google Search adds multimodal search」2025年4月7日。AI Modeが画像の場面全体を理解し、Lensが物体を一つずつ識別し、画像全体とそれぞれの物体について複数の問いを発行すること。本棚の例。米国のLabsの利用者向け。https://blog.google/products-and-platforms/products/search/ai-mode-multimodal-search/
  11. Google「Google expert explains AI Mode in Search's query fan-out method」2026年3月5日(Dounia Berradaへのインタビュー)。AIのモデルが画像を見る頭脳、画像検索の仕組みがウェブの結果を持つ書庫にあたるという説明、画像の中の複数の物について同時に検索を行うこと。https://blog.google/company-news/inside-google/googlers/how-google-ai-visual-search-works/
  12. Google Lens「How Lens works」。写真の物体を他の画像と比べて順位をつけること、画像が載っているページの言葉、言語、その他のメタデータを使うことがあること、バーコードや文字を認識した場合の扱い、商品の評価などの信号。https://lens.google/howlensworks/
  13. Nam Vo, Lu Jiang, Chen Sun, Kevin Murphy, Li-Jia Li, Li Fei-Fei, James Hays「Composing Text and Image for Image Retrieval — An Empirical Odyssey」CVPR 2019(arXiv 1812.07119)。画像と、その画像への変更を述べた文字を組み合わせた問いによる画像の検索。https://arxiv.org/abs/1812.07119
  14. Apple「WWDC24 Keynote」2024年6月。Siriの利用者が1日に15億回の音声のリクエストをしていること。https://developer.apple.com/videos/play/wwdc2024/101/
  15. Google(Josh Woodward)「Gemini App: 7 updates from Google I/O 2025」2025年5月20日。Gemini Liveでの会話が文字での対話にくらべて平均で5倍長いこと。https://blog.google/products-and-platforms/products/gemini/gemini-app-updates-io-2025/
  16. Google(Liza Ma)「Search Live with voice in AI Mode on Google Search」2025年6月18日。AI Modeでの声のやりとり、画面へのリンクの表示、クエリファンアウトの利用、答えの文字起こし、米国のLabsでの提供。https://blog.google/products-and-platforms/products/search/search-live-ai-mode/
  17. Google(Liza Ma)「Google Search Live expands globally」2026年3月26日。AI Modeが提供されているすべての言語と地域へのSearch Liveの展開。https://blog.google/products-and-platforms/products/search/search-live-global-expansion/
  18. NTTドコモ モバイル社会研究所「生成AIに「敬語で話す」人は15%、9%は「あだ名」をつけている」2026年7月16日。2026年2月のWeb調査(全国15〜69歳・生成AI利用者3,669人・複数回答)で「音声入力をして使うことが多い」が9%、60代女性で14%。https://www.moba-ken.jp/project/lifestyle/20260716.html
  19. F. Crestani, H. Du「Written versus spoken queries: A qualitative and quantitative comparative analysis」Journal of the American Society for Information Science and Technology 57(7), 881–890, 2006。話した問いは長くなりやすいが、検索の成果を有意には高めなかったこと。https://doi.org/10.1002/asi.20350
  20. 株式会社PLAN-B「画像検索の利用実態調査」2025年3月24日。2025年3月3〜5日のインターネット調査(スクリーニング2,000人、有効回答150人)。使ったことがある人が52.6%、最もよく使う方法が「キーワードを入力して検索し、画像タブを開く」64.0%、「画像をアップロードして検索」28.0%。SEO支援会社による調査。https://www.plan-b.co.jp/news/image_search/
  21. The Singju Post「Google I/O 2016 Keynote Full Transcript」。2016年5月18日のGoogle I/Oの基調講演の書き起こし(第三者による)。米国で問いの5件に1件、20%が音声であるとの発言(範囲の部分は「on our mobile app in Android」)。https://singjupost.com/google-io-2016-keynote-full-transcript/
  22. Jordan Novet「AI expert predicts half of web searches will soon be speech and images」VentureBeat、2014年9月20日。百度のアンドリュー・ン氏の、5年後に問いの50%が音声か画像になるとの発言、当時の百度の問いの10件に1件が音声であること。https://venturebeat.com/2014/09/20/ai-expert-predicts-half-of-web-searches-will-soon-be-speech-and-images/
  23. Rebecca Sentance「Why we need to stop repeating the "50% by 2020" voice search prediction」Econsultancy、2018年8月23日。comScoreのものとされる予測の出所をたどれないこと、元の予測がン氏の2014年の発言であること。https://econsultancy.com/why-we-need-to-stop-repeating-the-50-by-2020-voice-search-prediction/
  24. Rand Fishkin「In 2026, Less than One Third of Google Searches Still Send a Click」SparkToro、2026年6月9日。米国・2026年1〜4月のSimilarwebのデスクトップとモバイルのウェブのパネルで、Google検索のうちAI Modeに到達したのが0.34%であること、Googleのモバイルアプリを含まないこと。ベンダーによる分析。https://sparktoro.com/blog/in-2026-less-than-one-third-of-google-searches-still-send-a-click/
  25. Brian Dean「Voice Search SEO Study」Backlinko、最終更新2018年2月28日。Google Homeの検索結果1万件の分析で、音声の答えの平均が29語であること。ベンダーによる分析。https://backlinko.com/voice-search-seo-study
  26. Google Search Central「Google image SEO best practices」最終更新2026年3月2日。img要素、画像のサイトマップ、レスポンシブ画像、対応形式、速さと画質、代表の画像の指定、タイトルと説明、構造化データ、説明的なファイル名とalt、インラインリンクの停止、セーフサーチ。https://developers.google.com/search/docs/appearance/google-images
  27. Google Search Central「Optimizing your website for generative AI features on Google Search」最終更新2026年7月10日。質の高い画像と動画で文字の内容を支えること、画像のSEOのベストプラクティスと動画のSEOの文書に従っていれば生成AIの検索への最適化もできていること。https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
  28. Google Search Central「AI features and your website」最終更新2025年12月10日。AI OverviewsとAI Modeに特別な最適化は要らないこと、重要な内容を文字の形で用意すること、文字の内容を質の高い画像や動画で支えること、新しい機械可読のファイルやマークアップが要らないこと。https://developers.google.com/search/docs/appearance/ai-features
  29. Google Search Central「Speakable (Article, WebPage) structured data (BETA)」最終更新2026年9月8日。ベータ版であること、ニュースの話題についてGoogleアシスタントが読み上げるためのものであること、米国の英語設定のGoogle Homeと英語の発行者に限られること。https://developers.google.com/search/docs/appearance/structured-data/speakable
  30. WebAIM「The WebAIM Million: The 2026 report on the accessibility of the top 1,000,000 home pages」2026年2月。53.1%のページに代替テキストの無い画像があること、画像全体の16.2%に代替テキストが無いこと。https://webaim.org/projects/million/
  31. Google Search Central Blog(Harsh Kharbanda, Moshe Samet)「Announcing web multimodal Search performance reporting in Search Console」2026年9月24日。画像を使った検索の成果を見る区分の追加、対象(Lens、Androidのかこって検索、Google検索への画像のアップロード、Chromeの右クリックの「Search this image」)、世界での順次展開。https://developers.google.com/search/blog/2026/09/web-multimodal-in-sc
  32. Google Search Console ヘルプ「Performance report (Search results)」。検索の種類の絞り込み(Web: text-based、Web: multimodal、Image、Video、News)。https://support.google.com/webmasters/answer/7576553?hl=en
  33. Google Search Console ヘルプ「Generative AI performance report (Search)」。AI OverviewsとAI Modeでの表示回数、分類の軸(ページ、国、日付、端末)、検索の種類の絞り込み(Web: text-based、Web: multimodal)、Search Labsの実験を含まないこと。https://support.google.com/webmasters/answer/16984139?hl=en
  34. Google Search Console ヘルプ「Performance report (Search results): Dimensions and data groupings」。画像を使った検索は主に画像を使うため文字の問いのデータが無く、この種類を選ぶと問いの軸が使えないこと。https://support.google.com/webmasters/answer/17011259?hl=en
  35. Google Search Console ヘルプ「What are impressions, position, and clicks?」。画像はウェブの検索結果と画像検索の結果の両方に出うること、データは検索の種類ごとに分けて記録され合算されないこと。https://support.google.com/webmasters/answer/7042828?hl=en
  36. Google(Robby Stein)「Expanding AI Overviews and introducing AI Mode」2025年3月5日。AI Modeが、質の高いウェブの内容に加えて、ナレッジグラフ、現実の世界についての情報、数十億の商品についてのショッピングのデータといった情報源を使うこと。https://blog.google/products/search/ai-mode-search/
  37. Google「AI Mode in Google Search updates: Visual exploration and discovery」2025年9月30日。「visual search fan-out」により、画像の主な対象に加えて細かな特徴や副次的な物体を読み取り、背後で複数の検索を行うこと。ショッピンググラフが商品ごとにレビュー、最新のセール、色の展開、在庫の状況を持つこと。米国の英語での提供。https://blog.google/products-and-platforms/products/search/search-ai-updates-september-2025/
  38. Google(Brad Kellett)「Google Images: 25 years of visual search innovation」2026年7月14日。AI Modeが一つの画像による検索を数十の下位の問い(dozens of sub-queries)に分けること、かこって検索で複数の物をまとめて問う機能が同じ手法を使うこと。https://blog.google/products-and-platforms/products/search/google-images-25th-anniversary/

本記事の出典は、2026年9月25日に各掲載ページで確認した。出典21は講演の第三者による書き起こしで、講演の映像の該当箇所は確認していない。出典19は書誌と要旨で確認し、本文は確認していない。日本でAI Modeの問いに占める音声と画像の割合、および百度の問いに占める音声と画像のその後の割合を示す一次の数字は、本記事の調査範囲では確認できなかった。

Vaipmの視点

Vaipmは、AI上の認知を、複数のAIへの合計25回のステートレス計測で測定します。名指しで聞く、名前を出さずカテゴリで聞く、競合と並べて聞く、固有の施策名で聞く、の4通りの聞き方で、自社がAIの回答の中でどう扱われているかを記録します。写真や声を入力にした問いは、本記事が示す一般的な手順であり、Vaipmの聞き方とは別のものです。

関連する記事

実務ガイド

ロングクエリマーケティングとは|条件の多い問いに、答えは届いているか

ロングクエリマーケティングは実務での言い方で、公式の規格ではありません。AI Modeの問いは通常検索の3倍という数字と、短い問いも増えているという反証を並べ、条件の数という見方は本記事の分析として分けて示します。Search Consoleで測れる範囲と、AIの回答での扱われ方の測り方も解説します。

詳しく見る
実務ガイド

クエリファンアウト(query fan-out)とは|AIは一つの問いをどう複数の関連検索に広げて探すのか

クエリファンアウトとは、一つの問いに答えるためモデルが関連する複数の検索を同時に作って投げる手法です。Googleの定義と限定表現、観測で数倍ずれる本数、引用の安定性とファンクエリの入れ替わりの違い、ページを増やす対応がスパム方針に触れる理由、自社の測り方とその限界まで、一次の出典に当たって解説します。

詳しく見る
部門別ユースケース

決算説明会の内容はAIに届いているか|IRのためのAIO・LLMO対策[動画・書き起こし編]

決算説明会で話した内容の多くは動画とスライドの中にしかなく、質疑応答は書き起こされなければどこにも残りません。日本IR協議会の第33回調査と東証・金融庁の一次資料をもとに、話した内容とテキストの間にある欠落を棚卸しし、それがAIに届いているかを自社で確かめるための測定の手順まで、IR担当者向けに解説します。

IR決算説明会書き起こし情報開示AIPM
詳しく見る
部門別ユースケース

IRのためのAIO・LLMO対策|開示資料の中身はAIに読み取れているか — 決算短信PDFの表・脚注・単位

決算短信のPDFをAIが取得できても、中の数字が正しく取り出せているとは限りません。Googleの現行ドキュメントが示す形式の区別、有価証券報告書のインラインXBRLと決算短信のHTML提供、表・脚注・単位が壊れる八つの箇所、ベンダーへの依頼文、そして自社の資料を特別なツールなしで点検する手順を解説します。

IR開示資料機械可読XBRLAIPM
詳しく見る