定量分析

GPT-5.6でAIの回答はどう変わったか - 日本語810回答の実測調査

GPT-5.6でAIの回答はどう変わったか日本語810回答の実測調査
目次

GPT-5.6のリリース後、「AI検索での自社の見え方が変わった」という声を複数の企業から聞く。しかし、公式の説明だけでは、何がどう変わったのかまでは読み取れない。

そこで、日本語の質問90問を3つのモデルに810回投げ、AIが実際に発行した検索キーワードを1本ずつ記録した。

今回見えた変化
GPT-5.6では、AIがWeb全体を広く比較してそのまま答えるよりも、「候補を広く探す → 候補企業の公式サイトを名指しで確認する → 推奨に残す」という選定プロセスが鮮明になった。site: 指定の増加は、その変化を示す最も分かりやすいシグナルである。

特定サイト内だけを検索する site: 指定は、全検索キーワードの11.3%から61.0%へ増えた。たとえば「おすすめのMAツール」とだけ検索するのではなく、「site:hubspot.jp 料金 公式」のように、候補企業の公式情報を直接確認する検索が増えている。

調査サマリ

本調査で確認できた変化は、次の3点に集約できる。

変化GPT-5.5GPT-5.6 Sol意味
site: 指定の比率11.3%61.0%候補企業の公式サイトを直接確認する比重が上昇
1回目検索に比較系語を含む割合51.7%25.5%最初から比較記事を探す比重が低下
site: で名指し後、推奨として本文に残る割合28%28%「見に来る」と「選ぶ」は別の関門

この3つは、AIが企業を推奨するまでの過程を3つの関門に分けて考えると読みやすい。

3つの関門

① 候補に入る:AIが持つ候補、検索結果、第三者記事などから候補集合に入る。
② 名指しされる:候補の中から有望な企業として公式サイトを直接確認される。
③ 推奨に残る:公式サイトで確認した一次情報が、最終回答で選ぶ理由として使われる。

この構造が示すのは、LLMOが「引用を取るためのコンテンツ制作」だけでは完結しないということだ。候補に入るための検索・第三者露出、名指しされるためのカテゴリ内での認知、そして推奨に残るための一次情報整備を、分けて設計する必要がある。

調査の前提

2026年8月6日、OpenAIはGPT-5.6 Solを更新し、あわせて無料・GoユーザーのデフォルトモデルをGPT-5.6 Lunaに切り替えると告知した。一般ユーザーが目にする回答の挙動も、この時期から変化した可能性がある。

モデル更新後にAI検索の数字が動いたとき、原因は大きく「参照する情報源が変わった」か「AIが発行する検索キーワードが変わった」かに分けて考えられる。本調査では、後者を中心に、AIが何を検索し、どのサイトを確認し、最終的に何を推奨するのかを分析する。

調査の内容

項目内容
調査時期2026年8月
対象モデルGPT-5.5 / GPT-5.6 Sol / GPT-5.6 Luna
プロンプト日本語90問(6カテゴリ × 15問)
試行各プロンプト × 各モデル × 3回 = 810回答(取得失敗0件)
取得方法OpenAI Responses API(Web検索を有効化)。AIが発行した検索キーワードの文字列と引用URLを全件記録
カテゴリBtoB SaaS / 人材・転職 / 金融 / 医療・クリニック / EC・小売 / BtoBメディア・広告

質問はすべて社名を含まない一般相談型にした。「おすすめのMAツールを教えてください」のような、検討の入口にあたる質問である。社名を挙げて比較させる質問では、AIがその企業を確認しに行くのは当然の動作になるため、今回は扱っていない。

数字の読み方

重要:61%という絶対値ではなく、11.3% → 61.0%というモデル間の変化を見る

本調査はAPI経由で、GPT-5.6 Solの site: 使用率は61.0%だった。一方、当社が継続測定しているChatGPT実機ログ(40,662試行)では12.3%である。APIとChatGPT画面ではAIに与えられる指示が異なるため、61%をそのまま実機の水準とはみなさない。同一条件でGPT-5.5とGPT-5.6を比較したときに、11.3%から61.0%へ大きく上昇したことを読む。

また、1回答あたりの検索回数(クエリファンアウト数)は本調査の主張に含めていない。検索回数は思考量の設定で大きく変わるためである。同じ質問でも、GPT-5.5は既定で4回だった検索が、思考量を最大にすると9〜14回に増えた。

本調査では思考量を指定せず、各モデルの既定値のまま実行している。モデルごとの既定値が同一である保証はないため、検索回数の差がモデルの挙動によるものか既定値の差によるものかは切り分けられない。検索回数は site: の出現頻度にも影響しうるファクターであり、この点は本調査の弱みである。

なお本調査は、90問を各モデルに3回ずつ投げている。同じプロンプトの3回分は互いに独立した試行ではないため、90問固有の偏りが結果に含まれうる。厳密な効果測定ではなく、モデル間の傾向比較として読んでいただきたい。

調査結果

調査結果

結論

  • AIは検索キーワードの6割で site: を使い、特定企業の公式サイトを直接確認するようになった。
  • site: で名指しされた宛先のうち、直前の検索結果から発見経路を確認できなかったものが61.5%あった。
  • 公式サイトを名指しで確認しても、そのブランドが回答本文で推奨として残るのは28%にとどまった。

なお本稿では、AIの動作を次の3語で使い分ける。確認する=検索してそのページの内容を読み込むこと。出典として使う=読み込んだページを回答の引用元として提示すること。推奨する=回答本文でそのブランドを候補として挙げること。3つは別々の段階であり、確認されたページのすべてが出典になるわけでも、出典になったブランドのすべてが推奨されるわけでもない。

検索キーワードの6割が site: 指定になった

site: は検索対象を特定のサイトに限定する指定方法で、たとえば「site:example.com 料金」と検索すると、example.com内の情報を優先して確認できる。

指標GPT-5.5GPT-5.6 SolGPT-5.6 Luna
全キーワード中の site: 率 (分母=AIが発行した全キーワード数)11.3% (123/1,090)61.0% (483/792)42.2% (254/602)
site: を使った回答の割合 (分母=各270回答)34.1% (92/270)89.6% (242/270)77.0% (208/270)
site: 指定の総数123484254

さらに、site: 指定の32.4%はドメインだけでなくURLパスまで含んでいた。「site:hubspot.jp」ではなく「site:hubspot.jp/pricing」のように、サイト全体ではなく特定ページを狙って検索している。少なくとも検索実行時点で、AIが「どの企業の、どの種類のページを確認したいか」をかなり具体的に決めていることが分かる。

なお site: の宛先には、企業の公式サイトだけでなく、比較・ランキングサイトのドメインも含まれる。上位の宛先は各サービスの提供元ドメインが中心だが、「特定サイトを名指しする」動作そのものが増えた点が本節の要旨である。

site: 指定は、2回目以降の検索で特によく用いられる

ここは検索プロセスそのものを確認できるため、ローデータを残す。GPT-5.6は複数の検索キーワードをまとめて並列投入しているのではなく、APIの応答を1件ずつ見ると、検索と検索の間に推論ステップが挟まっている。

[1] 推論 「日本のマーケティングツールを調べる必要がある。公式の情報源で
           確認したい。HubSpot Marketing Hub、Salesforce Marketing Cloud、
           Adobe Marketo Engage あたりを検討している」
[2] 検索   site:hubspot.jp/products/marketing Marketing Hub 公式 MA
[3] 推論   (非公開)
[4] 検索   site:satori.marketing SATORI MAツール 機能 料金 公式
[5] 推論   (非公開)
[6] 検索   BowNow 公式 MAツール 料金 site:cloudcircus.jp
[7] 推論   「b→dashはBtoCやECのオムニチャネル施策に使えるかもしれない。
           機能や実際の効果について調べてみよう」
[8] 検索 site:b-dash.net b→dash データマーケティングクラウド 機能

検索は並列ではなく1本ずつ順に実行されており、その間に推論が挟まる。[7]では3回検索した後に「b→dashも調べてみよう」という判断が現れ、その直後に[8]が実行されている。

ただし、これは「前の検索結果を見て次の検索先を決めている」ことの証明ではない。最初の推論の時点で以降の手順がまとめて決まっており、順に実行しているだけという可能性も残る。本調査で言えるのは、実行順序が逐次であり、その間に推論が挟まっているという事実までである。

そのうえで、何回目の検索で site: が使われるかを見た。


GPT-5.5GPT-5.6 SolGPT-5.6 Luna
1回目の検索が site: だった割合0.4%35.9%5.2%
2回目以降の検索が site: だった割合14.9%73.2%72.3%

GPT-5.6では、「1回目で候補を広く探し、2回目以降で候補企業の公式サイトを直接確認する」という役割分担が見える。実際の検索列は次のとおりである。

■ おすすめのMAツール(マーケティングオートメーション)を教えてください。
1回目: 2026 マーケティングオートメーション MA ツール おすすめ 日本
       HubSpot Marketo SATORI BowNow 比較
2回目: site:business.adobe.com/jp/products/marketo Adobe Marketo Engage 機能 公式
3回目: site:shanon.co.jp SHANON MARKETING PLATFORM 展示会 イベント MA 公式

■ ハイクラス向けの転職サービスでおすすめはどれですか。
1回目: 2026 ハイクラス 転職サービス おすすめ ビズリーチ
       リクルートダイレクトスカウト doda X JAC
2回目: site:bizreach.jp ビズリーチ 公式 即戦力人材 スカウト 有料プラン 2026
3回目: site:career.oricon.co.jp/rank-scout 2026 転職スカウトサービス doda X ビズリーチ

3回目の宛先はランキングサイトである。2回目以降が必ず公式サイトになるわけではなく、候補を絞った後に第三者サイトを名指しで確認する動きも混在する。

なお、当社が継続測定している実機計測の40,662試行のログでも同じ2段構造が確認できている。site: が使われる位置の平均は、全キーワード列の49%地点だった。

AIが打つ検索キーワードは、人間の検索語より長い。2,484本を確認したところ、平均43字・中央値39字で、61字を超えるものが16.7%あった。複数の社名を並べた長い文字列も、区切りなしの1本の検索キーワードとして投げられている。カンマや読点で区切られたものは2,484本中2本(0.08%)しかなかった。

1回目の検索から、比較を探す語が半減した

AIが検索キーワードに自動で付け足す語の内訳を見る。

指標GPT-5.5GPT-5.6 SolGPT-5.6 Luna
1回目の検索に比較系語を含む割合
(分母=1回目キーワード数)
51.7%
(139/269)
25.5%
(66/259)
30.4%
(82/270)
全キーワード中「公式」を含む39.3%46.0%60.6%
全キーワード中「料金・価格」を含む17.3%16.3%15.6%
全キーワード中「比較」を含む4.4%0.9%2.5%
全キーワード中「評判・口コミ」を含む2.1%1.5%0.7%

最も大きい変化は1行目にある。比較系の語が1回目の検索キーワードに入る割合は、51.7%から25.5%へ半減した。引用側でも、比較・レビューまとめサイトの割合は2.1%から1.6%に下がっている。

これは「比較記事を読まなくなった」という意味ではない。比較記事を最終回答の根拠として探す比重が下がり、候補企業を決めた後に提供元へ直接確認する比重が上がった、と読む方が実態に近い。

企業側にとっての意味

従来は「おすすめ○選」「比較記事」に掲載され、その記事自体が引用される価値が大きかった。GPT-5.6では、比較記事から候補を知った後、最終判断のために公式サイトへ確認しにいく構造がより重要になっている。

site: の宛先の61.5%は、直前の検索から発見経路を確認できなかった

では、AIは名指しする相手をどこで知るのか。1回目が広い検索だった149回答を対象に、同じ検索キーワードでこちらから検索を再現し、その結果の中に「2回目以降で site: された企業」が含まれるかを確かめた。

判定は、①その企業のドメインが検索結果に出ていたか、②ドメインが出ていない場合、AIが確認したページ本文に社名が書かれていたか、の順で行った。

判定件数割合
① ドメインとして出た4419.9%
② 本文に社名があった4118.6%
①+② 1回目の検索から発見経路を確認できた8538.5%
③ どちらでも確認できなかった13661.5%

再現検索で確認できた範囲では、名指し先の38.5%は1回目の検索結果から発見できる経路があり、61.5%はその経路を確認できなかった。

後者をすべて「AIが検索前から知っていた」と断定することはできない。AIが実際に受け取った検索結果そのものではなく、再現検索による判定であることに加え、AIが利用する検索システムの挙動自体が外部からは見えないためである。検索システム側の仕様によって、同じキーワードでもAIが受け取る結果は変わりうる。

なお、1回の検索あたりAIが確認したのは平均10.4ドメインで、そのページ本文に書かれていた社名は平均63社だった。検索順位の上位に寄ってはいるが、上位N件を機械的に取っているわけではない。

比較記事は「不要」になったのではない。役割が変わった

比較記事の役割の変化

3-3では比較系の検索語が減った一方、3-4では「第三者ページの本文に社名があり、そこから候補を知る経路」が18.6%確認できた。この2つは矛盾しない。

AIは比較記事を最終回答の出典として使う頻度を下げつつも、候補企業を知る手段としては使っている。比較記事そのものが最終回答に現れなくても、そこに社名が載っていることで、その企業の公式サイトを名指しで確認しにいくことがある。

比較記事の価値の変化

「引用を取るため」だけではなく、「AIの候補集合に入るため」の価値を見る必要がある。掲載効果を引用数だけで測ると、候補形成への寄与を見落とす。

名指しされても、4件に3件は推奨に残らない

公式サイトを名指しされることは、最終的に選ばれることと同義ではない。

段階GPT-5.5GPT-5.6 SolGPT-5.6 Luna
site: で名指しした延べ件数123484254
→ AIが回答の出典として使った93(76%)369(76%)185(73%)
→ 回答本文で推奨として言及した34(28%)137(28%75(30%)

いずれも延べ件数で数えており、同一ドメインが複数回名指しされた場合はそれぞれ1件として計上している。

GPT-5.6 Solでは、名指しされた484件のうち369件(76%)は回答の出典として使われたが、推奨として本文に残ったのは137件(28%)だった。大きく落ちているのは「公式サイトを確認した後」である。

さらに、AIが1つのドメインから出典に使うページ数は平均1.19ページだった(1ページ277件・2ページ46件・3ページ9件)。複数ページを確認していても、最終回答で出典として使われるのは実質1ページに近い。しかもそれがトップページとは限らず、site: 指定の32.4%はURLパスまで含んでいた。

1回答あたりの推奨社数も9.61社から7.10社へ26%減り、回答文字数も2,733字から1,917字へ短くなった。候補として名前が挙がる枠そのものも狭くなっている。

重要な競争点

AIに「見つけてもらう」だけでは足りない。AIが公式サイトを確認しに来たとき、その1ページから料金・機能・実績・対象顧客・他社との違いなどの「選ぶ理由」を読み取れるかが、推奨に残るかを左右する。

AIの選定プロセスは、3つの関門に分けて考えられる

ここまでの結果をまとめると、AIが企業やサービスを推奨するまでの過程は、3つの関門として整理できる。

関門何が起きているか本調査で見えたこと
① 候補に入る事前知識・検索結果・第三者記事などから候補集合に入る再現検索で38.5%は1回目検索からの発見経路を確認。61.5%は確認できず
② 名指しされる候補の中から有望な企業として公式サイトを直接確認されるカテゴリ内で言及量が上位半分の企業は81.8%が名指し、下位半分は56.1%
③ 推奨に残る公式サイトで確認した情報を根拠に最終回答へ残るsite: で名指しされたうち、回答本文で推奨されるのは28%

この3つは別の課題である。検索順位や第三者記事は主に「候補入り」に効く。カテゴリ内での継続的な言及は「名指し」に関係する。そして「推奨に残る」は、公式サイトに何を公開しているかで比較的直接動かしやすい。

参考:ある事業者で観測された事象

当社が支援するある事業者で、モデル更新の前後を同一の質問で測定したところ、AI検索での推奨率が最大36ポイント下がった。

同じカテゴリの他社は参照されるURL数を伸ばしていたが、この1社だけが横ばいだった。参照回数が伸びたURLを並べると、上位を占めていたのは第三者のまとめ記事ではなく、各社が自社サイトに置いている一次情報のページだった。

各社の情報公開状況を調べると、サービスの実績値を自社サイト上に数値で公開している事業者は参照が伸び、同じ情報を問い合わせ後にのみ開示している事業者は伸びていなかった。当該事業者は数値が非公開で、該当するページ数も最少だった。

これは因果関係の証明ではないが、3-6で観測した「公式サイトを確認された後に推奨から落ちる」という構造と整合する事象である。AIが確認しに来たときに判断材料が公開されていなければ、推奨理由として利用しづらい。

提言:3つの関門ごとに打ち手を分ける

3つの関門ごとに打ち手を分ける

提言1 - 「候補に入る」ために、重要カテゴリの検索結果を自社・他社ともに押さえる

再現検索では、名指し先の38.5%について1回目の検索から発見できる経路を確認できた。その内訳は、自社ドメインが検索結果に出ていたもの19.9%、第三者ページ本文に社名があったもの18.6%である。

自社ページの順位を上げるだけでは不十分である。重要カテゴリの検索結果で、上位に出る第三者記事に自社名が載っているかも同時に見る。比較記事への掲載は、「その記事が引用されたか」だけではなく「候補として認識される経路を作れているか」で評価する。

提言2 - 「名指しされる」ために、カテゴリ内での言及量を高める

候補に入っても、公式サイトを名指しで確認されるとは限らない。カテゴリ内での言及量が上位半分の企業は81.8%が名指しされ、下位半分は56.1%だった。カテゴリによって効き方は異なるため、単独の因果指標ではないが、候補としての認知との関係は見ておくべきである。

見るべきはWeb全体での言及量ではなく、自社が勝ちたいカテゴリの中での相対的な位置である。「カテゴリを表す語 × 自社名」がどれだけセットで語られているかを競合比較する。

提言3 - 「推奨に残る」ために、判断材料を公式サイトへ公開する

site: で名指しされても、推奨として本文に残るのは28%だった。AIが1つのドメインから出典に使うページ数は平均1.19ページで、どのページが確認されるかを企業側が完全に選ぶことはできない。

料金・機能・実績・対象顧客・他社との違いなど、その企業しか持っていない一次情報を公式サイトに公開しておく。数値で示せるものは数値で置く。問い合わせ後にのみ開示している情報は、AIがその場で推奨理由として利用できない。

実務では、自社カテゴリでAIが実際に発行している検索キーワードを測定し、「そこで問われている項目への答えが公式サイト上に存在するか」を棚卸しするところから始める。

【備考】調査の限界

  • 本調査はOpenAI Responses API経由で取得している。ChatGPT画面とはAIへの指示が異なるため、site: 使用率の絶対値は画面より高く出ている可能性が高い。モデル間の比較として読む。
  • 観測された挙動が、モデル自体の変化によるものか、モデルが利用する検索ツール側の仕様変更によるものかは切り分けていない。外部からは分離できない。
  • 90問を各モデルに3回ずつ投げているため、同一プロンプトの3回分は独立した試行ではない。90問固有の偏りが結果に含まれうる。厳密な効果測定ではなく傾向比較として読む。
  • 対象は社名を含まない一般相談型の質問に限定している。社名を挙げて比較させる質問では site: の使われ方が構造的に異なる。
  • 思考量は指定せず、各モデルの既定値のまま実行している。モデル間で既定値が同一である保証はなく、検索回数の差がモデルの挙動によるものか既定値の差によるものかは切り分けられない。設定を上げると検索回数は約3倍に増えるため、検索キーワードの本数は本調査の主張に含めていない。
  • 「1回目の検索から発見できたか」の判定は、同じ検索キーワードで検索をやり直して再現したものであり、AIが実際に受け取った検索結果そのものではない。またAIが確認したページを母数にしているため、発見経路の確認率は下限値になりうる。
  • 引用元のサイト種別分類は、ドメイン名とURLパターンによる自動判定である。
  • Web上の言及数はAhrefs Content Explorerの日本語ページ数であり、同名の別企業・別用語を含みうる。またEC・小売はAIの検索が英語中心(キーワードの67.4%が日本語を含まない)のため、この指標での比較から除外している。
  • 因果関係は証明していない。時系列の一致と傾向による整合的な説明である。

AI検索での推奨獲得についてのご相談は、LANYのLLMOコンサルティングまでお問い合わせください。

プロフィール画像
担当メンバー 大西 真央

京都大学教育学部卒業後、新卒でデジタルマーケティング支援企業に入社。Shopifyアプリの立ち上げマーケティング全般を一人で担い、オウンドメディア運営や事例執筆、広報など多岐にわたる施策を自走した経験を持つ。 現在はLLMOコンサルタントとして活動する傍ら、R&D(研究開発)室にも所属し、LLM(大規模言語モデル)等の最先端技術に関する調査・活用研究にも携わっている。

>>詳細なプロフィールはこちら

【サービス概要資料】LLMOコンサルティング

【サービス概要資料】LLMOコンサルティング

LANYのLLMOコンサルティングのサービス概要資料です。LANYのLLMOコンサルティングは、企業がAIにどう見られているかを可視化し、選ばれるブランドづくりを支援する包括的なサービスです。

デジタルマーケティングのお悩み、
まずはお気軽にご相談ください。

LANYがお客様と共に考え、最適な解決の方向性をディスカッションを通じて見つけ出します。
サービス詳細は資料でもご確認いただけます。