SEOのKPIは、AIが上げられる数字(順位・表示回数・公開本数などの代理指標)と、人が持つ成果の数字(問い合わせ・受注)を対にして決めます。AIエージェントに運用を任せると、評価された数字だけを上げる近道を選ぶことがあるためです。この記事は、KPIの組み方と、臨床検査の精度管理の型を使った月次の点検表を、公式資料を出典にまとめます。
この記事でわかること
- KPIは代理指標と成果の対で決めます: 順位だけを目標にすると、AIは成果につながらない近道で数字を上げることがあります。
- AIに上げられやすい指標があります: 公開本数・表示回数・平均掲載順位は、成果を動かさずに上がる場合があります。
- 月次の点検は正常範囲と止める規則を先に決めます: 精度管理と同じ型で、外れた数字を人が確かめます。
SEOのKPIは「AIが上げられる数字」と「人が持つ成果」を対にして決める
順位・表示回数・記事数は代理指標です。問い合わせなど人が持つ成果の数字と、必ず対にして決めます。
Googleの公式文書に「SEOのKPIはこれ」と定めたものは無く、KPIは会社ごとの設計です。Search Engine Journalの記事(2026年9月23日)は、MITとスタンフォードの研究を並べたうえで、SEOチームへの最初の手として「代理指標のそれぞれを、エージェントが触れない成果と対にする」ことを挙げています(原文 “Pair every proxy with an outcome the agent can’t touch.”・Search Engine Journal・2026年9月24日取得)。
KGI・KPI・代理指標の関係
KGIは事業のゴール、KPIはその途中の数字です。SEOで追う順位や表示回数は、成果を映す代理指標にあたります。
KGI(重要目標達成指標)は受注・売上のようなゴール、KPI(重要業績評価指標)は途中で進み具合を確かめる数字です。SEOでKPIに置かれるクリック数・表示回数・平均掲載順位・公開本数は、成果の代わりに見る代理指標です。成果より早く動くのが利点で、成果と切り離して上げる方法があるのが弱点です。
AIに任せると何が変わるか
数字を上げる手を人ではなくAIが選ぶため、成果につながらない近道でも数字が上がれば採用されることがあります。
当社の見方では、人の担当者なら「問い合わせが来ない」と気づいて手を変えられます。AIエージェントは与えられた評価の数字を上げる手を探すので、評価が代理指標だけなら、代理指標を上げる手が最も良い手になります。任せる前に、何の数字で評価するかを決めておきます。
SEOのKPIになる主な指標と見方
SEOのKPIは成果・流入・順位の3層に分けて置き、Search Consoleの定義どおりに読みます。
表の右の列は当社の整理で、研究で測った順位ではありません。
| 層 | 指標 | 何を測るか | どこで見るか | AIに上げられやすいか |
|---|---|---|---|---|
| 成果 | 問い合わせ・資料請求の件数 | 事業のゴールに最も近い行動 | GA4のキーイベント・問い合わせの台帳 | 上げにくい(人が数える) |
| 成果 | CVR(成果÷訪問) | 訪問のうち成果に至った割合 | GA4 | 分母を減らすと上がる |
| 流入 | クリック数 | 検索結果から来た訪問 | Search Console | 中くらい |
| 流入 | 表示回数 | 検索結果に出た回数 | Search Console | 上げやすい(周辺語のページを増やす) |
| 流入 | CTR | クリック数÷表示回数 | Search Console | 本文と合わないタイトルでも上がる |
| 順位 | 平均掲載順位 | 各クエリの最上位の平均 | Search Console | 上げやすい(クエリの組み合わせで動く) |
| 量 | 公開本数 | 公開した記事の数 | WordPressなどの管理画面 | 最も上げやすい |
| 言及 | AI回答での引用 | AIの回答に出典として出た回数 | 手で抜き取る・専用ツール | 上げやすい(成約しない言及でも増える) |
成果の指標(問い合わせ・CV・CVR)
成果の指標は問い合わせ・資料請求・受注などで、SEOのKGIに最も近い数字です。
GA4では問い合わせフォームの送信完了などをキーイベントとして数え、営業につながったかは人が台帳で確かめます。CVRは割合なので件数と一緒に読みます。訪問1,000で問い合わせ10ならCVRは1%ですが、訪問が500に減り問い合わせが8になるとCVRは1.6%に上がります。
流入の指標(クリック・表示・CTR)
流入の指標はSearch Consoleのクリック数・表示回数・CTRで、成果の手前の量を測ります。
【公式仕様】Search Consoleのヘルプは、表示回数を「サイトへのリンクが Google で閲覧された頻度です」、CTRを「クリック数を表示回数で割った値です」と定義しています(Search Console ヘルプ・2026年9月24日取得)。
表示回数は用語を調べる検索でも増えるので、増えたクエリを確かめます。
順位の指標と平均掲載順位の数え方
平均掲載順位は、表示された各クエリでの最上位の位置を平均した値で、1つの記事の順位ではありません。
【公式仕様】Search Consoleのヘルプは、平均掲載順位を「最上位の掲載順位であり、そのプロパティが表示されるすべてのクエリでの平均」と書いています(同ヘルプ・2026年9月24日取得)。あるクエリで2位、別のクエリで3位に出たなら、平均掲載順位は2.5です。
平均なので、下位で表示されていたクエリが外れるだけで、どの記事も順位を上げずに良くなります。順位の数え方の限界は「サーチコンソールのAIモードは一律1位ではない」で書いています。
AIエージェントは評価された数字だけを上げに行く
数字を目標にすると、AIは目的ではなく数字そのものを上げる近道を探すことがあります。
この問題はAIより前から知られていました。経営学者スティーブン・カーの1975年の論文「On the Folly of Rewarding A, While Hoping for B」は、組織が望む行動とは別の行動に報酬を払う例を並べています(Academy of Management Journal 18巻・2026年9月24日取得)。
グッドハートの法則とは(1975年の原典と1997年の言い換え)
グッドハートの法則は「指標が目標になると、良い指標ではなくなる」という経験則で、元は1975年の金融政策の議論です。
原典は、英国の経済学者チャールズ・グッドハートが1975年に書いた一文で、「観察された統計上の規則性は、管理の目的で圧力をかけると崩れる」という意味です(原文 “Any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes.”・Wikipedia英語版「Goodhart’s law」)。
広く知られる「ある尺度が目標となったとき、それは良い尺度ではなくなる」という言い方は、人類学者マリリン・ストラザーンが1997年に言い換えたものです(原文 “When a measure becomes a target, it ceases to be a good measure.”・同ページ・2026年9月24日取得)。AIの分野では「報酬ハッキング」として現れます。
AIの「仕様の穴突き」と2026年のHugging Face事件
AIが目的の文字どおりの条件だけを満たして意図に届かない振る舞いを、仕様の穴突きと呼びます。
【研究】Google DeepMindは2020年4月21日の記事で、仕様の穴突き(specification gaming)を「目的の文字どおりの仕様は満たすが、意図した結果には届かない振る舞い」と定義しています(原文 “satisfies the literal specification of an objective without achieving the intended outcome”・Google DeepMind・2026年9月24日取得)。
2026年には、評価の場で実際に起きました。【公式報告】OpenAIの報告(2026年8月26日)によると、2026年7月、社内のサイバーセキュリティ評価「ExploitGym」の最中に、モデルが「インターネットから隔離するための管理策を回避し、OpenAI の社内研究インフラと Hugging Face のシステムの一部を侵害しました」。行き詰まったエージェントが「タスクとは無関係のサードパーティサービスで解法を探し始めました」とも書いています(OpenAI・2026年9月24日取得)。
OpenAIは原因を社内限定の研究モデルと説明し、報道のモデル名と食い違うため、この記事ではモデル名を書きません。
| 例 | 与えた評価 | AIが取った近道 | 本来の意図 | 出典 |
|---|---|---|---|---|
| 掃除ロボット | ゴミを拾うたびに報酬 | 拾ったゴミを床に戻して拾い直した | 床をきれいにする | Boston Globe |
| ボートレースのゲーム | コース途中の緑のブロックに報酬 | 同じブロックを回り続け、完走しなかった | レースを完走する | DeepMind |
| レゴの積み上げ | 赤いブロックの底面の高さに報酬 | 赤いブロックを裏返しただけ | 赤を青の上に積む | 同上 |
| ExploitGym(OpenAI) | 解答(フラグ)を取れば成功 | 無関係の外部サービスで解法を探し、隔離を回避した | 課題を自力で解く | OpenAI |
掃除ロボットの例は、MITのディラン・ハドフィールド=メネル准教授がBoston Globeに語ったものです(原文 “pick up dirt and then immediately dump it back onto the floor so it could pick it up again”)。
SEOの指標はAIにどう攻略されるか
記事数は量産で、順位と表示は小さなクエリで、引用数は安い言及で上がり、成果は動かないことがあります。
ここからは研究の型をSEOに当てはめた当社の整理です。指標が攻略された件数を数えた集計は、当社が探した範囲では見つかりませんでした。
記事数・公開本数と大量生成のスパムポリシー
公開本数をAIのKPIにすると、Googleのスパムポリシー「大量生成されたコンテンツの不正使用」に近づきます。
【公式仕様】Googleはこのポリシーを2024年3月5日に新設し、作り方を問わず(”no matter how it’s created”)対象にすると発表しました(Google検索セントラル ブログ(2024年3月5日)・2026年9月24日取得)。
【公式仕様】現行のスパムポリシーのページ(日本語版・最終更新2026年9月2日)は、大量生成されたコンテンツの不正使用を「ユーザーをサポートすることではなく、検索ランキングの操作を主な目的として大量のページを生成すること」と定義しています。該当例の1つ目は「生成 AI ツールまたはその他の同様のツールを使用して、ユーザーにとっての価値を付加することなく大量のページを生成すること」です(Google検索セントラル・2026年9月24日取得)。
【公式仕様】Googleは2023年2月の案内で、作り方より品質を評価するとしつつ、「検索結果のランキングを操作することを主な目的として」自動化を使えば違反だと書いています(Google検索セントラル ブログ・2026年9月24日取得)。公開本数で評価すると、指標が上がるほど違反の側へ寄ります。AI執筆の品質管理の基準は「WebのAI執筆比率は10%|コンテンツ品質管理の基準」にまとめています。
順位・表示回数・AI回答での引用
順位と表示回数は小さなクエリを増やすだけで上がることがあり、AI回答での引用は成約しない言及でも増えます。
表示回数は周辺語の解説ページを増やせば伸び、平均掲載順位は上位に入る小さなクエリが増えるか下位のクエリが外れるだけで良くなります。AI回答での引用も代理指標です。Search Engine Journalの記事は、引用の一部を毎月手で抜き取り、成約につながるページへ人を送っているかを確かめるよう勧めています(原文 “Check a sample of those citations by hand each month”)。測り方とツールのスコアの限界は「AI可視性とは?ツールのスコアが当てにならない理由」と「LLMO対策に効果はある?効く施策・効かない施策と測り方」で扱っています。
| 指標 | AIが選びうる近道 | 突き合わせる成果の指標 |
|---|---|---|
| 公開本数 | 価値を足さないページの量産 | 問い合わせ件数・Search Consoleの手動による対策の有無 |
| 表示回数 | 周辺語・用語解説のページを増やす | 問い合わせ件数と、増えたクエリの中身 |
| 平均掲載順位 | 小さなクエリで上位を取る・下位のクエリを外す | クリック数・問い合わせ件数 |
| CTR | 本文と合わないタイトルに変える | 問い合わせ件数・GA4のエンゲージメント率 |
| AI回答での引用 | 成約しない場所での言及を増やす | 引用元からの流入と問い合わせ(月1回手で確かめる) |
| CVR | 流入を絞って分母を小さくする | 問い合わせの件数(割合ではなく数) |
SEOのKPIを決める手順
成果の指標を先に決めて人が数え、代理指標はその成果と対にして読む順で決めます。
手順は次の5つです。4と5は後の章で説明します。
- KGIを決め、SEOが受け持つ成果の指標(問い合わせ件数など)を1つ選ぶ
- 成果の指標を、AIエージェントが触れない場所で人が数える
- 代理指標を成果の指標と対にして置く
- 過去の実測から正常範囲と止める規則を決め、月次で当てる
- AIエージェントに任せる前に、関所と権限を決める
成果の指標はAIが触れない場所で人が数える
問い合わせや受注の数は、AIエージェントが書き換えられない台帳や顧客管理の仕組みで、人が数えます。
エージェントが計測タグやGA4のキーイベントの設定を変えられると、成果の数え方ごと変わります。「エージェントが触れない成果」とは、この権限の外の置き場所のことです。数える人は件数だけでなく、営業につながったかという中身も見ます。
代理指標を対にして1つの数字で合否を決めない
順位が上がった月も問い合わせと並べて読み、1つの数字だけで良し悪しを決めません。
X上では、順位やアクセスは伸びたのに問い合わせが増えなかった、来ていたのは用語を調べる人だった、と書く投稿がありました(2026年8〜9月・当社が確認した範囲)。個人の観測で件数を数えたものではありませんが、代理指標だけで合否を決めたときに起きることと一致します。月次の報告では代理指標と成果の指標を同じ行に並べ、代理指標だけが上がった月は「近道の疑い」として次の章の点検に回します。
精度管理の考え方で月次の数字を点検する
検査の精度管理と同じく、正常範囲と止める規則を先に決めて、月次の数字に当てます。
臨床検査では、濃度が分かっている管理試料を毎日測り、正常範囲から外れたら結果を出す前に人が止めて原因を調べます。この型をSEOに当てはめたのが当社の月次点検です。精度管理の考え方でSEOのデータを読む方法は「臨床検査技師が解剖するSEOデータ分析」で詳しく書いています。
正常範囲(管理限界)と止める規則を先に決める
過去の月次の平均とばらつきから正常範囲を決め、外れたら人が止めて確かめる規則を先に書きます。
【公式仕様】精度管理で使われるウエストガードの多重規則は、平均±2SD(標準偏差の2倍)を超えたら「注意深く調べる合図となる警告」とし、1回でも±3SDを超えたら、その回の結果を棄却します(原文 “A run is rejected when a single control measurement exceeds the mean plus 3s or the mean minus 3s”)。同じ側で2SDを2回続けて超えたときと、平均の片側に10回続けて並んだときも棄却します(Westgard QC「Westgard Rules」・2026年9月24日取得)。
SEOでは、過去12か月のクリック数や問い合わせ件数から平均とばらつきを出し、±2SDを「調べる」、±3SDを「止める」に当てます。季節の波があるので前年同月とも並べ、「片側に10回」は週次の数字で見ます。業種ごとの減り方の基準線は「検索流入の減少は業種で−6.8%〜−47.3%」で扱っています。
異常は複数の指標で突き合わせる
1つの指標が外れたら、対になる成果の指標とSearch Consoleの別の数字を並べて、原因を切り分けます。
クリック数が−2SDを下回った月は、表示回数ごと減ったなら掲載の問題、表示回数が保たれてCTRだけ落ちたなら検索結果での見え方の問題と切り分けます。
当社の事例では、リライトの優先度をSearch Consoleの数字(現在の順位×表示回数)だけで機械的に採点していたため、Googleの順位が測れない記事を「優先度が低い」に沈めていたのです。当社の5サイトで直近365日のGA4の全チャネルのセッションを実測すると、順位が測れない記事が占める割合はサイトごとに15.7〜58.2%で、アイダイムでは20.8%でした。2026年9月20日に、GA4のセッションが30以上ある記事は機械で採点しない補正を入れました。ただしこの補正は低く沈めるのを止めるだけで、優先度を上げるものではありません。
| 点検項目 | 見る数字 | 調べる・止める目安 | 突き合わせる数字 |
|---|---|---|---|
| 問い合わせ | 人が台帳で数えた件数と中身 | −2SDで調べる・−3SDで止める | クリック数・フォームの動作 |
| クリック数 | Search Console | ±2SDで調べる・±3SDで止める | 表示回数・CTR・平均掲載順位 |
| 表示回数 | Search Console | 上に外れても調べる | 増えたクエリ・問い合わせ |
| 平均掲載順位 | Search Console | 急に良くなった月も調べる | クエリの数・クリック数 |
| 公開本数 | 管理画面 | 月の上限を超えたら止める | 1本あたりのクリック数 |
| AI回答での引用 | 月1回、手で抜き取る | 引用元からの流入が0なら調べる | 引用されたページの問い合わせ |
| エージェントの権限 | 操作の記録 | 下書き以外の操作で止める | 公開・テンプレート変更の履歴 |
AIエージェントに任せる前に置く関所
任せる前に設計前・試行前・拡大前の3回確認し、権限は下書きまでに絞り、ツールは自社のクエリで比べます。
MIT Sloanの記事(2026年8月3日)で、MITのジョージ・ウェスターマンは「統治はハンドルか、それともブレーキか」と問いかけています(原文 “Is your governance more the steering wheel or is it more the brakes?”)。ウェスターマンは、AIの試行のうち70〜95%が全社展開に至らないとも述べています(原文 “Somewhere between 70% and 95% of AI pilots don’t actually make it to scale in organizations.”・MIT Sloan「6 questions to guide your AI strategy」・2026年9月24日取得)。記事の中で調査名は示されていません。
設計前・試行前・拡大前に確認し、権限は下書きまでに絞る
HCA Healthcareの例にならい、作る前・試す前・広げる前に確認し、エージェントの権限は下書きまでにします。
同じ記事によると、米国の病院グループHCA Healthcareは、AIのリスク・事業性・実現性を、作る前・少数の病院で試す前・広げる前の3回確認し、その後も定期的に点検しています。Search Engine Journalの記事はこれをSEOに移し、試行を1つのディレクトリに絞り、終了条件を先に決め、権限を狭くするよう勧めています(原文 “keep agent permissions narrow, so drafting doesn’t quietly turn into publishing or editing templates”)。
【公式報告】上のHugging Face事件について、OpenAIは評価を「当社が外部向けにデプロイしているシステムと同じ水準の安全対策は有効にしていません」状態で実施していたと書き、対策として「隔離性の高いサンドボックス環境の整備、インターネットアクセスの制限、モデルの重みへのアクセス管理の強化」を挙げています(OpenAI・2026年9月24日取得)。AIで改修したサイトの点検は「バイブコーディングでSEOを壊さない検証手順」にまとめています。
| 関所 | 確認すること | 先に進めない条件 |
|---|---|---|
| 設計前 | KGIと成果の指標の数え方・代理指標の対・エージェントの権限 | 成果を人が数える場所が決まっていない |
| 試行前 | 試す範囲(1ディレクトリなど)・終了条件・正常範囲と止める規則 | 終了条件が決まっていない |
| 拡大前 | 試行で成果の指標が動いたか・止める規則に触れた回数 | 代理指標だけが動いた |
| 定期(月次) | 月次点検表の全項目 | 止める規則に触れた項目が残っている |
ツールは公開スコアではなく自社のクエリで試す
AIツールは公開のベンチマークの点数ではなく、自社のSearch Consoleのクエリを使った目隠しの比較で選びます。
AIのベンチマーク(評価用の問題集)の点数も代理指標です。【研究】AI Index 2026は、スタンフォードの研究者が広く使われる9つのベンチマークで無効な問題を調べ、その割合がMMLU Mathの2%からGSM8Kの42%まであったと書いています。この数字は、怪しいとして抽出した上位50問のうち無効だった割合(Precision@50)で、問題集全体の誤りの割合ではありません(出典 Truong et al., 2025)。Arenaの順位は評価の場への適応を一部反映している可能性も挙げています(Stanford HAI「AI Index 2026 Technical Performance」・2026年9月24日取得)。
【研究】同じ報告では、プログラミングの代表的なベンチマークSWE-bench Verifiedの成績が、1年で60%からほぼ100%に上がりました(原文 “rose from 60% to near 100% in a single year”)。点数が上限に近づくと、差は点数では見えません。Search Engine Journalの記事は、Search Consoleの実際のクエリで候補のツールを自社のページに走らせ、どのツールの結果かを伏せて編集者が採点し、四半期ごとに繰り返す方法を勧めています(原文 “have an editor grade the results without knowing which tool produced them. Repeat it every quarter”)。
SEOのKPIとAIでよくある質問
検索で調べられている6つの疑問に、この記事で確認した公式資料の範囲で答えます。
Q. SEOのKPIは順位と流入のどちらを置くべきですか?
A. どちらか1つではなく、成果の指標(問い合わせ件数など)を先に置き、順位と流入はその対として置きます。順位はクエリの組み合わせで動き、流入は用語を調べる人でも増えるためです。
Q. 平均掲載順位が上がったのに、流入が減るのはなぜですか?
A. 平均掲載順位は各クエリの最上位の位置の平均なので、下位のクエリが外れると平均は良くなり、表示回数とクリック数は減ります。順位はクリック数と並べて読みます。
Q. AIで記事を量産すると、Googleのポリシー違反になりますか?
A. AIを使うこと自体は違反ではなく、Googleは作り方より品質を評価するとしています。ただし、検索順位の操作を主な目的に、価値を足さずに多数のページを生成すると「大量生成されたコンテンツの不正使用」に当たります。
Q. AI回答での引用数は、KPIにしてよいですか?
A. 代理指標の1つとしては置けますが、単独のKPIにはしません。引用は成約につながらない場所でも増えるためです。月1回、引用を手で抜き取って確かめます。
Q. グッドハートの法則を避ける方法はありますか?
A. 1つの数字だけを目標にしないことです。代理指標を成果の指標と対にし、正常範囲と止める規則を先に決めておくと、数字だけが上がった月に気づけます。
Q. 小さな会社でも、AIに任せる前の関所は必要ですか?
A. 必要です。任せた作業を毎日見る人がいないなら、なおさら先に止める仕組みが要ります。権限を下書きまでに絞る、試す範囲を1つのディレクトリにする、終了条件を先に決める、の3つから始められます。
参考情報
出典はいずれも2026年9月24日に取得しました。

