← ブログ

GoogleはAIコンテンツにペナルティを科すのか?情報源の検証

Googleは、AIが作成に関わったというだけでコンテンツを禁止してはいません。公開されているガイダンスはAIの適切な利用を認め、有用で独自性のあるコンテンツを重視しており、スパムポリシーは大量生成コンテンツの不正使用を禁じています。このポリシーから、検索内部のあらゆる検出手法が分かるわけではありません。商用の検出ツールのスコアをGoogleのランキング判定として扱うのではなく、正確さ、根拠、読者にとっての価値で記事を評価してください。

Googleで優先ソースとして追加

関連する当社記事をより多く検索体験に表示する、無料のGoogle設定です。いつでも変更できます。

多くのマーケターに「GoogleはAIコンテンツにペナルティを科すか」と聞くと、自信満々に「はい」と返ってきます。その根拠を尋ねると、ブログ記事が別のブログ記事を引用する連鎖をたどって、2024年3月の発表に行き着きます。しかしその発表は、引用されている内容とは正反対のことを述べています。

AI生成コンテンツについてGoogle自身が公開している見解

当社は一次情報を読みました。Googleのスパムポリシーのページ、182ページに及ぶ検索品質評価ガイドライン(Search Quality Rater Guidelines)、大量生成コンテンツの不正使用に関する発表、そして査読済みの検出研究です。答えは世間の議論が示すよりも明快で、取り組むべき仕事をより有益な場所へと移してくれます。

要点

  • Googleの評価者向けガイドラインは、AIが関与したかどうかを判断せずにページを評価するよう、人間の評価者に明示的に指示しています。セクション4.6.5は、価値の低い大量生成コンテンツを「作成方法が分からない場合でも」Lowestと評価するよう求めています。
  • Googleの公開されているAIコンテンツに関するガイダンスは、適切な利用を認めています。付加価値のないページを大量に作ることは、それでもスパムポリシー違反になり得ます。
  • 上位表示されるページの86.5%に何らかのAI生成テキストが含まれており、AIの比率と掲載順位の相関は0.011です。60万ページにわたって、実質的にゼロです。
  • AI検出ツールもこの問題に決着をつけられません。7つのツールが、英語を母語としない人の作文を平均**61.22%**の割合で誤ってAIと判定し、言い換えによって検出率は70%から5%未満に下がります。
  • テキストの透かし(ウォーターマーク)はすでに存在します。Geminiには2024年から、Claudeには2026年8月14日から入っています。その印を読めるのはテキストを生成したプロバイダーだけで、Googleの検索での検証対象は画像、音声、動画であり、ランキングへの利用は公表されていません。
  • 本当に重要な基準は人間です。大規模言語モデル(LLM)を頻繁に使う5人が合議で判定したところ、300本中299本の記事を正しく分類しました。彼らが挙げた手がかりは語彙ではなく、独自性でした。

Google自身の文書が述べていること

まず、最も強力でありながらほとんど誰も引用しない証拠から始めましょう。検索品質評価ガイドラインです。これは、検索結果を評価する人間にGoogleが与えている指示書です。評価者はどのクローラーよりも1ページあたりにはるかに長い時間をかけられますが、出自を突き止める必要はないと指示されています。

2025年9月11日版のセクション4.6.5より:

「ユーザーにとって独自のコンテンツや付加価値がない、大量に作成されたコンテンツで構成されたページやウェブサイトは、作成方法にかかわらずLowestと評価すべきです。作成方法が分からない場合、たとえばページが生成AIツールで作成されたかどうか分からない場合でも、大量生成コンテンツの不正使用が強く疑われるときはLowestの評価を付けるべきです。」

セクション4.6.6も同じく率直です。「生成AIツールを使ったことだけでは、労力の程度やページ品質の評価は決まりません。」

これは品質評価のための指示です。評価者は、出自を判断しなくても、価値の低い大量生成コンテンツを評価できます。Googleの自動システムがどの内部シグナルを使っているかを教えてくれるものではありません。

Googleのスパムポリシーは、大量生成コンテンツの不正使用、クローキング、誘導ページ、その他の操作的な手法を扱っています。大量生成コンテンツのセクションには、生成AIを使って付加価値のないページを大量に作ることが含まれています。AIコンテンツに関するガイダンスは、適切な利用と、主にランキング操作を目的として生成されたコンテンツとを区別しています。

「付加価値のない」より前の言葉は、思っているほど重みを持っていません。違反とされているのは、量と中身のなさです。

そして、AIへの取り締まりとして通常引用される2024年3月の発表そのものがあります。そこでは「作成方法にかかわらず」と2回述べられています。同じ投稿にあるGoogle自身のFAQは、ポリシーが書き直された理由をこう説明しています。

「低品質なコンテンツが純粋に自動化によって作られたのかどうかが必ずしも明らかでない、より高度な大量生成の手法に対応するために、範囲を拡大しました。」

これは、ポリシーが制作方法にかかわらず不正使用を対象とする理由を説明しています。Googleに検出能力がないことや、AIを活用したコンテンツがすべて上位表示されることの証拠ではありません。

いずれにせよ、評価者のスコアはランキングに直接影響しません。有用なコンテンツに関するGoogleのドキュメントは、「評価者のデータはランキングアルゴリズムで直接使用されません」とはっきり述べています。

ランキングデータが示すこと

大規模な研究が2つあり、その結論は食い違っています。この食い違いこそが、この分野全体で最も有益な発見であることが分かります。

研究サンプル結果
Ahrefs、2025年7月60万ページ、上位20件、10万キーワード上位表示ページの86.5%に何らかのAIコンテンツが含まれる。AIの比率と順位の相関:0.011
Ahrefs、2026年7月100万ページ、10万件の検索上位3件の5.3%が100% AI。平均AIスコアは1位の27.1%から10位の30.9%へわずかに上がるだけ
Semrush、2026年4月4万2,000のブログページ、検出ツールはGPTZero1位は80.5%が人間、10%がAI。人間のコンテンツは1位に「8倍なりやすい」

どちらかの側につくのは当て推量です。2つの研究は、異なる検出ツール、異なる測定単位、異なるコーパスを使いました。Ahrefsは上位10件すべてについて、AIテキストの割合でページを採点しました。SemrushはブログページだけにGPTZeroをかけ、文書単位のラベルを採用しました。

つまり、検索結果に占めるAIコンテンツの比率の測定値は、どの検出ツールを向けるかに大きく左右されます。これは検出ツールについての事実であり、Googleについての事実ではありません。

Ahrefs自身も自社の研究についてそう述べています。「私たちのAIコンテンツ検出の方法は、Googleの方法とは異なるでしょう。」100万ページを調べた後の結論はさらに率直でした。「GoogleはAIコンテンツに反対しているのではなく、悪いコンテンツに反対しているのです。」

有用なコンテンツに関するGoogle検索セントラルのガイダンス。この問題に関する一次情報

検出ツールで決着がつかない理由

  • 英語を母語としない人の文章では大きく失敗します。 TOEFL(Test of English as a Foreign Language)の作文91本で7つの検出ツールをテストしたところ、平均**偽陽性率は61.22%**で、7つすべてが一致して19.78%を誤分類しました。同じ検出ツールは、米国の中学2年生の作文ではほぼ完璧でした。Cell Pressの学術誌Patternsに掲載されています。
  • 幅広く失敗します。 14のツールを対象にした独立したベンチマークでは、すべてが正解率80%を下回り、機械で言い換えたAIテキストが検出されたのは26%にとどまりました。
  • 些細な変更で崩れます。 偽陽性率を固定した条件で、言い換えによってある検出ツールの検出率は70.3%から4.6%に下がりました。620万件の生成を対象としたベンチマークでは、モデルのサンプリング設定を変えるだけで、主要な検出ツール2つの検出率が100%からほぼゼロになりました。
  • 証明された上限があります。 Transactions on Machine Learning Research(TMLR)に掲載された論文は、あらゆる検出ツールの達成可能な最高精度を、人間のテキストと機械のテキストの分布がどれだけ重なるかに結び付ける厳密な上限を導いています。モデルが向上するほど、この上限は誰にとっても厳しくなります。
  • ベンダー自身も分かっています。 OpenAIは2023年7月に自社の分類器を取り下げ、真陽性率26%、偽陽性率9%という数字を公表しました。Turnitinの最高製品責任者は、ローンチから数か月で「当初主張していたよりも偽陽性率が高い」ことを認めました。

検出ツールが頼りにしている言語的な特徴は、人間の文章にも染み出しています。82万4,634エピソード、73万7,083時間分の台本なしのポッドキャスト音声を調べた研究(Yakuraら、2024年9月に初公開)は、ChatGPT以降、まさに検出ツールが目印にする単語(“delve”“showcase”“boast”“intricacies”“meticulous”)が急増したことを明らかにしました。2026年に“delve”という単語を探す検出ツールは、チャットボットと話す人間を部分的に検出しているのです。

2026年9月時点のテキスト透かしの状況

「検出ツールにかけてみればいい」に代わって出てくる反論は「Googleが透かしを入れている」なので、2026年9月13日時点の記録を示します。

GoogleのSynthIDは2024年からGeminiのテキストに印を付けています。2026年8月14日、Anthropicは、EUのAI法第50条に対応するため、APIを含むすべての提供形態で、オプトアウトなしに、SynthID-Textをベースにした透かしをClaudeの出力に埋め込み始めました。Anthropic自身の説明によると、軽い編集では印が残りやすく、全面的な書き直しでは消え、短い文章は検出に必要なシグナルが少なすぎます。OpenAIは画像と音声にSynthIDを適用していますが、テキストについてのシグナルは挙げていません。

3つの事実が、この話をランキングの議論から切り離しています。テキストの透かしは、それを生成した鍵がなければ読めず、Anthropicの検出ツールは規制当局、メディア、研究者向けの非公開プレビューです。2026年5月19日に発表されたGoogleの検索とChromeにおけるSynthIDの検証は、画像、音声、動画について「これはAIで生成されたか」に答えるものです。そしてGoogleは、透かしとランキングを結び付けるものを何も公表していません。上で引用した評価者向けの指示は、今も自社の評価者に、ページを「作成方法にかかわらず」判断するよう求めています。

透かしの時代が変えるのは、次の2つのセクションの助言がどれだけ長く有効であり続けるかです。モデルによる言い換えしか中身のないページは、プロバイダーの協力があれば、いずれそうだと識別できるようになり、法律は今やその協力が可能であることを求めています。どのモデルも生み出していない数字、テスト、調査の上に築かれたページは、どのツールが文章を打ったかにかかわらず価値を保ちます。

Googleのスパムポリシー。対象はAIによる執筆ではなく大量生成コンテンツの不正使用

実際にコンテンツが抑制される原因

3つあります。そのどれも、誰が書いたかではありません。

1. 価値のない量産。 2024年にインデックスから削除されたサイトには共通の形があり、それは見分けがつきます。1つのディレクトリにほぼ同一のURLが何百も並ぶ。「他の人はこちらも質問」の質問をそのまま見出しにする。まとまりのない断片をつなぎ合わせる。隠しディレクトリ。お金や健康に関わるテーマでの匿名の執筆。記録に残る事例の1つでは、誰にも見つけられないはずのディレクトリに約500万のURLがありました。人間が書いたコンテンツでも、この形で公開すれば同じ結果になります。

2. 劣化。 16か月にわたる対照実験で、リンクも更新もない20の新しいドメインに、編集していないAI記事2,000本を公開しました。71%が36日以内にインデックスされ、上位100位以内への掲載率は約28%でピークを迎えました。3か月目には**3%**まで落ち込みました。ペナルティは一度も科されていません。ページが単に表示する価値のないものになったのです。

3. 読者。 これが本当の基準であり、どのアルゴリズムよりも高いものです。LLMを頻繁に使う5人のアノテーターが合議で判定したところ、300本中299本の記事を正しく分類しました。言い換えに対しても、テストしたすべての商用「ヒューマナイザー」ツールに対しても、精度は保たれました。何に気づいたかを尋ねると、彼らが挙げたのは単語ではなく、堅苦しさ、明快さ、そして独自性でした。

最後の1つがすべてです。独自性は文章の性質ではなく、情報の性質だからです。どんなプロンプトも、サンプリング設定も、編集の繰り返しも、まだ存在しない事実を生み出すことはできません。購入者が記事を読んで、上位3件の結果を手際よく言い直したものだと気づけば、どのツールも測れない次元で負けたことになります。

代わりにやるべきこと

何を改善するかを決めるには、Googleが公開している品質とスパムに関するガイダンスを使ってください。商用の検出ツールのスコアでは、その記事が読者の疑問にきちんと答えているかは分かりません。

ウェブにまだないものをページに載せてください。 自社アカウントの独自の数字。実際にやってみて、何が起きたかを記録した実体験のテスト。その仕事をした本人へのインタビュー。一次情報を独自に読み込み、よくある要約がどこで間違っていたかを報告すること。記事にそのどれもなければ、どれだけ磨いても超えられない天井があります。

根拠を確認しやすくしてください。 2万1,143件の引用を調べた2026年の観察研究では、統計、定義、比較を含むページで、情報源としての影響度の平均スコアが高いことが分かりました。ただし、それらの要素を加えることが引用の増加をもたらすかどうかは検証していません。統計は、読者の疑問に答えるから使うのであり、出典も説明してください。

価格も同じ理由で役に立ちます。購入者は、その選択肢が自分に合うかを知る必要があるからです。6つのモデルを対象にした別の実験では、25万2,000回の試行で価格と新しさへの強い選好が見られましたが、各試行で提示されたのは、挿入され匿名化された情報源文書のちょうど2つでした。これは管理された選択肢の間での最初の引用の選好を試したものであり、実運用の検索エンジンがあなたのサイトを見つけたり引用したりするかどうかを試したものではありません。可能なら正確な価格を公開し、ただしこの結果を効果の約束に変えないでください。

努力に見えて実は努力ではない2つのことはやめましょう。 商用のヒューマナイザーツールは、テストした19製品全体で74%の確率で、手を加えていないAIの原文との流暢さの比較に負け、しかもその過程で架空の引用を持ち込みます。そして、自分の下書きに「これを良くして」というループをかけないでください。LLMによる評価は予測しやすい文章を系統的に過大評価するからです。繰り返すたびに、評価役は改善したと報告する一方で、文章はより機械的に聞こえるようになります。

画像にも同じ区別が当てはまります。 3語のプロンプトから作った汎用的な画像は、3語のプロンプトから作った記事と同じくらい安っぽく見え、どんなフィルターやアップスケールでも救えません。技術はブリーフにあります。品質を表す形容詞を末尾に積み重ねるのではなく、被写体、光、レンズ、制約を指定してください。当社のGemini画像プロンプトと目を引くビジュアルのためのChatGPTプロンプトのガイドはどちらもそのように作られており、この構造は2つのモデルの間でそのまま使えます。

これに近いことは、当社のドメインで測ることができます。2026年7月27日までの1週間で、ChatGPTのフェッチャーはstrataigize.comに2,370件のリクエストを送り、Googlebotは1,390件でした。このウェブサイトがこれまでに生んだ2社だけの顧客は、どちらもAIの回答経由で来ており、合計で$215,603の価値がありました。それは巧妙なマークアップのあるページではなく、独自データのあるページで起きました。その回答があなたのブランドを挙げるかどうかが問題なら、それは生成エンジン最適化の仕事です。

問われていたのは常に、読んだ人が何かを学べるかどうかであり、機械が執筆を手伝ったかどうかではありませんでした。

出典

お問い合わせ

それを運用するチームと話す

どこを見るべきか教えてください。24時間以内に着手点をお返事します。価値が見えるまで売り込みはありません。

お問い合わせについてTeeganがメールでご連絡します。いつでも配信停止できます。プライバシー

まず話したいですか? 30分の通話を予約。

Googleで優先ソースとして追加

関連する当社記事をより多く検索体験に表示する、無料のGoogle設定です。いつでも変更できます。

私たちにお任せください

無料の30分相談をご予約ください。価値を確認するまでピッチはありません。

グロース相談を予約 → 評価 5.0 (Clutch)