株式会社SAL / AI検索最適化 無料・登録不要

AI CRAWLER REACHABILITY TEST

robots.txt に「許可」と書いてあっても、
サーバーが拒否していることがあります。

AIクローラ到達性チェックとは、ChatGPTやGeminiのクローラを名乗って実際にサイトへ接続し、返ってきた応答を確認する検査です。robots.txt の記述を読むのではなく、サーバーが本当に応答しているかを見ます。両者はしばしば食い違います。

READY 6 CRAWLERS / ROBOTS.TXT

対象サイトへ十数回の通常のアクセスを行います。ご自身が管理するサイト、または調査の許可があるサイトでご利用ください。結果は5分間保持されます。

01 / 問題

なぜ robots.txt を見るだけでは足りないのか

AIクローラの許可・不許可は robots.txt に書きます。しかし実際にアクセスを止めているのは、サーバー本体・WAF・CDN・レンタルサーバーの管理画面・セキュリティ系プラグインなどまったく別の場所であることが多く、両者は簡単に食い違います。

しかも設定は、自分以外の手で変わります。制作会社のサイト改修、プラグインの更新、サーバー移転、CDNの設定変更。一度直しても、また壊れます。

robots.txt の記述だけを読むチェックツールは、この食い違いを「許可されています」と表示します。実際にはAIから一行も読まれていない場合でも、です。

02 / 実測データ

日本の主要103サイトを実測しました

2026年8月7日、製造・SaaS・人材・金融・報道・EC など103サイトに対し、6種類のクローラを名乗って実際に接続し、応答を記録しました。

86
計測が成立したサイト数(103社中)
11.6%
robots.txt では許可なのに
サーバーが拒否していた
11.6%
robots.txt にAIクローラのことを
一行でも書いていた企業
27.9%
robots.txt が無い、または空

食い違いが見つかった10社のうち8社では、Googlebot は通過しているのにAIクローラだけが拒否されていました。User-Agent の文字列を見て判定しているということです。本物のAIクローラも同じ名前を送るため、同じように拒否されます。

もうひとつの数字のほうが重要かもしれません。robots.txt にAIクローラのことを書いている企業は11.6%しかありません。残る約8割は、許可も拒否も決めていない。今アクセスできているとしたら、それは意図ではなく偶然です。

調査レポート全文を読む(調査方法・業種別内訳・修正手順・限界)→

03 / 前提知識

クローラには3つの種類があり、混同すると事故になります

「AIに学習されたくない」という理由で一括遮断すると、AI検索に引用される経路まで同時に塞ぐことがあります。この3つは目的が違います。

種類代表例止めると何が起きるか
学習用GPTBot / ClaudeBot / CCBotAIモデルの知識に自社が入らなくなる
検索・引用用OAI-SearchBot / PerplexityBotAIの回答で出典として引用されなくなる
実時間取得ChatGPT-User / Perplexity-User利用者がリンクを開いても中身を読めない

本ツールは、この3分類のうち学習用3種と検索用2種、そして対照群として Googlebot の計6種を検査します。Googlebot を対照に置くのは、「AIクローラだけが狙って止められているのか」「自動アクセス全般が止められているのか」を切り分けるためです。

04 / この検査の限界

わかること、わからないこと

この検査は、外側から User-Agent を名乗り分けて接続したものです。したがってIPアドレスで本物のクローラだけを許可している設定は、見分けられません。「遮断の疑いあり」は確定診断ではなく、サーバーログでの確認が必要な状態を指します。

確定させるには、サーバーやCDNのアクセスログを見て、実際のクローラのIPアドレスからのアクセスにどのステータスを返しているかを照合する必要があります。そこまでやって初めて「読まれていない」と言えます。本ツールが「読まれていません」と断定しないのは、そのためです。

05 / よくある質問

よくある質問

費用はかかりますか
かかりません。登録も不要です。結果はその場で表示されます。
「遮断の疑いあり」と出たら、まず何をすればよいですか
サーバーやCDNの設定を確認してください。レンタルサーバーの管理画面に「AIクローラーを制限する」といった項目があることが多く、そこが有効になっているのが典型的な原因です。次にWAF、CDN、セキュリティ系プラグインの順に見ます。robots.txt を書き換えても直りません。止めているのは robots.txt ではないからです。
この結果は確定診断ですか
いいえ。外部からUser-Agentを名乗って接続した結果であり、IPアドレスで本物のクローラだけを許可している設定は見分けられません。確定にはサーバーログでの照合が必要です。
AIクローラは全部許可したほうがよいのですか
一概には言えません。有料コンテンツを持つメディアが学習用クローラを拒否するのは合理的な判断です。重要なのは、決めていることと、決めた通りに動いていることの2つです。実測した86社のうち、robots.txt に何らかの意思表示をしていた企業は11.6%でした。
検査対象のサイトに負荷はかかりますか
1回の検査で十数回のアクセスを行います。通常の閲覧1回分と同程度です。同一ドメインの結果は5分間保持し、その間は再接続しません。

ログまで見て、確定させたい場合

「遮断の疑いあり」が出た理由を確定させるには、サーバーやCDNのアクセスログで、実際のクローラIPからのアクセスにどう応答しているかを照合します。株式会社SALでは、この確定診断と修正までをご相談いただけます。

相談する →

SNS運用支援・Web戦略設計/制作・remodooo! / 東京都品川区東五反田