FIELD SURVEY / 2026-08-07
AIクローラの許可・不許可は robots.txt に書きます。しかし実際にアクセスを止めているのは、サーバー本体・WAF・CDN・レンタルサーバーの管理画面・セキュリティ系プラグインなど、robots.txt とはまったく別の場所です。両者は簡単に食い違います。
この食い違いは、当事者からは見えません。robots.txt には「許可」と書いてあるからです。そして robots.txt の記述だけを読むチェックツールも、「許可されています」と表示します。
調査のきっかけは、実施者である株式会社SAL自身の事故でした。自社サイトの robots.txt には GPTBot を明示的に許可すると書いてありましたが、サーバーは GPTBot に対して 403 を返していました。「許可」と書いた宣言を、当の相手が読むことすらできない状態です。これがどの程度一般的なのかを知るために、母集団で測りました。
103のドメインに対し、次の手順を自動で実行しました。
bare と www. のどちらで配信されているかを自動判定する(日本の企業サイトは www. のみで配信されるものが多く、これを外すと単なる名前解決の失敗を「遮断」と誤認する)検査した6種類は、学習用として GPTBot・ClaudeBot・CCBot、検索/引用用として OAI-SearchBot・PerplexityBot、そして対照群として Googlebot です。Googlebot を混ぜたのは、「AIクローラだけが狙って止められているのか」「自動アクセス全般が止められているのか」を切り分けるためです。
集計の元になったデータは匿名化して公開しています。本レポートに載せた数字は、そのファイルだけで再計算できます。
| 判定 | 件数 |
|---|---|
| すべてのAIクローラが通過 | 73 |
| 食い違い(robots.txtで禁止していない/サーバーは拒否) | 9 |
| 一部のAIクローラを判定できず(レート制限・無応答) | 3 |
| 拒否しているが robots.txt の記述と一致(意図的) | 1 |
| 計測不能(通常のブラウザでも到達できず) | 17 |
| 合計 | 103 |
個別の社名は公開しません。外側からの計測では意図的な遮断と設定事故を区別できないためです。業種カテゴリ単位で示します。
| 業種 | 該当/計測成立 |
|---|---|
| UGC・技術系メディア | 2 / 5 |
| 製造(大手) | 2 / 13 |
| SEO・GEO支援会社 | 1 / 10 |
| IT・専門メディア | 1 / 6 |
| 人材 | 1 / 5 |
| 不動産 | 1 / 5 |
| 小売・EC | 1 / 5 |
9社のうち6社は、学習用クローラだけを拒否していました。UGC・技術系メディアで比率が高いことから、コンテンツを学習に使われることへの防御として意図的に行っている例が相当数含まれると考えられます。合理的な判断です。ただしその意図が robots.txt に書かれていないため、外からは事故と区別がつきません。
残る3社は、AIクローラも Googlebot も含めて自動アクセスを広く拒否していました。このうち1社は、無名のUser-Agentは通過するのに GPTBot と Googlebot を名乗ったときだけ拒否されました。既知のボット名を文字列で見て弾いているということです。
GPTBot のUser-Agentで /robots.txt を取得しようとすると拒否される企業が6社ありました。許可も拒否も、書いてある内容を相手が読めません。
robots.txt にAIクローラを名指しした記述がある企業は、11.6%しかありませんでした。
当初の関心は「宣言と実装の食い違い」でしたが、実際にはそもそも宣言が存在しない企業が約8割を占めました。食い違い以前に、判断材料がありません。
実態を分けると、こうなります。
| 状態 | 割合 |
|---|---|
| AIクローラを名指しして robots.txt に書いている | 11.6% |
| robots.txt と実際の挙動が食い違っている | 10.5% |
| AIクローラを名指しした記述が確認できなかった | 約78% |
最後の層で今アクセスが通っているとしたら、それは意図ではなく偶然です。そしてAIクローラの名前は四半期ごとに増えています。数年前の設定は、今はもう不完全です。
「AIに学習されたくない」という理由で一括遮断すると、AI検索に引用される経路まで同時に塞ぐことがあります。目的が違うためです。
| 種類 | 代表例 | 止めると起きること |
|---|---|---|
| 学習用 | GPTBot / ClaudeBot / CCBot / Google-Extended | AIモデルの知識に自社が入らない |
| 検索・引用用 | OAI-SearchBot / Claude-SearchBot / PerplexityBot | AIの回答で出典として引用されない |
| 実時間取得 | ChatGPT-User / Perplexity-User / Claude-User | 利用者がリンクを開いても中身を読めない |
有料コンテンツを持つメディアが学習用だけを拒否するのは合理的です。一方、発見されたいB2B企業が学習用も検索用も一括で塞いでいるなら、それはたいてい意図ではありません。
robots.txt を書き換えても直りません。止めているのは robots.txt ではないからです。次の順に確認してください。
.htaccess や nginx の設定でUser-Agent判定が書かれていることがあります直したあとは、robots.txt に意思を明記してください。書いていなければ、次に設定を触る人(自社の担当者とは限りません)が同じことを繰り返します。
# AI検索に引用されたい場合の記述例 User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: /
数字を使う前に、次の4点を必ず併せてご確認ください。
確定させるには、サーバーやCDNのアクセスログで、実際のクローラのIPアドレスからのアクセスにどのステータスを返しているかを照合します。そこまでやって初めて「読まれていない」と言えます。
記事でお使いいただけます。許諾の申請は不要です。出典として 「株式会社SAL調べ(2026年8月7日)」 と、下記のURLを併記してください。
推奨引用URL:https://aio.sal.ne.jp/report/ai-crawler-japan-2026/
いずれも母数・調査日・標本の性質・限界を含んだ完成文です。切り出して短くすると不正確になります。
① 株式会社SALが2026年8月7日、日本の主要103サイト(便宜標本)へ6種類のクローラのUser-Agentを名乗って接続したところ、計測が成立した86サイトのうち9サイト(10.5%)で、robots.txtがそのクローラによるトップページ取得を禁じていないにもかかわらず、拒否を示すHTTPステータスが返された。
② 同調査では、robots.txtにAIクローラを名指しした記述がある企業は86サイト中10サイト(11.6%)だった。残る約8割については、AIクローラを許可する意思も拒否する意思も読み取れなかった。
③ 同調査は外部からUser-Agentを名乗って接続した外形計測であり、IPアドレスで本物のクローラだけを許可している設定は判別できない。同社は「確定にはサーバーログの照合が必要」としている。
| 種類 | 内容 |
|---|---|
| 集計用データ(CSV) | 103件全件。業種カテゴリ、判定、6クローラ別のHTTPステータスと再検査結果、robots.txtの解析結果。本レポートの数字はこのファイルだけで再計算できます |
| 図版(PNG/1200×630) | 主要な数字をまとめた画像 |
| 検査ツール | 同じ検査を任意のドメインに対して実行できます(無料・登録不要) |
社名は公開していません。外形計測では意図的な遮断と設定事故を区別できず、個社を名指しすると事故と断定したのと同じ受け取られ方をするためです。CSVも業種カテゴリ単位に匿名化しています。
取材・データに関するお問い合わせは 株式会社SAL へ。
2026-08-08:集計方法の誤りを修正し、主要な数字を下方修正しました。初版(同日公開)の数字を引用済みの場合は、お手数ですが差し替えをお願いします。
初版の集計プログラムには、判定として扱うべきでない応答を拒否・通過に振り分けてしまう誤りが2つありました。第三者レビューで指摘を受け、同じ生データを正しい分類で集計し直しています。新たに計測をやり直したものではなく、2026年8月7日に記録した応答そのものは変わっていません。
| 項目 | 初版 | 修正後 |
|---|---|---|
| 禁止記述がないのに拒否 | 10社(11.6%) | 9社(10.5%) |
| うちUser-Agent判定と確認できた社数 | 8社 | 6社 |
| うち学習用クローラだけを拒否 | 7社 | 6社 |
| すべてのAIクローラが通過 | 75社 | 73社 |
| 一部のAIクローラを判定できず | — | 3社 |
| robots.txtにAIクローラを名指し | 10社(11.6%) | 10社(11.6%)変更なし |
| robots.txtが無い、または空 | 24社(27.9%) | 24社(27.9%)変更なし |
いずれも「測れなかったものを、測れたことにしていた」誤りです。修正後は拒否・通過のどちらにも数えない第3の区分を設けました。同じ誤りが起きないよう、公開する数字はデータファイルから再計算して一致を確認しない限り書き出せないようにしています。
なお、この修正は拒否の過大計上を取り除く方向にのみ効きます。初版の記録には本文が残っていないため、200を返しながら実際には確認ページを出していたサイト(ソフトブロック)は、遡って検出できていません。実際の該当社数は9社より多い可能性があります。