Skip to content

Which sites block AI crawlers

We read robots.txt on 200 of the most visited sites on the web and recorded which AI crawlers each one disallows. Every page publishes the rule responsible and the date it was taken, so any of it can be checked in a few seconds.

The distinction that matters throughout: blocking a training crawler keeps a site out of the models. Blocking a search crawler affects whether an assistant can cite it. 40 of these sites do the second; 4 do only the first.

Blocks a crawler that affects citation (40)

These disallow at least one agent that builds the index assistants quote from, or that fetches a page live to answer a question.

Blocks training crawlers only (4)

Out of the models, still quotable. Reporting these as invisible to AI, as most checkers do, is wrong.

Every domain checked

DomainDisallowedEffect
google.com0Open
cloudflare.com0Open
facebook.com5Blocks citation
microsoft.com0Open
youtube.com0Open
apple.com0Open
instagram.com9Blocks citation
twitter.com9Blocks citation
dzen.ru0Open
amazon.com9Blocks citation
bing.com0Open
wikipedia.org0Open
github.com0Open
whatsapp.net4Blocks citation
googleusercontent.com0Open
netflix.com1Blocks citation
wordpress.org0Open
digicert.com0Open
youtu.be0Open
gandi.net0Open
pinterest.com9Blocks citation
x.com9Blocks citation
tiktok.com9Blocks citation
roblox.com0Open
whatsapp.com4Blocks citation
icloud.com0Open
yahoo.com5Blocks citation
msn.com9Blocks citation
cloudflare.net0Open
spotify.com0Open
adobe.com0Open
ntp.org0Open
chatgpt.com2Blocks citation
wa.me0Open
myfritz.net0Open
vimeo.com0Open
nginx.org0Open
zoom.us0Open
tiktokv.com0Open
baidu.com9Blocks citation
qq.com0Open
yandex.net0Open
opera.com0Open
mozilla.org0Open
samsung.com0Open
yandex.ru0Open
reddit.com10Blocks citation
ui.com0Open
blogspot.com0Open
discord.gg0Open
t.me0Open
bit.ly0Open
google-analytics.com0Open
europa.eu0Open
vk.com0Open
snapchat.com3Training only
amazonvideo.com4Blocks citation
apache.org0Open
openai.com0Open
nih.gov0Open
app-measurement.com0Open
unity3d.com0Open
app-analytics-services.com0Open
amazon-adsystem.com0Open
prodregistryv2.org0Open
intuit.com0Open
dropbox.com0Open
kaspersky.com0Open
archive.org0Open
reg.ru0Open
nytimes.com9Blocks citation
paypal.com0Open
one.one0Open
discord.com0Open
netflix.net1Blocks citation
adtrafficquality.google0Open
applovin.com0Open
aliyuncs.com0Open
shopify.com0Open
f5.com0Open
flickr.com4Blocks citation
adobe.io0Open
mts.ru0Open
soundcloud.com0Open
example.com0Open
w3.org0Open
medium.com2Training only
cnn.com9Blocks citation
theguardian.com4Blocks citation
rubiconproject.com0Open
vungle.com0Open
ebay.com3Blocks citation
creativecommons.org0Open
forbes.com3Blocks citation
doi.org0Open
userapi.com0Open
pki.goog0Open
t-online.de4Blocks citation
bbc.com7Blocks citation
afternic.com0Open
cpanel.net0Open
vk.ru0Open
twitch.tv0Open
gmail.com0Open
adsafeprotected.com0Open
researchgate.net0Open
mit.edu0Open
miui.com0Open
nist.gov0Open
t.co9Blocks citation
bbc.co.uk7Blocks citation
sourceforge.net0Open
ubuntu.com0Open
oxylabs.io0Open
canva.com2Training only
android.com0Open
stripe.com0Open
pubmatic.com0Open
weather.com4Blocks citation
wikimedia.org0Open
telegram.org0Open
cisco.com0Open
hubspot.com0Open
who.int0Open
imdb.com9Blocks citation
booking.com0Open
roku.com0Open
avast.com0Open
linktr.ee0Open
meraki.com9Blocks citation
launchpad.net7Blocks citation
hcaptcha.com0Open
forter.com0Open
springer.com0Open
ibm.com0Open
alidns.com0Open
reuters.com7Blocks citation
tinyurl.com0Open
mozilla.com0Open
myshopify.com0Open
hp.com0Open
duckdns.org0Open
nature.com5Blocks citation
inmobi.com0Open
www.gov.uk0Open
weibo.com9Blocks citation
debian.org0Open
alibaba.com2Training only
salesforce.com0Open
steampowered.com0Open
samsungcloud.com0Open
appsflyer.com0Open
php.net0Open
ok.ru0Open
wiley.com0Open
mailinabox.email0Open
doubleverify.com0Open
amazon.co.uk9Blocks citation
etsy.com0Open
launchdarkly.com0Open
aliyun.com0Open
gnu.org0Open
dnsmadeeasy.com0Open
drom.ru0Open
ea.com0Open
un.org0Open
checkpoint.com0Open
weebly.com0Open
amplitude.com0Open
bilibili.com0Open
cdc.gov0Open
issuu.com0Open
naver.com0Open
slack.com0Open
wsj.com6Blocks citation
opendns.com0Open
trustpilot.com1Blocks citation
quickconnect.to0Open
zendesk.com0Open
walmart.com0Open
washingtonpost.com2Blocks citation
bloomberg.com8Blocks citation
tradingview.com0Open
crpt.ru0Open
google.cn0Open
stanford.edu0Open
ampproject.org0Open
vkontakte.ru0Open
nvidia.com0Open
openx.net0Open
selectel.ru0Open
plesk.com0Open
ip-api.com0Open
calendly.com0Open
dell.com0Open
indeed.com0Open
amazon.de9Blocks citation
tp-link.com0Open
yandex.com0Open
dailymotion.com0Open

Measured 2026-08-08. Sites whose robots.txt could not be established are excluded rather than recorded as open, because a rule we were never shown looks exactly like no rule at all.

Check a domain that is not here

The same check runs on any site, free and without an account, and reports training and search crawlers separately.