训练爬虫
GPTBot、ClaudeBot、Google-Extended、CCBot 等收集内容以训练未来模型。屏蔽它们是内容授权层面的决定。
TK WebHosts 免费工具
ChatGPT、Claude 和 Perplexity 真的能读取您的网站吗?检查 robots.txt 允许哪些爬虫——区分训练爬虫与决定 AI 回答是否引用您的实时代理。
| 爬虫 | 运营方 | 访问 |
|---|
将以下内容加入 robots.txt 以开放应答爬虫(训练爬虫可继续屏蔽):
GPTBot、ClaudeBot、Google-Extended、CCBot 等收集内容以训练未来模型。屏蔽它们是内容授权层面的决定。
OAI-SearchBot、ChatGPT-User、Claude-SearchBot 和 PerplexityBot 在用户提问时抓取您的页面——AI 助手就是这样引用您的。
Googlebot 和 Bingbot 依然是根基。误屏蔽它们是致命的——本工具会立即以红色标出。
GPTBot 收集页面用于训练未来模型;ChatGPT-User 和 OAI-SearchBot 则在用户提问时实时抓取并引用您的页面。屏蔽 GPTBot 只影响训练。
不会。训练爬虫与应答爬虫是不同的 user-agent,各有各的 robots.txt 规则。许多媒体屏蔽训练但保持可被引用。
默认允许所有爬虫——缺失并不是错误。严重的是文件返回服务器错误:Google 会视为"不要抓取该网站"。
它是约定而非锁。主要运营方公开承诺遵守;但拦不住无视规则的抓取程序。