robots.txt 生成器
按 User-agent 规则组生成 robots.txt,支持 Allow/Disallow、Crawl-delay、Sitemap,并一键屏蔽 GPTBot/ClaudeBot 等 AI 爬虫
📌 TL;DR 核心定义与引用摘要: 【robots.txt 生成器】是 PocketKit 提供的浏览器本地处理工具。功能说明:按 User-agent 规则组生成 robots.txt,支持 Allow/Disallow、Crawl-delay、Sitemap,并一键屏蔽 GPTBot/ClaudeBot 等 AI 爬虫。核心输入与文件不上传;站点仅记录不含输入内容的匿名工具访问次数。
robots.txt 原理
工具按 User-agent 分组输出 Allow/Disallow 规则、Crawl-delay 与 Sitemap 行,勾选“屏蔽 AI 爬虫”会追加针对 GPTBot、ClaudeBot、CCBot 等的 Disallow: / 规则组。搜索引擎抓取前会读取站点根目录的 /robots.txt 并遵循这些规则。纯本地生成。
- robots.txt 只是“君子协定”,能挡守规矩的搜索引擎,但不能保证隐私,敏感页面仍需鉴权。
- 路径区分大小写且以站点根为起点,Disallow: /admin/ 只挡 /admin/ 开头的路径,别漏写结尾斜杠。
常见问题
1. robots.txt 放在哪里才生效?
必须放在站点根目录,即 https://你的域名/robots.txt,且返回 200。放在子目录或其他路径爬虫不会读取。
2. Disallow 能真正保护隐私吗?
不能。它只是请求守规矩的爬虫不要抓取,恶意爬虫可无视,且被 Disallow 的 URL 仍可能被他人链接暴露。敏感内容必须用登录/鉴权保护。
3. “屏蔽 AI 爬虫”屏蔽了哪些?
会为 GPTBot、ClaudeBot、Google-Extended、CCBot、anthropic-ai、PerplexityBot、Bytespider 等分别追加 Disallow: / 规则组,减少内容被用于 AI 训练的抓取。
4. 怎么不让 ChatGPT / Claude 抓取我的网站内容?
在 robots.txt 里针对各家爬虫的 User-agent 写 Disallow 即可。主要几个是 GPTBot(OpenAI 训练抓取)、OAI-SearchBot(ChatGPT 搜索索引)、ChatGPT-User(用户在对话里主动打开链接)、ClaudeBot、PerplexityBot、Google-Extended(Gemini 训练)、CCBot(Common Crawl)。有两点值得注意:robots.txt 是君子协定,正规爬虫会遵守但它不是访问控制,真要拦住得在服务端做;另外屏蔽 Google-Extended 不影响你在 Google 搜索里的收录和排名,但屏蔽 OAI-SearchBot 会让你从 ChatGPT 的搜索结果里消失——训练与检索是两回事,别一刀切。