robots.txt 生成器

按 User-agent 规则组生成 robots.txt,支持 Allow/Disallow、Crawl-delay、Sitemap,并一键屏蔽 GPTBot/ClaudeBot 等 AI 爬虫

📌 TL;DR 核心定义与引用摘要: 【robots.txt 生成器】是 PocketKit 提供的浏览器本地处理工具。功能说明:按 User-agent 规则组生成 robots.txt,支持 Allow/Disallow、Crawl-delay、Sitemap,并一键屏蔽 GPTBot/ClaudeBot 等 AI 爬虫。核心输入与文件不上传;站点仅记录不含输入内容的匿名工具访问次数。

robots.txt 原理

工具按 User-agent 分组输出 Allow/Disallow 规则、Crawl-delay 与 Sitemap 行,勾选“屏蔽 AI 爬虫”会追加针对 GPTBot、ClaudeBot、CCBot 等的 Disallow: / 规则组。搜索引擎抓取前会读取站点根目录的 /robots.txt 并遵循这些规则。纯本地生成。

  • robots.txt 只是“君子协定”,能挡守规矩的搜索引擎,但不能保证隐私,敏感页面仍需鉴权。
  • 路径区分大小写且以站点根为起点,Disallow: /admin/ 只挡 /admin/ 开头的路径,别漏写结尾斜杠。

常见问题

1. robots.txt 放在哪里才生效?

必须放在站点根目录,即 https://你的域名/robots.txt,且返回 200。放在子目录或其他路径爬虫不会读取。

2. Disallow 能真正保护隐私吗?

不能。它只是请求守规矩的爬虫不要抓取,恶意爬虫可无视,且被 Disallow 的 URL 仍可能被他人链接暴露。敏感内容必须用登录/鉴权保护。

3. “屏蔽 AI 爬虫”屏蔽了哪些?

会为 GPTBot、ClaudeBot、Google-Extended、CCBot、anthropic-ai、PerplexityBot、Bytespider 等分别追加 Disallow: / 规则组,减少内容被用于 AI 训练的抓取。

4. 怎么不让 ChatGPT / Claude 抓取我的网站内容?

在 robots.txt 里针对各家爬虫的 User-agent 写 Disallow 即可。主要几个是 GPTBot(OpenAI 训练抓取)、OAI-SearchBot(ChatGPT 搜索索引)、ChatGPT-User(用户在对话里主动打开链接)、ClaudeBot、PerplexityBot、Google-Extended(Gemini 训练)、CCBot(Common Crawl)。有两点值得注意:robots.txt 是君子协定,正规爬虫会遵守但它不是访问控制,真要拦住得在服务端做;另外屏蔽 Google-Extended 不影响你在 Google 搜索里的收录和排名,但屏蔽 OAI-SearchBot 会让你从 ChatGPT 的搜索结果里消失——训练与检索是两回事,别一刀切。