robots.txt 生成器
组合生成 robots.txt:多条 User-agent、Allow / Disallow、Crawl-delay、Sitemap 与 Host,实时校验路径与 URL,附带常见爬虫速查与预设。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
预设
爬虫规则
Sitemap 与 Host
校验结果
常见爬虫速查
GooglebotGoogle 搜索BingbotBing 搜索Baiduspider百度搜索Sogou web spider搜狗搜索360Spider360 搜索YandexBotYandex 搜索DuckDuckBotDuckDuckGo 搜索ApplebotApple 搜索PetalBot华为花瓣搜索facebookexternalhitFacebook 抓取TwitterbotX / Twitter 卡片GPTBotOpenAI 训练抓取 · AI 训练 / 抓取ChatGPT-UserChatGPT 实时浏览 · AI 训练 / 抓取OAI-SearchBotOpenAI 搜索索引 · AI 训练 / 抓取ClaudeBotAnthropic Claude 抓取 · AI 训练 / 抓取anthropic-aiAnthropic 训练抓取 · AI 训练 / 抓取PerplexityBotPerplexity 抓取 · AI 训练 / 抓取CCBotCommon Crawl 数据集 · AI 训练 / 抓取Google-ExtendedGoogle AI 训练开关 · AI 训练 / 抓取Applebot-ExtendedApple AI 训练开关 · AI 训练 / 抓取Bytespider字节跳动爬虫 · AI 训练 / 抓取meta-externalagentMeta AI 抓取 · AI 训练 / 抓取AmazonbotAmazon 抓取 · AI 训练 / 抓取MJ12botMajestic SEO 爬虫 · AI 训练 / 抓取AhrefsBotAhrefs SEO 爬虫SemrushBotSemrush SEO 爬虫robots.txt
User-agent: * Allow: /
统计
1102这个工具能做什么
- 上线前补一份 robots.txt:允许全站但屏蔽后台路径,或者干脆禁止全部,用预设一键生成再微调。
- 不希望内容被 AI 训练抓取时选「禁止 AI 爬虫」预设,GPTBot、ClaudeBot、CCBot、Bytespider 等会各生成一条规则。
- 路径和 URL 边填边校验:路径必须 / 开头且不能含空格,Sitemap 和 Host 必须是完整的 http(s) 地址,写错会立即提示。
- 配置多套爬虫规则时给同一个 User-agent 写多组,生成时自动合并去重,避免出现互相冲突的重复规则。
示例
输入
规则组:User-agent *,Allow /,Disallow /admin/ 与 /api/;Sitemap https://example.com/sitemap.xml
输出
User-agent: * Allow: / Disallow: /admin/ Disallow: /api/ Sitemap: https://example.com/sitemap.xml
同一规则组的指令按 User-agent、Allow、Disallow、Crawl-delay 的顺序输出;Sitemap 与 Host 单独成块,放在所有规则组之后并用空行隔开。
常见问题
Disallow 写了路径就一定不会被抓吗?
不是。robots.txt 是君子协定,遵守它的爬虫才会停下,恶意爬虫完全无视。而且它只能禁止抓取,不能阻止已收录的页面出现在搜索结果里,敏感内容请用登录鉴权或服务器层限制。
Allow 和 Disallow 冲突时谁生效?
按官方规范,路径匹配更精确(更长)的规则优先,长度相同时 Allow 优先。所以常见的写法是先 Allow 全站、再 Disallow 后台目录,用 Allow 单独放行某个被误伤的子路径。
禁止 AI 爬虫预设包含哪些?
覆盖 GPTBot、ChatGPT-User、OAI-SearchBot、ClaudeBot、anthropic-ai、PerplexityBot、CCBot、Google-Extended、Applebot-Extended、Bytespider、meta-externalagent、Amazonbot、MJ12bot,每个都生成 Disallow: /,并保留一条 User-agent: * 允许其余爬虫。
路径写错会怎样?
校验面板会列出问题,生成结果里也会跳过非法条目。路径必须 / 开头且不含空格,Crawl-delay 必须是非负数字,Sitemap 和 Host 必须是完整的 http 或 https URL。
生成的内容要放在哪里?
放在站点根目录,文件名必须是 robots.txt,也就是 https://你的域名/robots.txt 能直接访问。子目录下的 robots.txt 不会生效,CDN 或反向代理还要确认没有把它拦掉。
关键词:robots.txtrobotscrawleruser-agentsitemapseorobots.txt 生成爬虫禁止抓取AI 爬虫