跳到主内容
UniKit

robots.txt 生成器

组合生成 robots.txt:多条 User-agent、Allow / Disallow、Crawl-delay、Sitemap 与 Host,实时校验路径与 URL,附带常见爬虫速查与预设。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

预设

爬虫规则

Allow(允许)
/
Disallow(禁止)

Sitemap 与 Host

校验结果

常见爬虫速查

GooglebotGoogle 搜索
BingbotBing 搜索
Baiduspider百度搜索
Sogou web spider搜狗搜索
360Spider360 搜索
YandexBotYandex 搜索
DuckDuckBotDuckDuckGo 搜索
ApplebotApple 搜索
PetalBot华为花瓣搜索
facebookexternalhitFacebook 抓取
TwitterbotX / Twitter 卡片
GPTBotOpenAI 训练抓取 · AI 训练 / 抓取
ChatGPT-UserChatGPT 实时浏览 · AI 训练 / 抓取
OAI-SearchBotOpenAI 搜索索引 · AI 训练 / 抓取
ClaudeBotAnthropic Claude 抓取 · AI 训练 / 抓取
anthropic-aiAnthropic 训练抓取 · AI 训练 / 抓取
PerplexityBotPerplexity 抓取 · AI 训练 / 抓取
CCBotCommon Crawl 数据集 · AI 训练 / 抓取
Google-ExtendedGoogle AI 训练开关 · AI 训练 / 抓取
Applebot-ExtendedApple AI 训练开关 · AI 训练 / 抓取
Bytespider字节跳动爬虫 · AI 训练 / 抓取
meta-externalagentMeta AI 抓取 · AI 训练 / 抓取
AmazonbotAmazon 抓取 · AI 训练 / 抓取
MJ12botMajestic SEO 爬虫 · AI 训练 / 抓取
AhrefsBotAhrefs SEO 爬虫
SemrushBotSemrush SEO 爬虫

robots.txt

User-agent: *
Allow: /

统计

规则组1
规则条数1
Sitemap 数量0
行数2

这个工具能做什么

  • 上线前补一份 robots.txt:允许全站但屏蔽后台路径,或者干脆禁止全部,用预设一键生成再微调。
  • 不希望内容被 AI 训练抓取时选「禁止 AI 爬虫」预设,GPTBot、ClaudeBot、CCBot、Bytespider 等会各生成一条规则。
  • 路径和 URL 边填边校验:路径必须 / 开头且不能含空格,Sitemap 和 Host 必须是完整的 http(s) 地址,写错会立即提示。
  • 配置多套爬虫规则时给同一个 User-agent 写多组,生成时自动合并去重,避免出现互相冲突的重复规则。

示例

输入

规则组:User-agent *,Allow /,Disallow /admin/ 与 /api/;Sitemap https://example.com/sitemap.xml

输出

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

同一规则组的指令按 User-agent、Allow、Disallow、Crawl-delay 的顺序输出;Sitemap 与 Host 单独成块,放在所有规则组之后并用空行隔开。

常见问题

Disallow 写了路径就一定不会被抓吗?

不是。robots.txt 是君子协定,遵守它的爬虫才会停下,恶意爬虫完全无视。而且它只能禁止抓取,不能阻止已收录的页面出现在搜索结果里,敏感内容请用登录鉴权或服务器层限制。

Allow 和 Disallow 冲突时谁生效?

按官方规范,路径匹配更精确(更长)的规则优先,长度相同时 Allow 优先。所以常见的写法是先 Allow 全站、再 Disallow 后台目录,用 Allow 单独放行某个被误伤的子路径。

禁止 AI 爬虫预设包含哪些?

覆盖 GPTBot、ChatGPT-User、OAI-SearchBot、ClaudeBot、anthropic-ai、PerplexityBot、CCBot、Google-Extended、Applebot-Extended、Bytespider、meta-externalagent、Amazonbot、MJ12bot,每个都生成 Disallow: /,并保留一条 User-agent: * 允许其余爬虫。

路径写错会怎样?

校验面板会列出问题,生成结果里也会跳过非法条目。路径必须 / 开头且不含空格,Crawl-delay 必须是非负数字,Sitemap 和 Host 必须是完整的 http 或 https URL。

生成的内容要放在哪里?

放在站点根目录,文件名必须是 robots.txt,也就是 https://你的域名/robots.txt 能直接访问。子目录下的 robots.txt 不会生效,CDN 或反向代理还要确认没有把它拦掉。

关键词:robots.txtrobotscrawleruser-agentsitemapseorobots.txt 生成爬虫禁止抓取AI 爬虫

同类工具