robots.txt 测试器
实现 Googlebot / Bingbot 使用的匹配规则:分组以 user-agent 为键,最具体的 UA 优先(精确 > 子串 > *),组内最长匹配模式胜出(平局时 Allow 胜过 Disallow)。支持 * 通配符与 $ 路径末尾锚。同时展示每条 Sitemap: 声明,便于检查站点地图 URL 是否可达。
- 允许规则: Allow: /admin/
- 允许规则: Allow: /admin/public/
- 禁止规则: Disallow: /
- 禁止规则: Disallow: /private/
- https://example.com/sitemap.xml
子串 UA 匹配不区分大小写。最长模式胜出;平局归 Allow。
使用方法
- 把你的 robots.txt 粘贴到上方框中。
- 添加(user-agent,路径)测试用例 — 把 UA 设为 '*' 测试 catch-all 组。
- 在右侧查看判定与产生该判定的规则。
常见问题
- 最长匹配怎么工作?
- 在匹配的 UA 组中,仍能匹配路径的最长模式规则胜出。Allow 与 Disallow 仅按模式长度加权 — 模式更长的 Allow 击败模式更短的 Disallow。
- 模式末尾的 $ 是什么意思?
- 把模式锚定到 URL 路径末尾。/foo$ 精确匹配 /foo,但不匹配 /foo/bar。适用于阻止 /*.pdf$ 之类的特定扩展。
- 写了 Disallow,页面就不会出现在搜索结果里吗?
- 并不可靠。它只是让守规矩的爬虫不去抓取该页面,但被别的网站链接过的 URL 仍可能被收录,因为爬虫从不读取这个页面,也就看不到页面上的 noindex 标记。想让内容退出索引,反而要允许抓取并返回 noindex,或者把它放到需要登录的地方。
- 一份 robots.txt 能管住我的各个子域名吗?
- 不能。这个文件只对协议、主机和端口完全一致的范围生效,所以 example.com 和 www.example.com 各自需要一份,换个端口也要另写一份。而且它必须放在该主机的根目录下——放在子目录里的 robots.txt 根本不会被读取。
相关工具
User Agent 解析器
把 User-Agent 字符串解析为浏览器、引擎、操作系统、设备、CPU。识别 20+ 种爬虫,含 GPTBot、ClaudeBot、PerplexityBot。
CORS 头构建器
从清单组合 Access-Control-* 响应头,提供四个预设并对危险组合实时警告。
DMARC 记录构建器
构建 `_dmarc` TXT 记录 —— 策略、子域策略、百分比逐步推出、对齐、rua/ruf 报告 —— 带安全警告。
TXT 记录拆分器(255 字节块)
把长 SPF、DKIM 或 DMARC TXT 记录拆分为 DNS 协议要求的 255 字节块 —— 输出 BIND、通用 zone 文件、Cloudflare 或 Route 53 语法。
/.well-known/* URI 参考
IANA 注册的 well-known URI 可搜索目录 — `security.txt`、`openid-configuration`、`apple-app-site-association`、`acme-challenge` 加 30+ 更多,附 RFC 参考和用例。
DKIM 记录构建器 & 解析器
构建或解析 DKIM(DomainKeys Identified Mail)DNS TXT 记录 —— 粘贴公钥、选择 selector / 密钥类型(RSA/Ed25519)/ 哈希 / 标志,即可得到完整记录、`selector._domainkey` 主机名,以及超过 255 字符时的 DNS 分段版本。