robots.txt 테스터
Googlebot·Bingbot 매칭 룰 구현: 그룹은 user-agent 키, 가장 구체적 UA 우선(완전일치 > 부분문자열 > *), 그룹 내 최장 매칭 패턴 우선(동률 시 Allow 우선). * 와일드카드, $ 경로끝 앵커 지원. Sitemap: 선언도 모두 노출 — 사이트맵 URL 도달 가능성 점검.
- 허용룰: Allow: /admin/
- 허용룰: Allow: /admin/public/
- 차단룰: Disallow: /
- 차단룰: Disallow: /private/
- https://example.com/sitemap.xml
부분문자열 UA 매치는 대소문자 무시. 가장 긴 패턴 우선; 동률 시 Allow.
사용법
- robots.txt를 상단에 붙여넣기.
- (user-agent, 경로) 테스트 케이스 추가 — UA를 '*'로 두면 catch-all 그룹 테스트.
- 오른쪽에서 판정과 해당 룰 확인.
자주 묻는 질문
- 최장 매치는 어떻게 작동?
- 매칭 UA 그룹 내에서, 경로에 매칭되는 가장 긴 패턴 룰 우선. Allow·Disallow는 패턴 길이로만 가중 — 더 긴 Allow가 더 짧은 Disallow 이김.
- 패턴 끝 $는 뭐?
- URL 경로 끝에 패턴 고정. /foo$는 /foo와 정확히 매치, /foo/bar는 아님. /*.pdf$ 같은 특정 확장자 차단에 유용.
- Disallow 규칙을 넣으면 검색 결과에서 사라지나?
- 확실하지 않다. 규칙을 지키는 크롤러가 페이지를 가져가지 않게 할 뿐이고, 다른 사이트가 링크한 URL은 여전히 목록에 오를 수 있다. 크롤러가 페이지를 읽지 않으니 거기 붙은 noindex 태그도 보지 못하기 때문이다. 색인에서 빼려면 오히려 크롤링을 허용하고 noindex를 돌려주거나, 인증 뒤에 두어야 한다.
- robots.txt 하나로 서브도메인까지 적용되나?
- 아니다. 이 파일은 스킴, 호스트, 포트가 정확히 일치하는 곳에만 적용되므로 example.com과 www.example.com은 각자 하나씩 필요하고, 포트가 다르면 또 따로 필요하다. 위치도 그 호스트의 루트여야 한다. 하위 디렉터리에 있는 robots.txt는 아예 읽히지 않는다.
관련 도구
User Agent 파서
User-Agent 문자열을 브라우저·엔진·OS·디바이스·CPU로 파싱. GPTBot·ClaudeBot·PerplexityBot 포함 20+ 봇 감지.
CORS 헤더 빌더
Access-Control-* 응답 헤더 체크리스트 구성, 4 프리셋·위험한 조합 실시간 경고.
DMARC 레코드 빌더
`_dmarc` TXT 레코드 작성 — 정책·서브도메인 정책·퍼센트 롤아웃·정렬·rua/ruf 리포팅 — 안전 경고 포함.
TXT 레코드 분할기 (255바이트 청크)
긴 SPF·DKIM·DMARC TXT 레코드를 DNS 프로토콜이 요구하는 255바이트 청크로 분할 — BIND·일반 zone 파일·Cloudflare·Route 53 문법 출력.
/.well-known/* URI 레퍼런스
IANA 등록 well-known URI 검색 카탈로그 — `security.txt`·`openid-configuration`·`apple-app-site-association`·`acme-challenge` 외 30+개, RFC 레퍼런스·사용 사례 포함.
DKIM 레코드 빌더 & 파서
DKIM(DomainKeys Identified Mail) DNS TXT 레코드를 만들거나 분석 — 공개키 붙여넣고 selector·키 타입(RSA/Ed25519)·해시·플래그 설정 → 전체 레코드 + `selector._domainkey` 호스트명 + 255자 초과 시 DNS 청크 버전까지.