핵심 정리
sitemap.xml은 “어떤 문서가 있는가”를 알려주고, robots.txt는 “누가 어디까지 접근할 수 있는가”를 알려주는 기본 파일입니다.
역할 구분
| 파일 | 역할 |
|---|---|
| sitemap.xml | 문서 목록과 발견성 보조 |
| robots.txt | 크롤러 접근 정책과 허용/차단 지침 |
| HTML 본문 | 실제 읽히는 주 내용 |
| structured data | 의미를 구조적으로 보조 |
체크포인트
- 새로운 지식 허브 문서가 sitemap.xml에 포함되어 있는지 확인합니다.
- 검색용 봇 접근이 불필요하게 차단되어 있지 않은지 robots.txt를 점검합니다.
- 라이브 URL과 llms 파일, 지식 허브 URL 구조가 서로 모순되지 않게 유지합니다.
자주 묻는 질문
robots.txt만 잘 쓰면 충분한가요?
아닙니다. robots는 접근 정책이고, 실제 의미 전달은 HTML 본문과 structured data가 담당합니다.
새 페이지를 만들면 sitemap도 바로 갱신해야 하나요?
가능하면 그렇습니다. 특히 허브 문서를 확장할수록 발견성 관리가 중요해집니다.
참고 출처
Google crawlers overview
Google crawler, fetcher, verification, robots 처리 원칙을 설명하는 공식 문서
OpenAI bots
OAI-SearchBot, GPTBot, ChatGPT-User 등 OpenAI 웹 접근 주체를 설명하는 공식 문서
Anthropic crawler policy
ClaudeBot, Claude-User, Claude-SearchBot 정책을 설명하는 Anthropic 공식 문서
Microsoft Bing Webmaster
sitemap 제출, crawl stats, indexing 진단과 관련한 공식 문서