INSA MEDI AI · GEO KNOWLEDGE HUB

sitemap.xml·robots.txt·AI 준비

병원 사이트에서 AI와 검색엔진이 문서를 발견하고 읽을 수 있으려면, 보이는 HTML 본문뿐 아니라 sitemap.xml과 robots.txt 같은 기본 파일도 정리되어 있어야 합니다. 이 문서는 발견성과 접근 정책을 함께 보는 기본 체크 문서입니다.

업데이트: 2026-09-03 · 경로: /geo_hub/technical/sitemap-robots-ai.html

바로가기

현재 패키지는 우선순위 A+B 기준 총 35페이지로 정리되어 있습니다. 메인 허브 1개, 클러스터 허브 6개, 상세 문서 28개 구조입니다.
Summary

핵심 정리

sitemap.xml은 “어떤 문서가 있는가”를 알려주고, robots.txt는 “누가 어디까지 접근할 수 있는가”를 알려주는 기본 파일입니다.

Roles

역할 구분

파일역할
sitemap.xml문서 목록과 발견성 보조
robots.txt크롤러 접근 정책과 허용/차단 지침
HTML 본문실제 읽히는 주 내용
structured data의미를 구조적으로 보조
Checklist

체크포인트

  • 새로운 지식 허브 문서가 sitemap.xml에 포함되어 있는지 확인합니다.
  • 검색용 봇 접근이 불필요하게 차단되어 있지 않은지 robots.txt를 점검합니다.
  • 라이브 URL과 llms 파일, 지식 허브 URL 구조가 서로 모순되지 않게 유지합니다.
FAQ

자주 묻는 질문

robots.txt만 잘 쓰면 충분한가요?

아닙니다. robots는 접근 정책이고, 실제 의미 전달은 HTML 본문과 structured data가 담당합니다.

새 페이지를 만들면 sitemap도 바로 갱신해야 하나요?

가능하면 그렇습니다. 특히 허브 문서를 확장할수록 발견성 관리가 중요해집니다.

Sources

참고 출처

Google crawlers overview

Google crawler, fetcher, verification, robots 처리 원칙을 설명하는 공식 문서

OpenAI bots

OAI-SearchBot, GPTBot, ChatGPT-User 등 OpenAI 웹 접근 주체를 설명하는 공식 문서

Anthropic crawler policy

ClaudeBot, Claude-User, Claude-SearchBot 정책을 설명하는 Anthropic 공식 문서

Microsoft Bing Webmaster

sitemap 제출, crawl stats, indexing 진단과 관련한 공식 문서