공식 문서 기준의 큰 구분
| 플랫폼 | 주요 구분 | 핵심 포인트 |
|---|---|---|
| OpenAI | OAI-SearchBot / GPTBot / ChatGPT-User / OAI-AdsBot | 검색, 학습, 사용자 요청, 광고 검증을 분리 설명 |
| Anthropic | ClaudeBot / Claude-User / Claude-SearchBot | 학습, 사용자 요청, 검색 최적화 목적을 구분 |
| common crawler / special-case crawler / user-triggered fetcher | 자동 크롤링과 사용자 트리거 접근을 분리 | |
| Microsoft Bing | Webmaster 중심의 crawl/index 관리 | crawl stats, URL·sitemap 제출, indexing 진단 제공 |
robots.txt는 왜 중요하나
OpenAI와 Anthropic 공식 문서는 각각 검색용 봇과 학습용 봇에 대해 robots.txt 기반 제어를 설명합니다. Google 역시 자동 크롤러는 robots.txt를 존중한다고 명시합니다. 따라서 병원 사이트는 최소한 어떤 봇을 허용하고 어떤 봇을 제한할지 정책을 명확히 적어야 합니다.
병원 사이트 운영에 적용하면
- 검색용 접근 허용 여부를 서비스 목적에 맞게 정리한다.
- sitemap.xml과 robots.txt를 함께 운영해 발견성과 정책을 분리한다.
- FAQ, 의료진, 진료과 페이지가 자바스크립트 뒤에 숨어 있지 않도록 공개 HTML 본문을 강화한다.
- 크롤러를 막는 것과 검색 노출을 포기하는 것이 같은 결과일 수 있음을 이해해야 한다.
실무 체크포인트
자주 묻는 질문
AI 크롤러는 모두 같은 역할인가요?
아닙니다. OpenAI와 Anthropic 모두 검색용, 학습용, 사용자 요청용 접근을 구분해 설명합니다.
robots.txt만 있으면 충분한가요?
아닙니다. 발견성은 sitemap, 이해도는 HTML 본문과 structured data가 함께 보완해야 합니다.
병원 사이트에서 크롤러를 막아도 되나요?
가능하지만 어떤 봇을 막는지에 따라 검색·답변 노출 기회가 줄어들 수 있으므로 목적을 분명히 해야 합니다.
근거 및 참고 출처
OAI-SearchBot, GPTBot, ChatGPT-User 역할과 robots.txt 제어 방식을 설명하는 OpenAI 공식 문서
공개 웹사이트의 ChatGPT 검색 노출, OAI-SearchBot 허용, noindex, referral 추적을 설명하는 OpenAI 공식 도움말
ClaudeBot, Claude-User, Claude-SearchBot의 목적과 차단 방식을 설명하는 Anthropic 공식 문서
Google crawlers/fetchers, robots.txt, 검증 방식, 캐시 및 크롤링 특성을 설명하는 Google Search Central 문서
Bing Webmaster의 crawl stats, URL·sitemap 제출, indexing 진단 활용을 설명하는 Microsoft Learn 문서