RM360블로그

AI 검색

병원 홈페이지 robots.txt, AI 크롤러는 어떻게 열어 두나요?

학습용 · 검색용 · 사용자 요청 세 갈래 · 회사별 크롤러 이름 · 병원 홈페이지용 예시

작성 RM360 리서치팀 · 발행 · 최종 수정

핵심 요약

AI 회사의 크롤러는 모델 학습용, 검색용, 사용자 요청용으로 나뉩니다[1][2][3]. 검색용을 막으면 AI 검색 답변의 근거가 되기 어렵고, 학습용만 막는 것은 검색 노출과 별개의 선택입니다[1]. 병원 홈페이지는 검색용 크롤러를 열어 두고, 관리자·회원 화면처럼 읽힐 필요가 없는 경로만 닫는 구성이 기본입니다.

1. AI 크롤러는 몇 갈래인가요?

세 갈래입니다. 이름이 비슷해 한데 묶어 막는 경우가 많지만 하는 일이 다릅니다.

갈래하는 일막으면
학습용모델 학습에 쓸 수 있는 글을 읽음다음 모델 학습에 덜 쓰임. AI 검색 노출과는 별개
검색용AI 검색 결과에 사이트를 보여 주려고 미리 읽어 둠AI 검색 답변의 근거 후보에서 빠지기 쉬움
사용자 요청사용자가 대화 중에 요청한 페이지를 그 자리에서 읽음회사마다 robots.txt 적용 여부가 다름

OpenAI는 이 설정들이 서로 독립적이라고 설명합니다. 예를 들어 검색 결과에 나오도록 OAI-SearchBot은 허용하면서, 학습에 쓰지 말라는 뜻으로 GPTBot은 막을 수 있습니다[1].

2. 회사별 크롤러 이름은 무엇인가요?

회사학습용검색용사용자 요청
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
Perplexity없음 (학습에 쓰지 않는다고 설명)PerplexityBotPerplexity-User
GoogleGoogle-Extended (표시용 이름)Googlebot해당 없음

OpenAI와 Perplexity는 사용자 요청 방문에는 robots.txt가 적용되지 않을 수 있다고 적고[1][3], Anthropic은 세 크롤러 모두 robots.txt를 따른다고 설명합니다[2]. Google-Extended는 실제로 방문하는 크롤러가 아니라, 구글이 읽은 내용을 Gemini 학습과 그라운딩에 쓸지 정하는 표시 이름이고 구글 검색 노출에는 영향을 주지 않습니다[4].

3. 흔한 실수는 무엇인가요?

  • 개발 중에 넣은 User-agent: * / Disallow: /가 그대로 남아 모든 로봇을 막고 있습니다.
  • 학습용을 막으려다 목록을 통째로 복사해 OAI-SearchBot·PerplexityBot 같은 검색용까지 막습니다.
  • robots.txt는 열어 두었는데 본문이 스크립트로만 그려져 크롤러에게 빈 페이지로 보입니다.
  • robots.txt에 사이트맵 주소를 적지 않아 새 글을 찾는 데 오래 걸립니다.

4. 병원 홈페이지용 예시는 어떻게 쓰나요?

아래는 검색용과 사용자 요청 크롤러에 공개 페이지를 열고, 관리자·회원 화면만 닫는 예시입니다. 여러 User-agent 줄을 한 묶음으로 쓰는 방식은 robots.txt 표준(RFC 9309)에 있는 형식입니다[5]. 경로와 사이트맵 주소는 병원 사이트에 맞게 바꿉니다.

# 검색용·사용자 요청 크롤러: 공개 페이지 허용
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
Disallow: /admin/
Disallow: /mypage/

# 학습용 크롤러: 병원 방침에 따라 Allow 또는 Disallow
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Allow: /
Disallow: /admin/
Disallow: /mypage/

# 그 밖의 로봇
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /mypage/

Sitemap: https://www.example-clinic.kr/sitemap.xml

로봇은 자기 이름이 적힌 묶음이 있으면 그 묶음만 따르고 * 묶음은 보지 않습니다[5]. 그래서 이름을 적은 묶음마다 닫을 경로를 다시 적어야 합니다.

5. 바꾼 뒤에는 어떻게 확인하나요?

  1. 브라우저 주소창에 병원주소/robots.txt를 넣어 바뀐 내용이 보이는지 봅니다.
  2. 구글 서치콘솔의 robots.txt 보고서에서 구글이 읽은 버전과 오류를 확인합니다[6].
  3. 서버 방문 기록에서 OAI-SearchBot·PerplexityBot 같은 이름이 들어오기 시작하는지 봅니다. 방문이 쌓이는 데는 며칠 이상 걸릴 수 있습니다.

6. 참고자료

  1. 공식 문서 OpenAI, Overview of OpenAI Crawlers
  2. 공식 문서 Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?
  3. 공식 문서 Perplexity, Perplexity Crawlers
  4. 공식 문서 Google, Google's common crawlers (Google-Extended)
  5. 표준 IETF, RFC 9309 Robots Exclusion Protocol
  6. 공식 문서 Google, robots.txt 보고서

7. 자주 묻는 질문

Q. 학습용 크롤러를 막으면 불이익이 있나요?
OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot 설정이 서로 독립적이라고 설명합니다. 학습용만 막으면 검색 노출과는 별개로 학습에 쓰지 말라는 뜻을 밝히는 것입니다.
Q. 모든 AI 크롤러를 한 번에 허용하는 방법은 없나요?
User-agent: *에 Allow: /만 두면 이름을 따로 적지 않은 모든 로봇이 허용됩니다. 다만 이름을 적은 묶음이 하나라도 있으면 그 로봇은 그 묶음만 따르므로 두 규칙이 어긋나지 않는지 확인합니다.
Q. robots.txt를 고치면 바로 AI 답변에 나오나요?
아닙니다. robots.txt는 문을 여는 일이고, 크롤러가 다시 방문해 글을 읽고 답변 후보로 쓰기까지는 시간이 걸립니다. 본문 노출과 사이트맵도 함께 점검합니다.
Q. 홈페이지 업체에 무엇을 전달하면 되나요?
위 예시처럼 열 크롤러 이름, 닫을 경로, 사이트맵 주소를 적어 전달하면 됩니다. 수정 뒤에는 주소창에서 robots.txt를 열어 반영 여부를 확인합니다.

블로그 첫 화면 · 2026년 9월 칼럼