병원 홈페이지 robots.txt, AI 크롤러는 어떻게 열어 두나요?
학습용 · 검색용 · 사용자 요청 세 갈래 · 회사별 크롤러 이름 · 병원 홈페이지용 예시
핵심 요약
AI 회사의 크롤러는 모델 학습용, 검색용, 사용자 요청용으로 나뉩니다[1][2][3]. 검색용을 막으면 AI 검색 답변의 근거가 되기 어렵고, 학습용만 막는 것은 검색 노출과 별개의 선택입니다[1]. 병원 홈페이지는 검색용 크롤러를 열어 두고, 관리자·회원 화면처럼 읽힐 필요가 없는 경로만 닫는 구성이 기본입니다.
1. AI 크롤러는 몇 갈래인가요?
세 갈래입니다. 이름이 비슷해 한데 묶어 막는 경우가 많지만 하는 일이 다릅니다.
| 갈래 | 하는 일 | 막으면 |
|---|---|---|
| 학습용 | 모델 학습에 쓸 수 있는 글을 읽음 | 다음 모델 학습에 덜 쓰임. AI 검색 노출과는 별개 |
| 검색용 | AI 검색 결과에 사이트를 보여 주려고 미리 읽어 둠 | AI 검색 답변의 근거 후보에서 빠지기 쉬움 |
| 사용자 요청 | 사용자가 대화 중에 요청한 페이지를 그 자리에서 읽음 | 회사마다 robots.txt 적용 여부가 다름 |
OpenAI는 이 설정들이 서로 독립적이라고 설명합니다. 예를 들어 검색 결과에 나오도록 OAI-SearchBot은 허용하면서, 학습에 쓰지 말라는 뜻으로 GPTBot은 막을 수 있습니다[1].
2. 회사별 크롤러 이름은 무엇인가요?
| 회사 | 학습용 | 검색용 | 사용자 요청 |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Perplexity | 없음 (학습에 쓰지 않는다고 설명) | PerplexityBot | Perplexity-User |
| Google-Extended (표시용 이름) | Googlebot | 해당 없음 |
OpenAI와 Perplexity는 사용자 요청 방문에는 robots.txt가 적용되지 않을 수 있다고 적고[1][3], Anthropic은 세 크롤러 모두 robots.txt를 따른다고 설명합니다[2]. Google-Extended는 실제로 방문하는 크롤러가 아니라, 구글이 읽은 내용을 Gemini 학습과 그라운딩에 쓸지 정하는 표시 이름이고 구글 검색 노출에는 영향을 주지 않습니다[4].
3. 흔한 실수는 무엇인가요?
- 개발 중에 넣은
User-agent: */Disallow: /가 그대로 남아 모든 로봇을 막고 있습니다. - 학습용을 막으려다 목록을 통째로 복사해 OAI-SearchBot·PerplexityBot 같은 검색용까지 막습니다.
- robots.txt는 열어 두었는데 본문이 스크립트로만 그려져 크롤러에게 빈 페이지로 보입니다.
- robots.txt에 사이트맵 주소를 적지 않아 새 글을 찾는 데 오래 걸립니다.
4. 병원 홈페이지용 예시는 어떻게 쓰나요?
아래는 검색용과 사용자 요청 크롤러에 공개 페이지를 열고, 관리자·회원 화면만 닫는 예시입니다. 여러 User-agent 줄을 한 묶음으로 쓰는 방식은 robots.txt 표준(RFC 9309)에 있는 형식입니다[5]. 경로와 사이트맵 주소는 병원 사이트에 맞게 바꿉니다.
# 검색용·사용자 요청 크롤러: 공개 페이지 허용
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
Disallow: /admin/
Disallow: /mypage/
# 학습용 크롤러: 병원 방침에 따라 Allow 또는 Disallow
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Allow: /
Disallow: /admin/
Disallow: /mypage/
# 그 밖의 로봇
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /mypage/
Sitemap: https://www.example-clinic.kr/sitemap.xml
로봇은 자기 이름이 적힌 묶음이 있으면 그 묶음만 따르고 * 묶음은 보지 않습니다[5]. 그래서 이름을 적은 묶음마다 닫을 경로를 다시 적어야 합니다.
5. 바꾼 뒤에는 어떻게 확인하나요?
- 브라우저 주소창에
병원주소/robots.txt를 넣어 바뀐 내용이 보이는지 봅니다. - 구글 서치콘솔의 robots.txt 보고서에서 구글이 읽은 버전과 오류를 확인합니다[6].
- 서버 방문 기록에서 OAI-SearchBot·PerplexityBot 같은 이름이 들어오기 시작하는지 봅니다. 방문이 쌓이는 데는 며칠 이상 걸릴 수 있습니다.
6. 참고자료
- 공식 문서 OpenAI, Overview of OpenAI Crawlers
- 공식 문서 Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?
- 공식 문서 Perplexity, Perplexity Crawlers
- 공식 문서 Google, Google's common crawlers (Google-Extended)
- 표준 IETF, RFC 9309 Robots Exclusion Protocol
- 공식 문서 Google, robots.txt 보고서
7. 자주 묻는 질문
- Q. 학습용 크롤러를 막으면 불이익이 있나요?
- OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot 설정이 서로 독립적이라고 설명합니다. 학습용만 막으면 검색 노출과는 별개로 학습에 쓰지 말라는 뜻을 밝히는 것입니다.
- Q. 모든 AI 크롤러를 한 번에 허용하는 방법은 없나요?
User-agent: *에Allow: /만 두면 이름을 따로 적지 않은 모든 로봇이 허용됩니다. 다만 이름을 적은 묶음이 하나라도 있으면 그 로봇은 그 묶음만 따르므로 두 규칙이 어긋나지 않는지 확인합니다.- Q. robots.txt를 고치면 바로 AI 답변에 나오나요?
- 아닙니다. robots.txt는 문을 여는 일이고, 크롤러가 다시 방문해 글을 읽고 답변 후보로 쓰기까지는 시간이 걸립니다. 본문 노출과 사이트맵도 함께 점검합니다.
- Q. 홈페이지 업체에 무엇을 전달하면 되나요?
- 위 예시처럼 열 크롤러 이름, 닫을 경로, 사이트맵 주소를 적어 전달하면 됩니다. 수정 뒤에는 주소창에서 robots.txt를 열어 반영 여부를 확인합니다.