AI 크롤러 관리 — GPTBot·ClaudeBot·PerplexityBot 허용과 차단 전략
SEO Check 편집팀 · 2026-09-28 업데이트 · 7분 읽기
AI 크롤러는 AI 검색 답변에 인용하려고 방문하는 봇과 AI 모델 학습용 데이터를 모으는 봇으로 나뉩니다. AI 검색에 노출되고 싶다면 OAI-SearchBot·Claude-SearchBot·PerplexityBot 같은 검색 봇은 반드시 허용하고, GPTBot·ClaudeBot 같은 학습 봇은 콘텐츠 활용 정책에 따라 허용 여부를 정하면 됩니다. 두 종류를 구분하지 않고 한꺼번에 막으면 AI 검색 노출 기회까지 잃습니다.
AI 크롤러는 어떤 종류가 있나요?
2026년 9월 기준 주요 AI 크롤러와 robots.txt에서 쓰는 이름(User-agent 토큰)은 다음과 같습니다.
| 회사 | 검색·인용용 | 사용자 요청 시 방문 | 학습·데이터 수집용 |
|---|---|---|---|
| OpenAI | OAI-SearchBot (ChatGPT 검색) |
ChatGPT-User |
GPTBot |
| Anthropic | Claude-SearchBot |
Claude-User |
ClaudeBot |
| Perplexity | PerplexityBot |
Perplexity-User |
없음 |
Googlebot (검색·AI 개요·AI 모드) |
— | Google-Extended (제어 토큰) |
|
| Apple | Applebot (Siri·Spotlight) |
— | Applebot-Extended (제어 토큰) |
| 기타 | — | — | CCBot(Common Crawl), Bytespider(ByteDance), meta-externalagent(Meta), Amazonbot(Amazon) |
예전 자료에 나오는 anthropic-ai, Claude-Web은 더 이상 쓰이지 않는 이름입니다. 현재 Anthropic의 봇은 위 표의 세 가지입니다. 한국 검색엔진인 네이버의 Yeti, 다음의 Daumoa는 AI 크롤러가 아니라 일반 검색 로봇이므로 항상 허용합니다.
검색·인용 봇과 학습 봇은 무엇이 다른가요?
- 검색·인용 봇은 사용자가 질문했을 때 답변의 근거로 보여 줄 페이지를 수집합니다. 차단하면 해당 AI 검색에서 내 사이트가 출처로 인용되지 않고 클릭 유입도 생기지 않습니다.
- 사용자 요청 봇은 사용자가 대화 중에 특정 URL을 읽어 달라고 할 때 방문합니다. 사용자가 직접 시킨 요청이라는 이유로 회사에 따라 robots.txt를 적용하지 않을 수 있다고 밝히고 있습니다.
- 학습 봇은 차세대 모델을 훈련할 데이터를 모읍니다. 차단해도 AI 검색 노출에는 직접적인 영향이 없고, 대신 모델이 브랜드나 콘텐츠를 학습할 기회가 줄어듭니다.
- 제어 토큰(
Google-Extended,Applebot-Extended)은 실제로 방문하는 크롤러가 아닙니다. 기존 크롤러가 수집한 콘텐츠를 AI 학습 등에 써도 되는지 표시하는 이름입니다.
전략별 robots.txt 예시
어떤 전략이든 기존의 User-agent: * 규칙과 함께 써야 합니다. 특정 봇 그룹을 만들면 그 봇은 * 그룹 규칙을 무시한다는 점도 기억하세요. 자세한 문법은 robots.txt 작성법에서 다룹니다.
전략 A. 모두 허용 (AI 노출 최대화)
별도 규칙이 필요 없습니다. User-agent: *에서 막지 않으면 모든 AI 크롤러가 방문할 수 있습니다. 브랜드 인지도와 AI 인용이 중요한 소상공인·B2B 서비스 사이트에 적합합니다.
전략 B. 검색·인용은 허용, 학습은 차단 (가장 많이 쓰는 절충안)
# AI 학습용 수집 차단
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
Disallow: /
# 검색엔진·AI 검색 봇을 포함한 나머지
User-agent: *
Disallow: /admin/
Allow: /
Sitemap: https://www.example.co.kr/sitemap.xml
여러 User-agent 줄을 연달아 쓰면 하나의 그룹으로 묶여 같은 규칙이 적용됩니다. OAI-SearchBot·Claude-SearchBot·PerplexityBot은 * 그룹을 따르므로 허용된 상태가 됩니다.
전략 C. AI 크롤러 전면 차단
유료 콘텐츠나 독점 데이터가 핵심 자산이라면 검색 봇까지 막을 수 있습니다. 전략 B의 차단 그룹에 OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User를 추가하면 됩니다. 다만 AI 검색 답변에서 출처로 인용될 기회가 사라진다는 대가를 감수해야 합니다. 구글 AI 개요는 Googlebot을 사용하므로 이 방법으로는 빠지지 않습니다.
Google-Extended에 대한 흔한 오해
- "막으면 AI 개요에서 빠진다" — 아닙니다. AI 개요와 AI 모드는 구글 검색의 기능이며 Googlebot이 수집한 콘텐츠를 사용합니다. AI 개요 노출만 따로 막는 robots.txt 규칙은 없습니다.
nosnippet같은 스니펫 제어 태그는 일반 검색 결과의 설명문에도 함께 영향을 줍니다. - "막으면 검색 순위가 떨어진다" — 아닙니다. 구글은 Google-Extended가 검색 순위 신호가 아니라고 안내합니다.
- "서버 로그에 Google-Extended가 찍힌다" — 찍히지 않습니다. 별도의 방문 봇이 아니라 제어 토큰이기 때문입니다.
서버 로그로 AI 크롤러 방문을 확인하는 법
robots.txt 설정이 의도대로 작동하는지는 서버 접속 로그로 확인할 수 있습니다. Nginx 기준 예시입니다.
grep -oE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User|CCBot|Bytespider|meta-externalagent|Amazonbot|Applebot" /var/log/nginx/access.log | sort | uniq -c | sort -rn
- 위 명령으로 봇별 방문 횟수를 집계합니다.
- 허용한 검색 봇이 200을 받는지, 차단한 봇이 여전히 페이지를 가져가고 있지 않은지 봇별 로그를 확인합니다.
- 허용했는데 403이 보이면 robots.txt가 아니라 방화벽이나 CDN의 봇 차단 기능이 막고 있는 것입니다.
- User-agent는 위조할 수 있으므로 의심스러운 방문은 IP로 검증합니다. 구글봇은 역방향 DNS 조회로, OpenAI·Perplexity 등은 각 사의 크롤러 안내 문서에 공개된 IP 대역으로 확인할 수 있습니다.
robots.txt 외에 함께 확인할 것
- CDN·웹방화벽의 AI 봇 차단 기능이 의도치 않게 켜져 있지 않다 (robots.txt보다 우선 적용됨)
- 검색 봇이 읽을 수 있도록 본문이 HTML에 들어 있다 (자바스크립트로만 그리는 페이지는 AI 크롤러가 내용을 놓치기 쉬움)
- Bing 웹마스터 도구에 등록했다 (Microsoft Copilot 등이 Bing 색인을 활용)
- AI가 사이트를 빠르게 파악하도록 llms.txt를 제공한다
Cloudflare가 제안한 Content-Signal 줄처럼 검색·AI 입력·학습 용도별 의사를 표시하는 확장도 등장했지만, 이를 따를지는 각 회사의 선택입니다. AI 검색 인용을 늘리는 콘텐츠 전략은 GEO 가이드와 저자의 전자책 PART 4. On-Page GEO 전략을 참고하세요.
SEO Check에서는 이렇게 점검합니다
SEO Check는 robots.txt를 실제 매칭 규칙대로 해석해 봇별 허용 여부를 표로 보여 줍니다.
- AI 검색 크롤러 허용 (중요): OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Applebot이 모두 허용되어야 통과입니다. 하나라도 막혀 있으면 AI 답변 인용 기회를 잃는다는 경고를 표시합니다.
- AI 학습 크롤러 정책 (참고): GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, meta-externalagent, Bytespider, Amazonbot의 차단 현황을 보여 줍니다. 운영 정책의 문제이므로 점수에서 감점하지 않습니다.
- GEO 준비도: AI 검색봇 접근, llms.txt 제공 여부, Organization 구조화 데이터 등을 함께 평가합니다.
무료 SEO 진단으로 현재 설정을 먼저 확인한 뒤, 위 전략 중 하나를 골라 적용해 보세요.
자주 묻는 질문
GPTBot을 차단하면 ChatGPT 검색에 나오지 않나요?
Google-Extended를 막으면 구글 AI 개요(AI Overviews)에서 빠지나요?
지금 차단하면 이미 학습된 내 콘텐츠도 삭제되나요?
robots.txt를 지키지 않는 봇은 어떻게 막나요?
이 항목, 내 사이트는 어떨까요?
무료 간편진단으로 AI 크롤러 관리를 포함한 핵심 항목을 1분 만에 확인하세요.