기술

AI 크롤러 관리 — GPTBot·ClaudeBot·PerplexityBot 허용과 차단 전략

SEO Check 편집팀 · 2026-09-28 업데이트 · 7분 읽기

AI 크롤러는 AI 검색 답변에 인용하려고 방문하는 봇과 AI 모델 학습용 데이터를 모으는 봇으로 나뉩니다. AI 검색에 노출되고 싶다면 OAI-SearchBot·Claude-SearchBot·PerplexityBot 같은 검색 봇은 반드시 허용하고, GPTBot·ClaudeBot 같은 학습 봇은 콘텐츠 활용 정책에 따라 허용 여부를 정하면 됩니다. 두 종류를 구분하지 않고 한꺼번에 막으면 AI 검색 노출 기회까지 잃습니다.

AI 크롤러는 어떤 종류가 있나요?

2026년 9월 기준 주요 AI 크롤러와 robots.txt에서 쓰는 이름(User-agent 토큰)은 다음과 같습니다.

회사 검색·인용용 사용자 요청 시 방문 학습·데이터 수집용
OpenAI OAI-SearchBot (ChatGPT 검색) ChatGPT-User GPTBot
Anthropic Claude-SearchBot Claude-User ClaudeBot
Perplexity PerplexityBot Perplexity-User 없음
Google Googlebot (검색·AI 개요·AI 모드) — Google-Extended (제어 토큰)
Apple Applebot (Siri·Spotlight) — Applebot-Extended (제어 토큰)
기타 — — CCBot(Common Crawl), Bytespider(ByteDance), meta-externalagent(Meta), Amazonbot(Amazon)

예전 자료에 나오는 anthropic-ai, Claude-Web은 더 이상 쓰이지 않는 이름입니다. 현재 Anthropic의 봇은 위 표의 세 가지입니다. 한국 검색엔진인 네이버의 Yeti, 다음의 Daumoa는 AI 크롤러가 아니라 일반 검색 로봇이므로 항상 허용합니다.

검색·인용 봇과 학습 봇은 무엇이 다른가요?

  • 검색·인용 봇은 사용자가 질문했을 때 답변의 근거로 보여 줄 페이지를 수집합니다. 차단하면 해당 AI 검색에서 내 사이트가 출처로 인용되지 않고 클릭 유입도 생기지 않습니다.
  • 사용자 요청 봇은 사용자가 대화 중에 특정 URL을 읽어 달라고 할 때 방문합니다. 사용자가 직접 시킨 요청이라는 이유로 회사에 따라 robots.txt를 적용하지 않을 수 있다고 밝히고 있습니다.
  • 학습 봇은 차세대 모델을 훈련할 데이터를 모읍니다. 차단해도 AI 검색 노출에는 직접적인 영향이 없고, 대신 모델이 브랜드나 콘텐츠를 학습할 기회가 줄어듭니다.
  • 제어 토큰(Google-Extended, Applebot-Extended)은 실제로 방문하는 크롤러가 아닙니다. 기존 크롤러가 수집한 콘텐츠를 AI 학습 등에 써도 되는지 표시하는 이름입니다.

전략별 robots.txt 예시

어떤 전략이든 기존의 User-agent: * 규칙과 함께 써야 합니다. 특정 봇 그룹을 만들면 그 봇은 * 그룹 규칙을 무시한다는 점도 기억하세요. 자세한 문법은 robots.txt 작성법에서 다룹니다.

전략 A. 모두 허용 (AI 노출 최대화)

별도 규칙이 필요 없습니다. User-agent: *에서 막지 않으면 모든 AI 크롤러가 방문할 수 있습니다. 브랜드 인지도와 AI 인용이 중요한 소상공인·B2B 서비스 사이트에 적합합니다.

전략 B. 검색·인용은 허용, 학습은 차단 (가장 많이 쓰는 절충안)

# AI 학습용 수집 차단
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
Disallow: /

# 검색엔진·AI 검색 봇을 포함한 나머지
User-agent: *
Disallow: /admin/
Allow: /

Sitemap: https://www.example.co.kr/sitemap.xml

여러 User-agent 줄을 연달아 쓰면 하나의 그룹으로 묶여 같은 규칙이 적용됩니다. OAI-SearchBot·Claude-SearchBot·PerplexityBot은 * 그룹을 따르므로 허용된 상태가 됩니다.

전략 C. AI 크롤러 전면 차단

유료 콘텐츠나 독점 데이터가 핵심 자산이라면 검색 봇까지 막을 수 있습니다. 전략 B의 차단 그룹에 OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User를 추가하면 됩니다. 다만 AI 검색 답변에서 출처로 인용될 기회가 사라진다는 대가를 감수해야 합니다. 구글 AI 개요는 Googlebot을 사용하므로 이 방법으로는 빠지지 않습니다.

Google-Extended에 대한 흔한 오해

  • "막으면 AI 개요에서 빠진다" — 아닙니다. AI 개요와 AI 모드는 구글 검색의 기능이며 Googlebot이 수집한 콘텐츠를 사용합니다. AI 개요 노출만 따로 막는 robots.txt 규칙은 없습니다. nosnippet 같은 스니펫 제어 태그는 일반 검색 결과의 설명문에도 함께 영향을 줍니다.
  • "막으면 검색 순위가 떨어진다" — 아닙니다. 구글은 Google-Extended가 검색 순위 신호가 아니라고 안내합니다.
  • "서버 로그에 Google-Extended가 찍힌다" — 찍히지 않습니다. 별도의 방문 봇이 아니라 제어 토큰이기 때문입니다.

서버 로그로 AI 크롤러 방문을 확인하는 법

robots.txt 설정이 의도대로 작동하는지는 서버 접속 로그로 확인할 수 있습니다. Nginx 기준 예시입니다.

grep -oE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User|CCBot|Bytespider|meta-externalagent|Amazonbot|Applebot" /var/log/nginx/access.log | sort | uniq -c | sort -rn
  1. 위 명령으로 봇별 방문 횟수를 집계합니다.
  2. 허용한 검색 봇이 200을 받는지, 차단한 봇이 여전히 페이지를 가져가고 있지 않은지 봇별 로그를 확인합니다.
  3. 허용했는데 403이 보이면 robots.txt가 아니라 방화벽이나 CDN의 봇 차단 기능이 막고 있는 것입니다.
  4. User-agent는 위조할 수 있으므로 의심스러운 방문은 IP로 검증합니다. 구글봇은 역방향 DNS 조회로, OpenAI·Perplexity 등은 각 사의 크롤러 안내 문서에 공개된 IP 대역으로 확인할 수 있습니다.

robots.txt 외에 함께 확인할 것

  • CDN·웹방화벽의 AI 봇 차단 기능이 의도치 않게 켜져 있지 않다 (robots.txt보다 우선 적용됨)
  • 검색 봇이 읽을 수 있도록 본문이 HTML에 들어 있다 (자바스크립트로만 그리는 페이지는 AI 크롤러가 내용을 놓치기 쉬움)
  • Bing 웹마스터 도구에 등록했다 (Microsoft Copilot 등이 Bing 색인을 활용)
  • AI가 사이트를 빠르게 파악하도록 llms.txt를 제공한다

Cloudflare가 제안한 Content-Signal 줄처럼 검색·AI 입력·학습 용도별 의사를 표시하는 확장도 등장했지만, 이를 따를지는 각 회사의 선택입니다. AI 검색 인용을 늘리는 콘텐츠 전략은 GEO 가이드와 저자의 전자책 PART 4. On-Page GEO 전략을 참고하세요.

SEO Check에서는 이렇게 점검합니다

SEO Check는 robots.txt를 실제 매칭 규칙대로 해석해 봇별 허용 여부를 표로 보여 줍니다.

  • AI 검색 크롤러 허용 (중요): OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Applebot이 모두 허용되어야 통과입니다. 하나라도 막혀 있으면 AI 답변 인용 기회를 잃는다는 경고를 표시합니다.
  • AI 학습 크롤러 정책 (참고): GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, meta-externalagent, Bytespider, Amazonbot의 차단 현황을 보여 줍니다. 운영 정책의 문제이므로 점수에서 감점하지 않습니다.
  • GEO 준비도: AI 검색봇 접근, llms.txt 제공 여부, Organization 구조화 데이터 등을 함께 평가합니다.

무료 SEO 진단으로 현재 설정을 먼저 확인한 뒤, 위 전략 중 하나를 골라 적용해 보세요.

자주 묻는 질문

GPTBot을 차단하면 ChatGPT 검색에 나오지 않나요?
아닙니다. GPTBot은 모델 학습용 수집 봇이고, ChatGPT 검색 결과에 쓰이는 봇은 OAI-SearchBot입니다. GPTBot만 막고 OAI-SearchBot을 허용하면 학습에는 쓰이지 않으면서 검색 인용은 받을 수 있습니다.
Google-Extended를 막으면 구글 AI 개요(AI Overviews)에서 빠지나요?
빠지지 않습니다. Google-Extended는 Gemini 등의 학습·그라운딩 사용 여부만 정하는 토큰이고, 구글 검색과 AI 개요는 Googlebot이 수집한 콘텐츠를 사용합니다. 검색 순위에도 영향이 없습니다.
지금 차단하면 이미 학습된 내 콘텐츠도 삭제되나요?
아닙니다. robots.txt는 앞으로의 수집에만 적용됩니다. 이미 수집된 데이터의 처리는 각 회사의 정책에 따릅니다.
robots.txt를 지키지 않는 봇은 어떻게 막나요?
robots.txt는 권고일 뿐 강제력이 없습니다. 서버나 CDN의 방화벽에서 User-agent와 공식 IP 대역을 기준으로 차단해야 확실합니다.

이 항목, 내 사이트는 어떨까요?

무료 간편진단으로 AI 크롤러 관리를 포함한 핵심 항목을 1분 만에 확인하세요.

무료 진단하기