클래스도산

AI·자동화 트렌드

GPTBot·ClaudeBot·PerplexityBot, robots.txt에서 막아야 할까 열어야 할까 — 크롤러별 설정 가이드

GPTBot·ClaudeBot·PerplexityBot, robots.txt에서 막아야 할까 열어야 할까 — 크롤러별 설정 가이드

robots.txt에 Disallow: / 한 줄을 잘못 넣었다가, 몇 주 뒤 "왜 우리 회사가 Perplexity 답변에 안 뜨죠?"라는 질문을 받는 마케팅 담당자를 종종 봅니다. 반대로 아무것도 안 건드렸는데 서버 로그가 AI 봇 트래픽으로 도배되기도 하죠. AI 크롤러는 "막느냐 여느냐"의 단순한 스위치가 아닙니다. 봇마다 하는 일이 다르거든요.

핵심부터 답하면, AI 크롤러를 막으면 학습 데이터에선 빠지지만 ChatGPT·Perplexity의 실시간 인용까지 자동으로 막히는 건 아닙니다. 학습용 봇과 검색·인용용 봇은 서로 다른 개체이기 때문입니다.

세 줄 요약부터 보세요.

  1. 학습용 봇(GPTBot·ClaudeBot)을 막으면 미래 모델 학습에서만 빠집니다. 과거 학습분은 소급되지 않습니다.
  2. 검색·인용용 봇(OAI-SearchBot·PerplexityBot)은 별개 개체라, 학습 봇을 막아도 이쪽을 열어두면 AI 검색은 계속 내 페이지를 인용합니다.
  3. Googlebot과도 완전히 별개라 GPTBot을 막아도 구글 검색 순위는 흔들리지 않습니다.

그래서 판단은 콘텐츠 성격 하나로 갈립니다. 콘텐츠가 자산이냐, 유입 통로냐. 아래 "크롤러 3분법"으로 정리해 드릴게요.

AI 크롤러, 정확히 뭘 가져가나요?

학습용·검색용·즉석 페치용, 세 부류입니다. 모델을 학습시키려 수집하는 봇, AI 검색이 인용하려 색인하는 봇, 사용자가 링크를 던졌을 때 그 자리에서 읽는 봇으로 나뉩니다.

  • GPTBot은 OpenAI의 모델 학습용 크롤러입니다. 2023년 여름 공개됐고, OpenAI는 robots.txt를 따른다고 문서에 명시합니다.1 같은 OpenAI라도 OAI-SearchBot은 ChatGPT 검색 색인용, ChatGPT-User는 사용자 요청 시 실시간 페치용으로 역할이 갈립니다.
  • ClaudeBot은 Anthropic의 학습용 크롤러입니다. 사용자 요청으로 웹을 읽는 Claude-User와는 별개입니다.2
  • PerplexityBot은 Perplexity가 답변에 인용할 페이지를 색인하는 봇입니다.
  • Google-Extended는 봇이 아니라 robots.txt 제어 토큰입니다. Gemini 등 구글 AI 학습에서 빼달라는 신호이며 2023년 9월 도입됐습니다.3
  • CCBot은 Common Crawl의 공개 웹 아카이브 봇으로, 여러 AI 학습셋이 이 데이터를 간접적으로 씁니다.

robots.txt 차단, SEO에는 영향 없나요?

없습니다. 구글 검색 색인은 Googlebot이 담당하고, GPTBot·ClaudeBot·Google-Extended는 완전히 다른 개체입니다. GPTBot을 막아도 Googlebot은 그대로 돌기 때문에 검색 순위는 흔들리지 않습니다.

보충. Google-Extended가 별도 토큰으로 나온 이유가 이겁니다. AI 학습 거부와 검색 노출을 분리해서, "구글엔 검색되고 싶지만 Gemini 학습엔 쓰이기 싫다"는 선택을 가능하게 한 장치입니다.

그럼 GEO(AI 검색 노출)엔 영향이 있나요?

여기서 갈립니다. 학습용 봇을 막는 것과 실시간 인용용 봇을 막는 것은 결과가 정반대입니다.

크롤러주체하는 일막으면
GPTBotOpenAI모델 학습 수집향후 학습 제외 · 실시간 인용 영향 적음
OAI-SearchBotOpenAIChatGPT 검색 색인ChatGPT 검색 인용 감소
ClaudeBotAnthropic모델 학습 수집향후 Claude 학습 제외
PerplexityBotPerplexityPerplexity 색인Perplexity 답변 인용 감소
Google-ExtendedGoogleGemini 학습 제어Gemini 학습 제외 · 구글 순위 무관
CCBotCommon Crawl공개 웹 아카이브다수 학습셋에서 간접 제외

GPTBot(학습)을 막아도 OAI-SearchBot(검색)을 열어두면 ChatGPT 검색은 여전히 내 페이지를 인용합니다. 유입을 원한다면 잠글 곳과 열어둘 곳이 다릅니다.

크롤러별 robots.txt 설정 가이드

User-agent로 봇을 지정하고 Disallow로 경로를 막습니다.

# 학습용 봇만 차단, 검색·인용 봇은 허용
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# 특정 경로만 차단 (예: 회원 전용 콘텐츠)
User-agent: GPTBot
Disallow: /members/

# 전면 차단
User-agent: *
Disallow: /

아무 설정도 없으면 기본값은 "모두 허용"입니다. 파일은 도메인 최상단(/robots.txt)에 둬야 읽힙니다.

"robots.txt를 무시한다"는 논란, 사실인가요?

일부 봇은 사실로 보도됐습니다. 2024년 6월 Wired는 Perplexity가 크롤링을 차단한 사이트의 콘텐츠에 접근했다는 조사를 냈고,4 이후 Cloudflare는 Perplexity가 정체를 숨긴 크롤러로 차단을 우회했다고 보고하며 검증된 봇 목록에서 제외했습니다.5 robots.txt는 규칙을 지키는 봇에만 유효한 신사협정입니다. 강제로 막으려면 WAF나 방화벽 차원의 차단이 필요합니다. Cloudflare가 2024년 AI 봇 원클릭 차단 기능을 내놓은 것도 이 때문입니다.6

AX Lab 크롤러 3분법: 학습·실시간·요약

크롤러를 이름 그대로 세 층으로 나눠 보면 결정이 쉬워집니다.

  1. 학습층(Training) — GPTBot·ClaudeBot·CCBot·Google-Extended. 내 콘텐츠가 모델의 "기억"이 되는 통로입니다. 리포트·유료 자료처럼 콘텐츠 자체가 자산이라면 여기부터 잠급니다.
  2. 실시간층(Retrieval) — PerplexityBot·OAI-SearchBot. AI 검색이 지금 내 페이지를 찾아 인용하는 통로입니다. 유입이 목표라면 반드시 엽니다.
  3. 요약층(User-fetch) — ChatGPT-User·Claude-User 등 사용자가 링크를 건네면 그 자리에서 읽는 봇입니다.

판단 기준은 한 줄입니다. 자산형 콘텐츠는 학습층을 잠그고, 유입형 콘텐츠는 실시간층을 엽니다. 이 둘을 뭉뚱그리는 순간 손해를 봅니다.

결론: 막을까 열까 — 우리 사이트는 어느 쪽인가

  • 미디어·언론: 콘텐츠가 곧 상품이라 학습층 차단이 합리적입니다. 2023년 뉴욕타임스를 비롯한 주요 언론사가 GPTBot을 막은 이유입니다.
  • 커머스: 노출이 매출로 이어지는 구조라면 여는 편이 낫습니다. 상품이 AI 검색에 더 자주 걸릴수록 접점이 늘기 때문입니다.
  • B2B·콘텐츠 마케팅: 실시간층을 활짝 여세요. 블로그로 권위를 쌓아 AI 검색 인용을 노리는 전략이라면, 막는 순간 그 노력을 스스로 지우는 셈입니다.

우리 사이트가 "읽히는 게 곧 영업"인 쪽이라면, 오늘 robots.txt를 열어 실시간층부터 점검하세요.

자주 묻는 질문(FAQ)

Q. GPTBot을 막으면 구글 검색 순위가 떨어지나요? A. 아니요. Googlebot과 완전히 별개라 검색 순위엔 영향이 없습니다.

Q. robots.txt만으로 완벽히 차단되나요? A. 규칙을 지키는 봇에만 유효합니다. 강제하려면 Cloudflare 같은 WAF 차단을 병행하세요.

Q. 이미 학습된 내용도 지워지나요? A. 아니요. robots.txt는 앞으로의 수집만 막고 과거 학습분엔 소급되지 않습니다.

Q. B2B 블로그는 막는 게 나은가요, 여는 게 나은가요? A. 유입이 목표라면 실시간층(PerplexityBot·OAI-SearchBot)은 반드시 여세요.

출처

Footnotes

  1. OpenAI, "GPTBot / OAI-SearchBot / ChatGPT-User" 봇 문서 — https://platform.openai.com/docs/bots

  2. Anthropic 지원 문서, "Does Anthropic crawl data from the web, and how can site owners block the crawler?" — https://support.anthropic.com/en/articles/8896518

  3. Google Search Central, "Google crawlers" — Google-Extended 항목 — https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers

  4. Wired, "Perplexity Is a Bullshit Machine"(2024년 6월) — https://www.wired.com/story/perplexity-is-a-bullshit-machine/

  5. Cloudflare 블로그, "Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives"(2025) — https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/

  6. Cloudflare 블로그, AI 봇 원클릭 차단 기능 발표(2024) — https://blog.cloudflare.com/declaring-your-aindependence-block-ai-bots-scrapers-and-crawlers-with-a-single-click/