AI·자동화 트렌드
GPTBot·ClaudeBot·PerplexityBot, robots.txt에서 막아야 할까 열어야 할까 — 크롤러별 설정 가이드
GPTBot·ClaudeBot·PerplexityBot, robots.txt에서 막아야 할까 열어야 할까 — 크롤러별 설정 가이드
robots.txt에 Disallow: / 한 줄을 무심코 넣었다가, 몇 주 뒤 "왜 우리 회사가 Perplexity 답변에 안 뜨죠…?" 하고 머리를 긁는 마케팅 담당자를 종종 만나요. 반대로 아무것도 안 건드렸는데 서버 로그가 AI 봇 트래픽으로 도배되기도 하고요. AI 크롤러는 "막느냐 여느냐"를 켜고 끄는 단순한 스위치가 아니거든요. 봇마다 하는 일이 제각각이라, 한 스위치로 다 끄면 열어둬야 할 문까지 같이 닫혀 버려요. 🤖
핵심부터 짚을게요. AI 크롤러를 막으면 앞으로의 학습 데이터에선 빠지지만, ChatGPT·Perplexity의 실시간 인용까지 자동으로 막히는 건 아니에요. 학습하는 봇과, 검색해서 인용하는 봇이 서로 다른 식구거든요.
세 줄 요약부터 보세요.
- 학습용 봇(GPTBot·ClaudeBot)을 막으면 미래 모델 학습에서만 빠집니다. 과거 학습분은 소급되지 않습니다.
- 검색·인용용 봇(OAI-SearchBot·PerplexityBot)은 별개 개체라, 학습 봇을 막아도 이쪽을 열어두면 AI 검색은 계속 내 페이지를 인용합니다.
- Googlebot과도 완전히 별개라 GPTBot을 막아도 구글 검색 순위는 흔들리지 않습니다.
그래서 판단은 콘텐츠 성격 하나로 갈립니다. 콘텐츠가 자산이냐, 유입 통로냐. 아래 "크롤러 3분법"으로 정리해 드릴게요.
AI 크롤러, 정확히 뭘 가져가나요?
크게 세 부류예요. 모델을 학습시키려 콘텐츠를 수집하는 봇, AI 검색이 인용하려 색인하는 봇, 그리고 사용자가 링크를 툭 던졌을 때 그 자리에서 읽고 오는 봇. 이름이 비슷해서 헷갈리지만 하는 일은 꽤 달라요.
- GPTBot은 OpenAI의 모델 학습용 크롤러예요. 2023년 여름 공개됐고, OpenAI는 robots.txt를 따른다고 문서에 명시하고 있어요.1 같은 OpenAI라도
OAI-SearchBot은 ChatGPT 검색 색인용,ChatGPT-User는 사용자 요청 시 실시간 페치용으로 역할이 갈려요. - ClaudeBot은 Anthropic의 학습용 크롤러예요. 사용자 요청으로 웹을 읽는
Claude-User와는 별개고요.2 - PerplexityBot은 Perplexity가 답변에 인용할 페이지를 색인하는 봇이에요.
- Google-Extended는 봇이 아니라 robots.txt 제어 토큰이에요. Gemini 등 구글 AI 학습에서 빼달라는 신호이고, 2023년 9월 도입됐어요.3
- CCBot은 Common Crawl의 공개 웹 아카이브 봇인데, 여러 AI 학습셋이 이 데이터를 간접적으로 가져다 써요.
한 장으로 정리하면 이렇게 나뉘어요.
| 봇 | 부류 | 하는 일 | 이 봇을 막으면 |
|---|---|---|---|
| GPTBot | 학습 | 모델 학습용 수집 | 앞으로의 학습에서 제외 |
| ClaudeBot | 학습 | 모델 학습용 수집 | 앞으로의 Claude 학습에서 제외 |
| CCBot | 학습 | 공개 웹 아카이브 | 다수 학습셋에서 간접 제외 |
| Google-Extended | 학습(토큰) | Gemini 학습 제어 | Gemini 학습 제외 · 구글 순위 무관 |
| OAI-SearchBot | 검색·인용 | ChatGPT 검색 색인 | ChatGPT 검색 인용 감소 |
| PerplexityBot | 검색·인용 | Perplexity 색인 | Perplexity 답변 인용 감소 |
| ChatGPT-User / Claude-User | 요약(요청) | 사용자가 준 링크를 즉석에서 읽음 | 사용자 요청 응답이 불완전해질 수 있음 |
robots.txt 차단, SEO에는 영향 없나요?
안 떨어져요. 여기서 마음을 놓으셔도 돼요. 구글 검색 색인은 Googlebot이 담당하고, GPTBot·ClaudeBot·Google-Extended는 완전히 다른 식구예요. GPTBot한테 문을 잠가도 Googlebot은 자기 열쇠로 그대로 드나들거든요. 그래서 검색 순위는 흔들리지 않아요.
보충. Google-Extended가 굳이 별도 토큰으로 나온 이유가 이거예요. AI 학습 거부와 검색 노출을 분리해서, "구글엔 검색되고 싶지만 Gemini 학습엔 쓰이긴 싫다"는 선택을 가능하게 한 장치죠.
그럼 GEO(AI 검색 노출)엔 영향이 있나요?
바로 여기서 갈려요. 학습용 봇을 막는 것과, 실시간 인용용 봇을 막는 건 결과가 정반대거든요. 같은 "차단"이라도 어느 쪽을 잠그느냐에 따라 득이 되기도, 손해가 되기도 해요.
GPTBot(학습)을 막아도 OAI-SearchBot(검색)을 열어두면 ChatGPT 검색은 여전히 내 페이지를 잘 인용해요. 그러니 유입이 목표라면, 잠글 곳과 열어둘 곳을 나눠서 봐야 해요.
크롤러별 robots.txt 설정 가이드
이제 실전이에요. 목표에 따라 어떤 줄을 넣으면 되는지 먼저 표로 정리해 둘게요. 여기서 자기 상황에 맞는 칸을 고르고, 아래 코드를 복사해 쓰면 돼요.
| 목표 | 넣을 설정 |
|---|---|
| AI 학습만 빼고 검색·인용은 열기 | 학습 봇(GPTBot·ClaudeBot·CCBot·Google-Extended)에 Disallow: / |
| 특정 폴더만 가리기 | 해당 봇에 Disallow: /members/ 처럼 경로 지정 |
| AI에 아무것도 안 주기 | User-agent: * + Disallow: / (검색 노출까지 포기하는 강수) |
| 다 열기 | 아무것도 안 적기 (기본값이 전면 허용) |
User-agent로 봇을 지정하고 Disallow로 경로를 막는 구조예요.
# 학습용 봇만 차단, 검색·인용 봇은 허용
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# 특정 경로만 차단 (예: 회원 전용 콘텐츠)
User-agent: GPTBot
Disallow: /members/
# 전면 차단
User-agent: *
Disallow: /
참고로 아무 설정도 없으면 기본값은 "모두 허용"이에요. 그리고 파일은 꼭 도메인 최상단(/robots.txt)에 둬야 읽혀요. 하위 폴더에 숨겨두면 봇은 거기까지 찾아보지 않거든요.
"robots.txt를 무시한다"는 논란, 사실인가요?
안타깝게도, 일부 봇은 사실로 보도됐어요. robots.txt는 사실 문에 붙여둔 "들어오지 마세요" 쪽지에 가깝거든요. 예의 있는 손님은 지키지만, 마음먹고 창문으로 넘어오는 손님까지 막아주진 못해요.
실제로 2024년 6월 Wired는 Perplexity가 크롤링을 차단한 사이트의 콘텐츠에 접근했다고 보도했고4, 2025년엔 Cloudflare가 "정체를 숨긴 크롤러로 차단을 우회했다"며 Perplexity를 검증된 봇 목록에서 제외했어요.5
그래서 robots.txt는 규칙을 지키는 봇에만 통하는 신사협정이에요. 정말 강제로 막고 싶다면 WAF나 방화벽 차원의 차단을 함께 걸어야 하고요. Cloudflare가 2024년 'AI 봇 원클릭 차단' 기능을 내놓은 것도 딱 이런 이유예요.6
클래스도산 크롤러 3분법: 학습·실시간·요약
크롤러를 이름 그대로 세 층으로 나눠 보면 결정이 한결 쉬워져요.
- 학습층(Training) — GPTBot·ClaudeBot·CCBot·Google-Extended. 내 콘텐츠가 모델의 "기억"이 되는 통로예요. 리포트·유료 자료처럼 콘텐츠 자체가 자산이라면 여기부터 잠그면 돼요.
- 실시간층(Retrieval) — PerplexityBot·OAI-SearchBot. AI 검색이 지금 이 순간 내 페이지를 찾아 인용하는 통로예요. 유입이 목표라면 여기는 꼭 열어두세요.
- 요약층(User-fetch) — ChatGPT-User·Claude-User처럼 사용자가 링크를 건네면 그 자리에서 읽어오는 봇이에요.
판단 기준은 딱 한 줄이에요. 자산형 콘텐츠는 학습층을 잠그고, 유입형 콘텐츠는 실시간층을 연다. 이 둘을 뭉뚱그려서 한 번에 막아버리는 순간 손해가 시작돼요.
결론: 막을까 열까 — 우리 사이트는 어느 쪽인가
- 미디어·언론: 콘텐츠가 곧 상품이라 학습층 차단이 합리적이에요. 2023년 뉴욕타임스를 비롯한 주요 언론사가 GPTBot을 막은 것도 같은 맥락이고요.
- 커머스: 노출이 곧 매출로 이어지는 구조라면 여는 편이 나아요. 상품이 AI 검색에 자주 걸릴수록 만나는 접점이 늘어나니까요.
- B2B·콘텐츠 마케팅: 실시간층을 활짝 여세요. 블로그로 권위를 쌓아 AI 검색 인용을 노리는 전략인데 여기를 막아버리면, 애써 쌓은 노력을 스스로 지우개로 지우는 셈이거든요.
우리 사이트가 "읽히는 게 곧 영업"인 쪽이라면, 오늘 robots.txt를 한번 열어서 실시간층부터 점검해 보세요. 5분이면 충분하고, 그 5분이 AI 검색에서 우리 이름이 불릴지 말지를 가르거든요.
자주 묻는 질문(FAQ)
Q. GPTBot을 막으면 구글 검색 순위가 떨어지나요? A. 아니요, 안 떨어져요. Googlebot과 완전히 별개라 검색 순위엔 영향이 없어요.
Q. robots.txt만으로 완벽히 차단되나요? A. 규칙을 지키는 봇에만 통해요. 확실히 막고 싶다면 Cloudflare 같은 WAF 차단을 함께 걸어주세요.
Q. 이미 학습된 내용도 지워지나요? A. 아쉽지만 아니에요. robots.txt는 앞으로의 수집만 막지, 과거에 이미 학습된 분까진 소급해서 지우지 못해요.
Q. B2B 블로그는 막는 게 나은가요, 여는 게 나은가요? A. 유입이 목표라면 실시간층(PerplexityBot·OAI-SearchBot)은 꼭 열어두세요. 그게 우리 글이 AI 답변에 인용될 통로거든요.
출처
Footnotes
-
OpenAI, "GPTBot / OAI-SearchBot / ChatGPT-User" 봇 문서 — https://platform.openai.com/docs/bots ↩
-
Anthropic 지원 문서, "Does Anthropic crawl data from the web, and how can site owners block the crawler?" — https://support.anthropic.com/en/articles/8896518 ↩
-
Google Search Central, "Google crawlers" — Google-Extended 항목 — https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers ↩
-
Wired, "Perplexity Is a Bullshit Machine"(2024년 6월) — https://www.wired.com/story/perplexity-is-a-bullshit-machine/ ↩
-
Cloudflare 블로그, "Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives"(2025) — https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/ ↩
-
Cloudflare 블로그, AI 봇 원클릭 차단 기능 발표(2024) — https://blog.cloudflare.com/declaring-your-aindependence-block-ai-bots-scrapers-and-crawlers-with-a-single-click/ ↩