AI·자동화 트렌드
GEO 성과 측정법: 인용 점유율 세는 4가지 방법
GEO 성과 측정은 어떻게 하나요 — 인용 점유율을 세는 4가지 방법
GEO 성과는 검색 순위가 아니라 AI 답변 속 인용 점유율로 측정해요.
구글 순위는 3위에서 꼼짝도 안 하는데 문의 폼만 석 달째 조용한 상황, 겪어보셨을 거예요. 대시보드에는 빨간불이 없습니다. 그런데 영업팀은 "요즘 리드가 이미 우리 이름을 알고 들어온다"고 말하죠. 어디서 알았는지는 아무도 모릅니다.
측정 순서는 이렇게 짭니다.
- 프롬프트 샘플링 — 30~50개 질문을 직접 던져 인용 여부를 기록해요.
- AI 가시성 트래킹 툴 — 조회량이 사람 손을 넘어가면 자동화로 넘깁니다.
- 서버 로그·GA4 — 크롤러 종류와 리퍼럴 세션을 분리해서 봐요.
- 인용 품질 채점 — 횟수가 아니라 인용의 정확성·맥락·위치를 봅니다.
Gartner는 2024년 2월, AI 챗봇과 가상 에이전트 확산으로 2026년까지 전통 검색엔진 이용량이 25% 줄 것으로 전망했어요.1 그 25%가 어디로 가는지는 예측에 없습니다. 제 해석은 이렇습니다. 사라지는 게 아니라, 기존 SEO 리포트의 어느 칸에도 안 잡히는 곳으로 옮겨갑니다.
인용 점유율은 정확히 무엇을 세는 값인가요?
동일한 프롬프트 집합에서 우리 브랜드가 인용된 응답 수 ÷ 전체 응답 수입니다. 같은 프롬프트를 3회 던져 2회 이상 인용되면 1건으로 집계하세요. 한 번 물어보고 "안 나오네" 하는 게 이 작업에서 가장 흔한 실수예요.
GEO(Generative Engine Optimization, 생성엔진 최적화)는 2024년 KDD에서 발표된 논문 『GEO: Generative Engine Optimization』이 처음 정식화한 개념입니다. 프린스턴대·조지아공대·앨런AI연구소 연구진은 생성엔진 답변에서 콘텐츠 가시성을 최대 40%까지 높이는 방법을 제시하고, 검증용으로 질의 1만 개 규모의 벤치마크 GEO-bench를 만들었어요.2
실무자가 가져갈 건 40%가 아니라 이 논문의 측정 방식입니다. 연구진은 가시성을 인용 여부로 세지 않고, 답변 안에서 해당 문장이 차지한 위치와 분량을 가중한 지표로 나눠 봤어요. 이진 카운트로는 성과가 안 보인다는 뜻이죠.
보충. SEO 순위는 정답 목록 하나라 어제와 오늘이 거의 같아요. 생성엔진은 같은 질문에 매번 조금 다르게 답합니다. GEO는 순위표가 아니라 여론조사에 가깝습니다. 표본을 설계해야 숫자가 의미를 갖죠.
방법 1 — 프롬프트를 손으로 물어보고 기록해도 되나요?
됩니다. 단, 표본 설계를 안 하면 그냥 기분입니다.
프롬프트는 30~50개로 시작하세요. "기업 AI 교육 추천"처럼 카테고리를 묻는 질문, "비개발자도 코딩 배울 수 있나" 같은 문제 인식 질문, "A사 B사 비교" 같은 대안 검토 질문을 구매 여정별로 3등분합니다. 나중에 "우리는 비교 단계에서만 빠진다"는 진단이 여기서 나와요.
통제할 변수는 네 개입니다. 로그인 상태(개인화 메모리가 결과를 바꿉니다), 대화 신규 여부(반드시 새 대화), 요일·시간대, 반복 횟수. 논문이 위치와 분량까지 가중해 센 이유도 같습니다. 조건을 고정하지 않으면 비교 자체가 성립하지 않아요.
기록은 스프레드시트 한 장이면 됩니다. 날짜, 모델, 프롬프트, 인용 여부, 인용된 URL, 답변 내 등장 순서, 함께 언급된 경쟁사. 이 일곱 칸이 3개월 쌓이면 어떤 툴보다 정확한 자사 데이터가 됩니다.
방법 2 — 전용 추적 툴은 언제부터 필요한가요?
프롬프트 50개 × 모델 4개 × 주 1회를 넘는 순간, 즉 주당 200회 조회부터요. 그걸 손으로 하면 다른 일을 못 해요.
AI 가시성 트래킹 툴은 2025년부터 SEO 스위트의 기본 모듈로 들어왔습니다. Ahrefs의 Brand Radar, Semrush의 AI 툴킷이 기존 제품에 붙인 AI 답변 모니터링 기능이고, 이 영역만 전문으로 하는 신생 제품군도 있어요. 하는 일은 같습니다. 프롬프트 세트를 주기적으로 여러 모델에 던지고, 브랜드·경쟁사 언급과 인용 도메인을 파싱해 점유율로 환산해 줍니다.
| 측정 방법 | 자동화되는 것 | 남는 한계 |
|---|---|---|
| 수동 프롬프트 샘플링 | 없음 (사람이 직접 기록) | 주 200회 조회부터 인건비로 감당 불가 |
| AI 가시성 트래킹 툴 | 다모델 반복 조회·인용 파싱·점유율 집계 | 인용 맥락의 적합성 판단은 사람 몫 |
| 서버 로그·GA4 분석 | 크롤러 방문·리퍼럴 세션 집계 | 인용됐지만 클릭 없는 노출은 안 잡힘 |
툴 성능은 제품마다 달라 여기서 우열을 말하지 않겠습니다. 대신 방법 1을 최소 한 달 돌린 다음 도입하세요. 프롬프트 세트를 직접 만들어 본 팀만 툴이 뱉은 숫자가 틀렸을 때 알아챕니다.
방법 3 — 서버 로그로 AI 크롤러와 사람 유입을 나눌 수 있나요?
나눠집니다. 크롤러 종류를 섞으면 인용이 늘었다고 오판하게 돼요.
OpenAI는 용도가 다른 크롤러 셋을 공개합니다. GPTBot은 모델 학습용 수집, OAI-SearchBot은 ChatGPT 검색에 실을 페이지 색인, ChatGPT-User는 사용자가 질문한 순간 실시간으로 페이지를 여는 요청이에요.3 인용과 직결되는 건 뒤의 둘입니다. GPTBot 방문이 늘어난 건 학습 수집이 늘어난 것일 뿐이죠. Perplexity도 색인용 PerplexityBot과 사용자 요청 기반 Perplexity-User를 구분해 문서화하고 있습니다.4 Google은 AI Overviews 노출이 일반 Googlebot 색인을 따르고, Google-Extended는 Gemini 계열 학습 활용을 제어하는 별도 토큰이라고 명시했어요.5
실무 팁 하나. ChatGPT-User나 Perplexity-User 로그는 "누군가 지금 그 질문을 했다"는 신호입니다. 실시간 조회를 자주 받는 URL을 보면 프롬프트 세트에 넣을 질문이 역산돼요.
사람 유입은 GA4 참조 소스에서 chatgpt.com, perplexity.ai, gemini.google.com, copilot.microsoft.com으로 잡힙니다. 앱에서 링크를 열면 리퍼러가 빠져 "직접 유입"으로 섞이니, AI 유입 세션은 항상 과소 집계로 보고 절대값이 아닌 추세로 읽으세요.
방법 4 — 인용 품질은 어떻게 채점하나요: 인용 3조건
인용이 늘었는데 리드가 안 늘면 볼 곳은 세 군데입니다. AX Lab은 이 진단 기준을 인용 3조건으로 부릅니다.
| 조건 | 판단 기준(임계값) | 어긋났을 때 증상 |
|---|---|---|
| 정확성 | 인용된 수치·대상·조건이 원문과 불일치 0건 | 잘못된 조건으로 소개돼 문의 후 이탈 |
| 맥락 적합성 | 우리가 파는 문제를 묻는 프롬프트에서만 인용 | 무관한 질문에 등장, 인용은 늘고 전환은 그대로 |
| 포지션 | 답변 첫 3분의 1 안 + 나열이 아닌 추천 근거로 등장 | 경쟁사 목록 끝에 곁들여져 클릭 0 |
셋 중 하나만 무너져도 점유율 그래프는 우상향하는데 파이프라인은 평평합니다. 특히 맥락 적합성이 놓치기 쉬워요. 글이 잘 써졌다는 이유로 엉뚱한 질문의 근거로도 끌려오면, 인용은 남의 고객 앞에서만 늘어난 셈이죠.
측정 주기와 경영진 보고는 어떻게 짜나요?
주간·월간·분기 세 겹으로 나누면 보고가 깔끔해집니다.
- 주간 — 프롬프트 세트 고정 조회, 인용 점유율과 경쟁사 동반 언급만 기록해요. 해석은 붙이지 않습니다. 응답이 흔들리니 한 주 하락의 원인 분석은 시간 낭비예요.
- 월간 — 인용 3조건으로 품질을 채점하고 경쟁사 점유율을 나란히 놓습니다. 콘텐츠 액션은 이 단위에서 결정하세요.
- 분기 — GA4의 AI 참조 세션과 실제 문의·상담 데이터를 붙여, 인용이 매출 대화로 이어졌는지 확인합니다.
보고서는 세 줄로 충분해요. 인용 점유율(자사·경쟁사), 인용 품질 점수, AI 참조 세션 추세. 여기에 "지난달 대비 어떤 프롬프트 군에서 빠졌는지" 한 문장을 붙이면 설명이 끝납니다.
이번 주에 프롬프트 30개부터 적어보세요. 측정 스프레드시트와 자동 수집 스크립트를 비개발자가 직접 만드는 방법은 AX Lab의 클로드 바이브 코딩 원데이 클래스(5시간, 결과물 1개 완성)에서 다룹니다.
자주 묻는 질문
Q. GEO 성과를 SEO 순위 지표로 대체해서 볼 수 있나요? A. 안 됩니다. 순위는 하나의 결과 목록에서의 위치, 인용 점유율은 매번 달라지는 여러 응답에서의 등장 비율이에요. 변동성이 달라 같은 그래프에 올리면 해석이 망가집니다.
Q. 경쟁사 인용 점유율은 어떻게 알 수 있나요? A. 우리 프롬프트 세트를 그대로 쓰면 됩니다. 같은 응답 안에 등장한 브랜드명을 전부 기록하면 자사·경쟁사 점유율이 같은 분모로 계산돼요. 기록 시트에 "함께 언급된 경쟁사" 칸을 두는 이유입니다.
Q. GPTBot 방문이 늘면 ChatGPT 인용도 늘어난 건가요? A. 아니에요. GPTBot은 학습용 수집이고, 색인과 실시간 조회는 OAI-SearchBot과 ChatGPT-User가 담당합니다. 인용 신호로 볼 건 뒤의 둘입니다.
Q. 측정을 시작하면 언제쯤 변화가 보이나요? A. 주 단위 등락은 응답 변동이라 신호가 아닙니다. 판단은 월 단위 3개 시점, 즉 최소 3개월치가 모인 뒤에 하세요. 그 전에 할 일은 프롬프트 세트와 집계 규칙을 바꾸지 않고 유지하는 것뿐이에요.
출처
각주 5건은 모두 실재하는 1차 자료입니다. 다만 크롤러 문서는 URL 경로가 개정되는 편이니, 인용 전에 한 번 열어 확인하시길 권해요.
Footnotes
-
Gartner, 「Gartner Predicts Search Engine Volume Will Drop 25% by 2026, Due to AI Chatbots and Other Virtual Agents」, 보도자료, 2024년 2월 19일. https://www.gartner.com/en/newsroom/press-releases/2024-02-19-gartner-predicts-search-engine-volume-will-drop-25-percent-by-2026-due-to-ai-chatbots-and-other-virtual-agents ↩
-
Pranjal Aggarwal 외, 『GEO: Generative Engine Optimization』, KDD 2024. arXiv:2311.09735. https://arxiv.org/abs/2311.09735 ↩
-
OpenAI, 「Overview of OpenAI Crawlers」(GPTBot · OAI-SearchBot · ChatGPT-User), 개발자 문서. https://platform.openai.com/docs/bots ↩
-
Perplexity, 「PerplexityBot」 크롤러 문서(PerplexityBot · Perplexity-User). https://docs.perplexity.ai/guides/bots ↩
-
Google, 「Google Crawlers and Fetchers Overview」(Googlebot · Google-Extended), Search Central 문서. https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers ↩