클래스도산

AI·자동화 트렌드

Gemini 3 이후, '멀티 모델 스택'이 표준이 된 이유

Gemini 3 이후, 왜 '멀티 모델 스택'이 표준이 되었을까

분기 벤더 재계약 회의. 개발팀은 클로드를, 마케팅팀은 챗GPT를, 데이터 조직은 제미나이를 밀어요. 예산 담당자는 "하나로 몰아줘야 단가 협상이 되지 않겠냐"고 묻고요. 다들 틀린 말을 안 하는데, 회의는 매번 결론 없이 끝납니다.

Gemini 3 이후, '멀티 모델 스택'이 표준이 된 이유 커버

LLM은 한 벤더에 몰아주는 계약이 아니라, 과업별로 갈아끼우는 스택으로 설계하세요. 2025년 11월, 3주가 채 안 되는 기간에 구글·오픈AI·앤트로픽이 차례로 최상위 모델을 내놓으면서 "종합 1등"이라는 자리가 흐려졌거든요. 미리 밝혀둘 게 하나 있습니다. 아래 숫자는 전부 각 벤더가 공식 발표한 자체 측정값이에요. 제3자 검증치가 아닙니다.

Gemini 3는 모든 면에서 1등인가요?

아닙니다. 추론·학술 난제는 1위, 코딩 벤치마크는 3위였어요. 이 비대칭이 이 글의 전부입니다.

Gemini 3는 모든 면에서 1등인가요? 개념 일러스트

구글은 2025년 11월 18일 Gemini 3 Pro를 공개하며 LMArena Elo 1501(사람이 두 모델 답변을 비교 투표해 매기는 순위), GPQA Diamond 91.9%(박사급 과학 문제 세트), Humanity's Last Exam 37.5%(도구 없이 푸는 초고난도 시험)를 발표했습니다. 100만 토큰 컨텍스트도 그대로 유지했고요.1 그런데 실제 깃허브 이슈를 고쳐 채점하는 SWE-bench Verified에서는 76.2%였어요.

엿새 뒤인 11월 24일, 앤트로픽이 Claude Opus 4.5로 같은 지표 80.9%를 내놓습니다. 숫자보다 눈에 띈 건 가격이었어요. 백만 토큰당 입력 5달러·출력 25달러. 직전 Opus 4.1의 15달러·75달러에서 3분의 1로 떨어졌습니다.2 그 사이 11월 19일, 오픈AI의 GPT-5.1-Codex-Max가 같은 벤치마크에서 77.9%를 기록했고요.3

보충. 벤치마크는 "누가 더 똑똑한가"가 아니라 "어떤 과업에서 누가 앞서는가"를 읽는 용도입니다. 한 달 안에 나온 세 모델이 지표마다 순서를 바꿔 다는 상황이라면, 그 혼전 자체가 답이에요.

축2025년 11월 벤더 발표 기준 앞선 쪽발표 수치
추론·학술 난제Gemini 3 ProGPQA Diamond 91.9%, HLE 37.5%
코딩·에이전트Claude Opus 4.5SWE-bench Verified 80.9%
코딩(장시간 작업)GPT-5.1-Codex-MaxSWE-bench Verified 77.9%
초장문 입력Gemini 3 Pro컨텍스트 100만 토큰

단일 벤더 표준화는 어디서 깨지나요?

세 군데입니다. 성능 역전, 가격 변동, 장애.

첫째, 역전 주기가 분기 단위로 짧아졌어요. 위 표의 순서는 2025년 11월 기준일 뿐이고, 여섯 달 뒤에도 같으리라는 근거는 어디에도 없습니다. 2년짜리 단독 계약은 "지금 1등"에 2년을 거는 베팅이에요.

둘째, 가격이 위아래로 움직입니다. Opus 4.5의 3분의 1 인하는 반가운 소식이지만 뒤집어 보면 벤더가 단가를 그만큼 크게 조정할 여력이 있다는 뜻이거든요. 한 곳에 묶인 조직은 인하의 수혜도, 인상의 충격도 협상 없이 그대로 받습니다.

셋째, API 하나가 곧 단일 장애점입니다. 고객 응대 챗봇이 벤더 장애로 두 시간 멈추면 그건 AI 사고가 아니라 서비스 사고예요.

여기에 덜 논의되는 변수가 하나 더 있습니다. 특정 도구에 손이 익은 실무자일수록 전환 비용을 실제보다 크게 느껴요. 그리고 조직은 그 감각을 "이미 다들 이거 쓰니까"라는 결정의 근거로 삼습니다. 익숙함은 근거가 아닙니다.

기업들은 지금 몇 개 모델을 쓰고 있나요?

평균 3개입니다. Menlo Ventures는 2024년 기업 조사에서 기업들이 평균 세 개의 파운데이션 모델을 운용하며 용도에 따라 요청을 나눠 보낸다고 보고했어요.4 이어 2025년 중반 업데이트에서는 엔터프라이즈 LLM API 지출이 그해 상반기 6개월 만에 약 35억 달러에서 84억 달러로 늘었고, 그 지출이 앤트로픽·오픈AI·구글 세 축으로 갈려 있다고 밝혔습니다.5

읽는 방식이 중요합니다. "3개"는 2024년 시점의 평균이고, 2025년 들어 시장은 더 커지면서 더 갈라졌어요. 멀티 모델은 앞서가는 소수의 실험이 아니라 이미 다수가 서 있는 기본값입니다. 회의실에서 세 팀이 서로 다른 모델을 미는 장면은 조직의 혼선이 아니라 시장의 모양 그 자체고요.

모델을 고르는 기준, AX Lab의 '멀티 모델 3축'

기준은 세 개면 충분합니다. AX Lab은 이걸 멀티 모델 3축이라고 부릅니다. 과업, 단가, 거버넌스.

  1. 과업 축. 벤더 벤치마크는 후보를 3개로 추리는 데까지만 쓰세요. 최종 판단은 우리 데이터로 만든 골든셋(정답을 사람이 확정해 둔 자체 평가 문제 모음) 30~50건으로 합니다. 이게 없으면 모델 교체는 영원히 취향 논쟁으로 끝나요.
  2. 단가 축. 비교 단위는 백만 토큰당 가격이 아니라 "처리 1건당 총비용"입니다. 답을 길게 쓰는 추론형 모델은 표면 단가가 낮아도 청구서가 커지거든요.
  3. 거버넌스 축. 데이터 처리 지역, 학습 이용 여부, 감사 로그 보존 기간. 이 셋이 다르면 같은 과업이라도 같은 모델을 못 씁니다.

여기에 하나만 덧붙일게요. 애플리케이션 코드가 특정 벤더 SDK를 직접 호출하고 있다면, 그건 기술 부채가 아니라 협상력의 손실입니다. 모델 호출을 감싸는 얇은 추상화 계층(어느 벤더를 부를지 설정으로 바꿀 수 있게 하는 한 겹의 코드) 하나가 재계약 테이블에서 지렛대가 돼요. 이사 갈 생각 없어도 짐이 박스에 담겨 있으면 집주인 태도가 달라지는 것과 비슷합니다. 🙂

재계약 서명 전에 뭘 확인하나요?

2순위 모델을 2주 안에 붙일 수 있는지부터 확인하세요. 그게 안 되면 나머지 협상은 형식입니다.

점검 항목통과 기준
골든셋 평가자체 과업 30건 이상, 모델별 점수 기록 보유
추상화 계층모델 교체가 설정 변경 수준에서 가능
계약 구조최소 약정 12개월 이하 또는 물량 이전 조항
장애 대응2순위 모델로 넘어가는 경로가 이미 동작
내부 역량실무자가 2개 이상 모델을 직접 써본 경험

마지막 줄이 제일 자주 비어 있습니다. 두 개 이상 다뤄본 사람이 없으면 아무리 잘 만든 멀티 모델 구조라도 트래픽은 결국 익숙한 하나로 쏠려요. 구조보다 손이 먼저입니다.

한눈 요약

  1. 2025년 11월, 벤더 발표 기준 추론 1위(Gemini 3 Pro)와 코딩 1위(Claude Opus 4.5)가 갈렸습니다.
  2. 같은 달 Opus 4.5 가격이 직전 세대 대비 3분의 1로 내려갔습니다. 단가는 고정값이 아닙니다.
  3. Menlo Ventures 2024년 조사 기준, 기업은 이미 평균 3개 모델을 운용합니다.
  4. 판단 기준은 과업·단가·거버넌스 세 축이고, 최종 근거는 벤더 점수가 아니라 자체 골든셋입니다.
한눈 요약 개념 일러스트

결론

Gemini 3가 바꾼 건 순위표가 아니라 전제입니다. 과업마다 1등이 다르고 그 순서가 분기마다 뒤집히는 시장에서 단일 벤더 표준화는 비용 절감이 아니라 리스크 집중이에요. 다음 재계약 회의 전에 우리 업무 데이터로 골든셋 30건부터 만들어 보세요. 근거 없는 벤더 논쟁이 하루 만에 정리됩니다. AX Lab은 비개발자 실무자가 직접 AI 도구를 손에 익히는 지점부터 이 문제를 다룹니다. 모델을 고르는 힘은 결국 써본 사람 수에서 나오거든요.

자주 묻는 질문

Q. 멀티 모델이면 관리 비용이 더 들지 않나요? A. 추상화 계층과 평가셋을 처음 만들 때는 듭니다. 단가가 오르거나 장애가 났을 때 치를 비용을 미리 사두는 셈이에요.

Q. Gemini 3가 코딩에서도 1등인가요? A. 아닙니다. 2025년 11월 각 벤더 발표 기준 SWE-bench Verified는 Claude Opus 4.5가 80.9%, GPT-5.1-Codex-Max가 77.9%, Gemini 3 Pro가 76.2%였습니다.

Q. 소규모 조직도 여러 모델을 돌려야 하나요? A. 운영은 하나로 하세요. 대신 평가셋과 추상화 계층은 지금 만들어 두면 됩니다. 교체 가능성만 확보해도 절반은 끝납니다.

Q. 벤치마크 점수를 그대로 믿어도 되나요? A. 후보를 추리는 용도까지만요. 본문의 수치는 전부 벤더 자체 발표치라 측정 조건이 서로 다릅니다. 순위를 뒤집는 근거는 우리 데이터로 만든 골든셋 점수뿐이에요.

출처

Footnotes

  1. Google, 『A new era of intelligence with Gemini 3』, 2025년 11월 18일. https://blog.google/products/gemini/gemini-3/ ↩

  2. Anthropic, 『Introducing Claude Opus 4.5』, 2025년 11월 24일. https://www.anthropic.com/news/claude-opus-4-5 ↩

  3. OpenAI, 『Building more with GPT-5.1-Codex-Max』, 2025년 11월 19일. https://openai.com/index/gpt-5-1-codex-max/ ↩

  4. Menlo Ventures, 『2024: The State of Generative AI in the Enterprise』. https://menlovc.com/2024-the-state-of-generative-ai-in-the-enterprise/ ↩

  5. Menlo Ventures, 『2025 Mid-Year LLM Market Update』. https://menlovc.com/perspective/2025-mid-year-llm-market-update/ ↩