Gemini 2.5 Ultra 공식 출시 — GPT-5 초월과 200만 토큰 컨텍스트를 동시에 달성
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Google DeepMind는 한국 시간 8월 30일 22시, 「Gemini 2.5 Ultra」를 공식 출시했다. 컨텍스트 길이 2,097,152토큰 초과, MATH-500에서 92.3%·HumanEval에서 89.7%를 기록하며, 「GPT-5 대비 주요 9개 지표 중 6개 지표에서 앞선다」고 발표했다. API 가격은 입력 $3.50/1M 토큰으로 당일 제공이 시작되었다. 장문 컨텍스트 단일 모델 처리가 '실험적'에서 '선택지'로 바뀐 날로 기록될 것이다.
8월 30일 21:47(한국 시간), Google DeepMind의 공식 X 계정이 「Gemini 2.5 Ultra is here.」라는 한 문장과 함께 릴리스를 발표했다. Google AI Studio 및 Vertex AI에서 당일 이용 가능하게 되었다.
주요 사양은 다음과 같다:
「전체 코드베이스를 1개의 요청으로 넘겨서 리뷰시켰더니, 2,000줄짜리 PR을 3분 만에 지적 사항과 함께 반환해 왔다. 이건 실전에 투입할 수 있다」
여러 엔지니어들이 이런 내용을 X에 게시하고 있으며, 실제 업무 적용 가능 여부가 즉각적인 화두가 되고 있다.
Gemini 2.5 시리즈는 2026년 2월 Pro가 공개된 이후 약 6개월의 개발 기간을 거쳐 Ultra가 투입되었다. OpenAI가 GPT-5를 2026년 4월에 공개하며 LLM 경쟁이 재점화되는 가운데, Google은 7월 「Google I/O Extended 2026」에서 Ultra 예고 영상을 공개하며 8월 중 릴리스를 시사했었다.
Anthropic이 「Claude Agent SDK」로 멀티 에이전트 분산 처리 기반을 내세우는 반면, Google은 「장문 컨텍스트를 단일 모델로 완결시킨다」는 노선을 심화하고 있어, 아키텍처 설계 사상의 차이가 뚜렷해지고 있다.
A4 한 장이 약 700토큰이라면, 200만 토큰은 약 2,860페이지에 해당한다. 법률 문서·대규모 코드베이스·분기 보고서 전체를 일괄 입력할 수 있는 수준에 도달했다. 「요약→RAG 파이프라인→생성」이라는 기존 설계의 전단 비용을 절감할 수 있는 케이스가 나올 것이다. 다만 컨텍스트 중반부의 주의력 저하(Lost in the Middle 문제)가 완전히 해소되었는지는 별개의 문제로, 실제 운용에서의 검증이 필요하다.
OpenAI가 리드하던 수학 추론(MATH-500 89.1%)을 Gemini가 앞질렀다. 다만 OpenAI는 o3계 추론 모델을 별도 계열로 유지하고 있어, 「범용 최강」의 정의 자체가 모델 패밀리별로 분단된 현상에 주의가 필요하다. 단순한 일대일 비교는 이미 어렵다.
Claude 3.7 Sonnet($3.00)을 소폭 상회하고, GPT-5($5.00)를 크게 하회하는 설정이다. 고성능 영역에서 가격 경쟁이 본격화되는 가운데, Google이 성능과 가격 양면에서 포지션을 잡아왔다. 이 수준이 지속 가능한지는 각 사의 추론 인프라 비용에 달려 있다.
Google Cloud의 기존 계약 기업은 추가 절차 없이 Vertex AI를 통해 이용이 가능하다. 의료·금융·법무의 대용량 문서 처리를 주전장으로, 엔터프라이즈 시장에서의 침투가 가속될 것으로 보인다.
「장문 컨텍스트 모델은 아직 실용 수준에 도달하지 못했다」는 전제가, 이번 발표로 무너졌다고 판단한다. 2,000토큰 전후에서 잘리던 시대에 쓰인 설계 패턴 다수는 앞으로 재검토를 강요받을 것이다.
한편 냉정하게 살펴볼 점도 있다. Google은 「Needle in a Haystack(NIAH)테스트에서 99.2%」라고 주장하지만, 합성 벤치마크와 실제 업무 데이터의 분포는 다르다. 컨텍스트 길이가 늘어날수록 추론 레이턴시도 증가하기 때문에, 실시간 계열 태스크에서의 채택 적합성은 별도로 평가가 필요하다.
GPT-5 공개로부터 불과 4개월 만에 Google이 주요 지표를 바꿔놓은 사실은, 「모델의 리프레시 사이클이 반년 이하로 단축되었다」는 LLM 시장의 구조적 변화를 단적으로 보여준다. 연말까지 어떤 플레이어가 다음 수를 둘지, 동향을 계속 추적할 것이다.
Gemini 2.5 Ultra의 출시로, 장문 컨텍스트·고정밀·저가격의 3가지 조건이 단일 모델로 성립하는 시대가 찾아왔다. GPT-5와의 비교 우위는 지표상 실재하지만, 추론 속도·안정성·파인 튜닝 지원 등 실제 운용 평가는 앞으로 쌓여가야 한다.
당신의 시스템 설계에 「문서를 분할하여 입력하는」 단계가 있다면, 그 전제를 이번 주 다시 검토해볼 가치가 있다.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.