DeepSeek 「R3」 공식 출시——수학·코딩 추론에서 o3 초과, 비용은 1/8
機械翻訳 / Machine-translated
DeepSeek가 2026년 8월 29일, 추론 특화 모델 「R3」를 공식 출시했다. AMATH(고급 수학 추론) 벤치마크에서 OpenAI 「o3」를 0.8포인트 앞질렀으며, SWE-bench Verified에서도 72.4%라는 신기록을 경신했다. MIT 라이선스로 모델 가중치를 동시 공개했으며, API 단가는 o3 대비 약 8분의 1 수준으로 알려져 있다. '오픈·저렴·벤치 1위'라는 세 가지 조건이 동시에 충족된 것은 이번이 처음으로, 기업의 추론 AI 도입 설계는 이번 주부터 재검토가 시작될 것으로 보인다.
2026년 8월 29일 17:00 UTC, DeepSeek는 Hugging Face에서 「DeepSeek-R3」의 모델 가중치와 기술 보고서를 동시에 공개했다. 총 파라미터 수는 671B(Mixture-of-Experts 구성)이지만, 추론 시 활성화 파라미터는 37B로 억제되어 있어 동일 규모의 밀집 결합 모델에 비해 큰 비용 우위를 가진다.
주요 벤치마크 결과(공식 기술 보고서 기준):
X(구 Twitter)에서는 공개 직후부터 개발자들의 검증 게시물이 잇따랐으며, 「R3 AMATH」가 한국 시간 29일 심야에 트렌드에 올랐다.
「DeepSeek R3를 시험해봤다. SWE-bench 점수가 진짜라면, 코딩 에이전트의 백본 모델 선정은 이번 주 안에 재검토해야 한다. 사내 비교 평가, 지금 바로 돌린다.」
DeepSeek는 2025년 1월에 「R1」을 공개했고, 같은 해 7월의 「R2」에서 다단계 추론(Chain-of-Thought 확장)을 강화했다. 이번 R3는 「R2」로부터 약 13개월 만의 후속 릴리스다. 회사는 베이징을 거점으로 하며, 칭화대·베이징대 출신 연구자들이 핵심을 담당하고 있다.
MoE 아키텍처는 추론 시 계산 비용을 671B 규모에서 37B 상당으로 압축하는 구조로, Google의 Gemini 시리즈와 Mistral 「Mixtral」에서도 채택된 방식이다. R3는 활성화 선택의 효율을 더욱 개선했다고 알려져 있으나, 독립적인 검증은 아직 진행 중이다.
API 제공도 같은 날 시작되었다. 공표 가격은 input 1M 토큰당 0.55달러로, o3(4.40달러) 대비 약 1/8 수준이다.
MIT 라이선스는 상업적 이용·수정·재배포를 무제한으로 허용한다. 자사 인프라에의 배포가 현실적인 선택지가 되었으며, AWS·Azure 상에서의 추론 비용은 o3 API 대비 최대 65% 절감할 수 있다고 시산하는 엔지니어가 이미 여럿 등장했다. 국내 SI업체·클라우드 벤더가 R3를 파인튜닝해 수직 SaaS화하는 시나리오는 향후 90일 이내에 가시화될 것으로 전망된다.
SWE-bench Verified는 실제 GitHub 이슈를 자동으로 수정할 수 있는지를 측정하는 지표다. 72.4%라는 수치는 「약 10건 중 7건 이상에서 사람의 풀 리퀘스트에 상당하는 수정을 출력할 수 있다」는 수준을 의미한다. 코드 리뷰의 전처리 자동화, 혹은 버그 트리아지의 자동화가 사정권에 들어오기 시작했다.
2025년 말 시점에서는 「프런티어 모델은 미국 진영이 리드」하는 구도가 정설이었다. R3의 AMATH 1위는 그 구도에 대한 구체적인 반증이 될 수 있다. 다만 재현성에 대한 독립 검증은 아직 제한적이며, 과거에는 발표값과 제3자 검증값이 5~8포인트 괴리된 사례도 있다. 단정은 이르다.
중국 기업의 모델을 기업 시스템에 통합할 때의 리스크 평가는 한국의 금융·의료·공공 섹터에서도 필수 공정이 된다. API 이용과 온프레미스 배포에서 리스크 프로파일이 크게 달라지는 점은 간과되기 쉽다.
R3가 다른 릴리스와 차별화되는 점은 「가중치 공개·가격 파괴·벤치 1위」의 세 요소가 동시에 갖춰진 것이다. 통상적으로는 그 중 하나만으로도 충분한 뉴스 가치가 있지만, 세 가지가 겹치면 시장의 조정 압력은 승수적으로 높아진다. 2025년 R1 공개 당시 Nvidia의 시가총액이 하루에 약 5,900억 달러 하락한 기억은 생생하다.
다만 즉각적인 채택 판단은 위험하다. 지금 해야 할 일은 「자사 유스케이스에서의 비교 평가 프로세스를 이번 주 안에 가동하는 것」이다. 특히 코딩 에이전트, 법무 문서 분석, 수리 최적화의 세 영역은 우선순위가 높다. 반면, 추론 정확도보다 응답 속도·안정성이 우선시되는 고객 대화형 태스크에서는 점수의 높낮이가 그대로 우위로 전환되지 않는다는 점도 유의해야 한다.
다음 주 중에 독립적인 재현 실험 결과가 여러 건 공개될 예정이며, 그에 따라 평가는 크게 달라질 것이다.
DeepSeek R3는 「오픈×저렴×고성능 추론」의 조건이 처음으로 갖춰진 모델이 될 수 있다. 벤치마크의 제3자 검증과 실운용에서의 안정성 확인이 갖춰질 다음 주 전후가 첫 번째 의사결정 타이밍이 될 것이다. 당신의 조직에서는 모델 평가 사이클의 다음 트리거를 언제로 설정하고 있는가.
※ 본 기사는 ミライ・ニュース 편집부의 AI 라이터(AIニュース)가 작성하였습니다.