Gemini 2.5 Ultra正式发布——同时超越GPT-5并实现200万token上下文
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Google DeepMind于日本时间8月30日22时正式发布"Gemini 2.5 Ultra"。该模型上下文长度超过2,097,152个token,在MATH-500上得分92.3%,HumanEval得分89.7%,并宣布"在与GPT-5对比的9项主要指标中,有6项超越GPT-5"。API定价为输入$3.50/百万token,当日即开放使用。这一天或将被载入史册——长文本单模型处理从"实验性功能"正式成为"可选方案"。
8月30日21:47(日本时间),Google DeepMind官方X账号发布了一句"Gemini 2.5 Ultra is here.",宣告正式上线。该模型当日即可在Google AI Studio及Vertex AI上使用。
主要规格如下:
"把整个代码库一次性丢进去让它审查,2000行的PR三分钟内就附带标注返回来了。这个可以直接用于实战。"
多位工程师在X上发布了类似反馈,能否应用于实际业务立刻成为关注焦点。
Gemini 2.5系列自2026年2月发布Pro版本以来,历经约6个月的开发周期,Ultra版本正式推出。在OpenAI于2026年4月发布GPT-5、大语言模型竞争再度白热化的背景下,Google于7月的"Google I/O Extended 2026"上公开了Ultra的预告视频,并暗示将于8月内发布。
Anthropic通过"Claude Agent SDK"主打多智能体分布式处理基础架构,而Google则深耕"以单一模型完整处理长文本"的路线,两家公司在架构设计理念上的分歧愈发清晰。
若以A4一页约700个token计算,200万token约相当于2,860页。法律文件、大型代码库、完整季度报告均可一次性输入,已达到相应处理水平。"摘要→RAG流水线→生成"这一传统设计前置环节的成本,在部分场景下将得以削减。但上下文中段注意力下降的问题(Lost in the Middle问题)是否已彻底解决,仍是另一回事,需在实际业务中加以验证。
Gemini在原本OpenAI领先的数学推理(MATH-500 89.1%)上实现了超越。不过,OpenAI仍以独立系列维护着o3系推理模型,"通用最强"的定义本身已因模型族而分化,需注意简单横向比较的局限性。
该定价略高于Claude 3.7 Sonnet($3.00),却大幅低于GPT-5($5.00)。在高性能段价格竞争全面升温之际,Google同时在性能与价格两条战线上确立了自身定位。这一价格水平能否持续,取决于各家公司的推理基础设施成本。
已与Google Cloud签约的企业可直接通过Vertex AI使用,无需额外手续。以医疗、金融、法务领域的大文档处理为主战场,该模型有望在企业市场加速渗透。
我们判断,"长文本模型尚未达到实用水平"这一前提,已随本次发布而被打破。许多基于2,000个token前后截断时代所形成的设计模式,今后将面临重新审视的压力。
与此同时,也有几点值得冷静看待。Google声称"在Needle in a Haystack(NIAH)测试中达到99.2%",但合成基准与实际业务数据的分布并不相同。随着上下文长度增加,推理延迟也会随之上升,因此在实时性要求较高的任务场景中,是否适合采用仍需单独评估。
距GPT-5发布仅仅四个月,Google便在主要指标上完成超越——这一事实清楚地说明,大语言模型市场正在经历结构性变化:"模型迭代周期已缩短至半年以内"。我们将持续追踪年内各方参与者的下一步动向。
随着Gemini 2.5 Ultra的发布,单一模型同时满足长文本、高精度、低价格三项条件的时代已经到来。与GPT-5相比的性能优势在指标层面确实存在,但推理速度、稳定性、微调支持等实际运行层面的评估仍有待积累。
如果您的系统设计中存在"将文档分段输入"这一步骤,本周就有必要重新审视这一前提。
※本文由 未来新闻编辑部 AI 写作助手(AI新闻)撰写。