AI API集体降价——推理成本骤降,LLM开发经济迎来转折点
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
在2026年8月28日至9月1日的短短5天内,OpenAI、Anthropic、Google三家公司相继将主要LLM API降价50%至73%。这不只是一场简单的价格战——推理基础设施的商品化正式全面提速,AI服务设计的经济学前提本身正在迎来根本性变革。
各家公司的调价详情如下:
"三家公司在同一个月内都有这么大的动作,这还是第一次见到。API费用已经快到可以从产品成本核算中剔除的水平了。"
——国内某初创公司CTO,发布于X平台
此次降价的直接背景,是搭载NVIDIA Blackwell Ultra(B300)的数据中心大规模投入运营。与H100相比,每次推理的能效提升约2.8倍,据悉这使得服务提供商的成本大幅下滑。
2025年下半年至2026年Q2,"性能竞争"与"价格竞争"在两条轨道上各自推进。GPT-5、Claude Opus 4.6、Gemini 2.5 Ultra 不断刷新基准测试成绩,而在价格层面,各家公司均以保障利润为优先,迟迟未采取大幅降价行动。
转折点出现在2026年7月。AWS、Azure、Google Cloud三大云服务商相继完善各自的自有推理基础设施,绕过模型提供商、直接通过云端进行推理成为切实可行的选择。Anthropic 在 Amazon Bedrock 上试点优化方案,OpenAI 宣布进一步深化与 Azure 的整合——此后不久,"若通过云端更便宜,独立端点的价格优势将荡然无存"这一结构性压力开始同时作用于三家公司。此次集体降价,正是这一逻辑的最终结果。
以每月处理十亿级token规模的应用为例,仅Claude Sonnet 4.6输出成本的变化,粗算下来每年可节省逾$36,000。"要不要用AI"的决策成本在降低,此前阻碍项目从原型迈向生产环境的费用门槛正在实质性消失。
随着各模型间价格差距收窄,针对不同场景切换使用不同模型的多模型架构在经济上愈发合理。Claude Agent SDK、LangGraph等编排层工具的需求预计将随之增长。
OpenAI 此次降价的同时,将面向个人开发者的免费额度从每月100万token扩大至500万token。Google 则将 Gemini Flash 的免费额度调整为附带速率限制的实质性无限量使用。围绕模型本身的竞争,正在向"争夺生态系统归属"演变。
Anthropic 于8月31日更新了面向日本的价格表,以日元固定计价的形式实施降价,而非与汇率联动。在日元持续贬值的背景下,采用固定日元定价降价,也可以理解为"内含汇率对冲的优惠待遇"。
将此次集体降价视为"成本竞争的终点",未免言之过早。推理成本越是趋近边际成本,下一个差异化维度就越会转向"谁能提供最可靠的SLA"。Anthropic 此次在调整价格的同时,强化了99.95%正常运行时间的SLA保障,其战略意图由此可见一斑。
价格下降并不意味着"对高精度推理的需求"会消失。代码批量生成、文档自动化等场景将更多选用低价模型,而法律审查、最终决策、对话质量优先等场景则仍会使用高端模型——这种分层格局将愈发清晰。价格竞争越激烈,高端模型的相对价值反而不会随之贬低——这才是这一结构的本质所在。
对于日本的开发者来说,现在正是"布局入场的时机"。此前将API费用列为主要成本项的项目,有必要在本财季内重新审视并设计成本结构。
三家公司在同一个月内集体降价,这一前所未有的举动表明,推理基础设施的商品化已越过临界点。接下来值得关注的,是10月预定举行的OpenAI开发者大会,以及Anthropic Q4价格路线图的发布。届时,"成本竞争的终点线"将会变得更加清晰。
成本降下来之后,我们能创造什么——这才是当下真正的命题。
※本文由 ミライ・ニュース 编辑部 AI 写作助手(AIニュース)撰写。