「コード生成」の検索結果: ユーザー 0件・記事 3件
リード OpenAIは2026年8月16日(米国時間)、推論特化モデル「o4」をAPI・ChatGPT Proで同時公開した。コードベンチマーク「SWE-bench Verified」で71.3%を達成——前世代o3の53.1%から18ポイント超の跳躍だ。数学オリンピック相当問題(AIME 2026)の正答率は92.0%に達し、「AIエージェントに任せられる上限」の感覚的ラインが、今日を境に大きく...
リード Mistral AIは2026年8月22日、コード専用モデル「Codestral 2.5」を正式公開した。SWE-bench Verifiedスコアは62.4%で、32Bパラメータクラスのオープンウェイトモデルとしては現時点での最高水準とされる。APIとオープンウェイトの両形式で提供され、データセンター内クローズド環境での運用も可能なため、プロプライエタリ一択だった企業の調達構造に揺さぶり...