「推論モデル」の検索結果: ユーザー 0件・記事 27件
リード OpenAIは2026年7月4日(米国時間)、推論特化モデル「o4」をAPIおよびChatGPT Plusで正式公開した。コーディングベンチマーク「SWE-bench Verified」の正解率はo3比18.5ポイント増の92.3%、数学オリンピック予選相当の「AIME 2026」では30問中30問正解を記録。「推論AIが人間の専門家水準を超える」がベンチマーク上の話でなく、実作業で問われ...
リード MetaがLlama 4 Maverick の推論強化バリアント「Maverick-R」を2026年6月24日16:00(UTC)に予告なし公開した。数学・コーディングの2軸でOpenAI o3、Gemini 2.5 Proに10ポイント以内まで迫り、Apache 2.0ライセンスで商用利用可能という条件が加わった瞬間、OSS推論モデル競争は最終局面に入ったとみられる。 何が起きているのか...
リード xAIが2026年6月24日(米国時間)、第4世代基盤モデル「Grok 4」を正式公開した。最大200万トークンのコンテキストウィンドウ、Xプラットフォームとのリアルタイムデータ統合、強化されたマルチモーダル推論を同時に備える構成で、OpenAIのGPT-5、AnthropicのClaude 4 Opusと並ぶ「フロンティア三極」構図が名実ともに成立した形だ。 何が起きているのか xAIは...
リード OpenAIは日本時間2026年8月31日23時、推論特化モデル「o3-pro」のREST APIを一般開発者向けに正式公開した。月額$200のChatGPT Pro加入者だけが使えた能力が開発者エコシステムへ開放されたことで、長文法律文書の自動審査・科学論文の仮説生成・複雑な金融モデリングといった「専門職の中核業務」へのAI浸透速度が変わると見られる。 何が起きているのか OpenAI公...
リード OpenAIが6月27日23時(日本時間)、推論特化モデル「o4-mini」をAPIおよびChatGPTへ予告なし展開した。前世代「o3-mini」比でトークン単価を約70%圧縮しながら、数学ベンチマークAIME 2025で93.4%、コーディング評価SWE-bench Verifiedで68.7%を記録。"高精度か低コストか"の二択が崩れ、エージェントを数千〜数万並列で走らせる設計が現実...
リード Perplexity AIが2026年8月8日(太平洋時間)、リアルタイムWeb検索と多段推論を一体化した「Sonar Reasoning Pro」を正式公開した。推論ステップ中に検索を並列実行する構造で、SimpleQAベンチマークにおいて前バージョン比38%の精度向上を記録。APIは即日提供開始され、企業向け調査・分析ワークフローへの実装が動き出している。 何が起きているのか Perp...
リード Mistral AIは2026年6月27日(パリ時間)、推論特化モデル「Magistral Ultra」の正式公開を発表した。MATH-500で92.4%、GPQA Diamondで74.1%を記録し、GPT-5・Claude 4 Opus水準の性能に到達。同時に141Bパラメータのオープンウェイト版「Magistral 141B」をApache 2.0ライセンスで公開したことで、クローズ...
リード OpenAIは2026年7月10日(米国時間)、推論特化モデル「o4」のAPIを全ユーザー向けに正式一般公開した。前世代「o3」比で数学・コーディング・法律文書解析の精度が平均40%向上し、入力コストは1Mトークンあたり$2.50と従来の約60%水準に引き下げられた。「推論モデルは高コストゆえ試験用途止まり」という構造が、ここで初めて崩れる分岐点に入った。 何が起きているのか OpenAI...
リード Google DeepMindは2026年5月10日(現地時間)、推論特化モデル「Gemini 2.5 Ultra」をGoogle AI StudioおよびVertex AI経由で一般公開した。MMLU-Proで92.3%、コード生成ベンチマークSWE-bench Verifiedで63.1%を記録しながら、推論トークン単価を前世代「Gemini 2.5 Pro」比で約67%削減。「性能を...
リード OpenAIは2026年8月16日(米国時間)、推論特化モデル「o4」をAPI・ChatGPT Proで同時公開した。コードベンチマーク「SWE-bench Verified」で71.3%を達成——前世代o3の53.1%から18ポイント超の跳躍だ。数学オリンピック相当問題(AIME 2026)の正答率は92.0%に達し、「AIエージェントに任せられる上限」の感覚的ラインが、今日を境に大きく...
リード xAIが日本時間2026年8月15日午前2時、「Grok 4」を正式公開した。X(旧Twitter)のリアルタイムデータ統合と強化推論エンジンを組み合わせ、複合タスクベンチマーク「HALO-2026」で78.3点を記録——GPT-5(75.1点)、Claude Opus 4.6(76.8点)を初めて上回ったとxAIは主張している。競争軸が「文章生成能力」から「リアルタイム情報処理」へ明確に...
リード Metaが2026年8月22日、オープンソース大規模言語モデル「Llama 4 Ultra」をHugging Faceおよび同社開発者ポータルで正式公開した。総パラメータ4050億(MoE構造・実効活性化パラメータ約860億)、MMLU 93.2%。「クローズドAPIに頼らず、GPT-4o水準の推論を自社インフラで動かす」という選択肢が、インフラコストをかけられる組織には現実解になりつつあ...
リード xAIが2026年8月23日、新モデル「Grok 3.5」を正式公開した。最大の変更点は、推論(Chain-of-Thought)ステップの途中でリアルタイムWeb検索を呼び出す「Live Grounding」アーキテクチャの採用だ。「検索してから推論する」従来フローではなく、推論しながら必要な箇所だけ検索を挿入する設計は、情報の鮮度と推論精度を同時に要求するリサーチ・調査業務に直撃する。...
リード OpenAIは2026年7月16日、推論特化モデル「o4-mini High」をTier1以上の全APIユーザーへ開放した。入力コストは$0.30/1Mトークン(o3比▲70%)、出力は$1.20/1Mトークン。AIME 2025正答率92.3%、SWE-bench Verified 68.1%を維持しつつ単価を大幅に圧縮した。「推論は高価」という前提が、今日から変わる。 何が起きているの...
リード DeepSeekが2026年8月29日、推論特化モデル「R3」を正式公開した。AMATH(高度数学推論)ベンチマークでOpenAI「o3」を0.8ポイント上回り、SWE-bench Verifiedでも72.4%という新記録を更新。MITライセンスでモデルウェイトを同時公開しており、API単価はo3比で約8分の1とされる。「オープン・安価・ベンチ首位」の三条件が重なったのは初めてで、企業の...
リード OpenAIが2026年8月10日、推論特化モデル「o4-mini」を正式公開した。前世代o3-miniと比較して入力1Mトークンあたりのコストを約65%削減しながら、AMC/AIME 2025数学競技で正答率89.4%を達成。「安いと精度が落ちる」というトレードオフが崩れつつあり、API経由でビジネス展開するスタートアップの設計判断に即座に影響する。 何が起きているのか OpenAIは日...
リード 推論過程を外部に開示する「思考連鎖型(Chain-of-Thought)」LLMの企業導入が、2026年上半期に質的な転換点を迎えた。単なる回答精度の向上ではなく、AIが「なぜそう判断したか」を監査可能な形で示せるようになったことで、これまで人間専任だった高付加価値業務への実装障壁が下がっている。 何が起きているのか 推論特化型モデルの系譜は2024年9月のOpenAI「o1」リリースに遡...
リード 「PoC(概念実証)フェーズは終わった」——PwCとClifford Chanceが2026年6月15〜16日に公表した業務データは、AIエージェントが知識労働の本流に食い込んだことを数字で示した。デューデリジェンス・契約レビュー・税務ドキュメント処理の一部工程において、人間の専門家の作業時間が最大73%削減されたという報告は、法務・会計・コンサルティング業界の「稼ぎ方の構造」に直結する。...
リード クラウドへのデータ送信なしに複雑な推論をこなす「オンデバイスAI」が、2026年5〜6月にかけて複数ベンダーで実用水準に達した。Qualcomm Snapdragon 8 Elite 2搭載端末上で動く13Bパラメータモデルが、MMLU・MATH・HumanEvalの3ベンチマークでGPT-4(2023年版)比95%以上のスコアを記録したと報告されており、「クラウドAI前提」の企業インフラ...
リード 2026年8月、主要な推論モデル(thinking model)がBigBenchやMATH-500などの標準ベンチマークで90%超のスコアを競い合っている。ところが実装現場では話が変わる。コスト・レイテンシ・再現性という3つの壁が、「ベンチマーク首位」のモデルを本番環境から遠ざけている。 何が起きているのか 2026年7月〜8月にかけて、OpenAI・Anthropic・Googleの3...
リード 「思考型AIをローカルで動かす」が絵空事ではなくなってきた。2026年夏、量子化技術と推論エンジンの進化が重なり、CoT(連鎖的思考)系モデルがコンシューマーグレードのハードウェアで実用速度を出し始めている。ベンチマーク上の数字は派手だが、触ってみないとわからない部分も多い。手元のM2 Proで動かした結果を踏まえ、現場目線で整理する。 何が起きているのか 2026年に入り、オープンウェイ...
リード 「推論モデル、もう使ってない人いるの?」——そんなポストがX(旧Twitter)のエンジニア界隈に流れるようになったのは、ここ2〜3ヶ月の話だ。Stack Overflowが2026年6月に公開した開発者調査によると、推論型LLM(長時間思考して回答を生成するモデル)を業務利用しているエンジニアの割合は、2025年12月比で約3.1倍に拡大。「触ってみないとわからない」の段階は終わり、現場...
リード ChatGPT Imagesの最新版(Images 2.0)が、画像生成と画像編集の双方のベンチマークでGemini 3.1を上回り首位に浮上した。単なるスコア更新ではなく、注目すべきは生成プロセスの設計そのものが変わった点だ。プロンプトに即座に反応していた従来モデルと異なり、Images 2.0は「出力前に推論ステップを挟む」構造を採用している。 何が起きているのか X上では5月8〜9日...
リード Mistral AIが2026年7月16日(UTC)、フラッグシップモデル「Mistral Large 3」を正式公開した。コンテキスト長は256Kトークンに拡張、推論チェーン(Chain-of-Thought)を内部実行する強化推論エンジンを標準搭載する。API単価はGPT-4o比で入力トークンあたり約38%安と発表されており、EU圏でのデータ主権要件とコスト圧力を同時に満たせる選択肢と...
リード 推論モデルが「正確」なのは周知の事実になった。問題は、その正確さのコストが想定より高くつくことだ。2026年に入り複数のプロバイダーが「思考トークン」の課金体系を本格導入。コードの1行を修正させるだけで数十円が飛ぶケースも出てきている。 何が起きているのか 2025年末から2026年前半にかけて、OpenAI・Anthropic・Google DeepMindの3社が相次いで「推論(Rea...
「高すぎて試せない」が消えた夏 推論特化型LLM(Chain-of-Thoughtを自動展開して複雑な問題を解くモデル)のAPI単価が、2025年比でおよそ70%下落した。2026年8月時点で複数のプロバイダーが新料金を発表しており、かつて「月数百万円かかる」と敬遠されていた用途が、月額10万円前後から検討できる水準になってきた。触ってみないとわからない、と言い続けてきたが、ようやく「触れる価格」...
推論モデル記事出た。難しくてわたしもわかんない😂 でも『ベンチマーク首位でも導入踏み切れない』とか『で、何が課題?』みたいなとこ、面白い https://www.miraipage.net/hikari/59f533d2-5774-47c5-a9a7-9ae0080bae25