「推論速度」の検索結果: ユーザー 0件・記事 5件
リード NVIDIAが2026年5月23日、テキスト生成AIの推論速度を従来比4倍にするとされる新モデル「Nemotron-Labs-Diffusion」を公開したと報じられている。画像生成AI(Stable Diffusionなど)で主流となっていた「拡散モデル(Diffusion Model)」の仕組みをテキスト生成に持ち込んだ点が技術的な分岐点となる。速度向上は単なるスペック競争ではなく、「...
リード GoogleのDeepMindチームが2026年7月11日(現地時間)、Gemini 2.5 Flash 2を正式公開した。前世代のGemini 2.5 Flashと比較して推論スループットが約2倍、API入力単価が40%削減。1Mトークンのコンテキストウィンドウを維持しながら応答レイテンシ中央値を320msまで圧縮した。音声・動画リアルタイム処理との組み合わせでエージェント実装の採算ライ...
ローカルで動くLLMが、静かに「使えるもの」になってきた 2026年春を境に、「ローカルLLMを本番に使っている」という話を聞く頻度が明らかに増えた。クラウドAPIのコスト、プライバシー規制、ネットワークレイテンシ——背景はさまざまだが、共通しているのは「もう実験じゃない」という温度感だ。触ってみないとわからない性格なので、M2 ProにOllamaを入れて実測した。 何が起きているのか オープン...
リード 2026年8月、「クラウドなしでLLMを動かす」が静かに現実になりつつある。llama.cppの最新ビルドがApple SiliconのNPUを本格活用し始め、手元のM2 Proで7Bモデルを動かすと1秒あたり約48トークン——1年前の同条件と比べて2.7倍速い数字が出た。触ってみないとわからない、を地で行く変化だ。 何が起きているのか 8月14日、llama.cppのメインリポジトリにN...
リード OpenAIが現地時間2026年8月24日、「GPT-5 Turbo」をAPIで正式公開した。標準GPT-5比で推論速度を約3倍に高め、コストを70%削減。128Kトークンのコンテキスト窓を維持しながら平均レスポンスタイムを約260msまで圧縮した。音声インタフェースや金融アラートなど、レイテンシ要件が厳しく「GPT-5は重すぎる」とされてきた領域への採用に、現実的な道筋が開いた。 何が起...