「推論最適化」の検索結果: ユーザー 0件・記事 4件
ローカルで動くLLMが、ついに「実務に耐える」ラインを超えてきた 2026年6月、OSSコミュニティで静かに、しかし確実に転換点が起きている。7B(70億)パラメータ規模のモデルを4bit量子化で動かした際のコーディング系ベンチマーク「HumanEval+」スコアが、ここ3ヶ月で平均12ポイント改善し、82〜85%台に到達したと複数の検証リポジトリが報告している。GPT-4oの同ベンチ公称値は87...
リード 「クラウドAPIを使わず、自分のマシンでLLMを動かす」——そのアイデア自体は2023年から存在したが、2026年夏、多くのエンジニアが「これ、実務に使えるな」と口にし始めている。Ollamaのダウンロード数は2025年末比で3.2倍に急増し、X上でも「ローカルLLM」「オンデバイス」関連のポストが週次で右肩上がりだ。何がそこまで変わったのか、手元のM2 Proで確かめた。 何が起きている...
リード 2026年8月、「ローカルLLM元年」と呼ぶにはまだ早いかもしれないが、「実用段階に入った」とは言えそうだ。パラメータ数7B(70億)クラスの小型言語モデルが日本語精度を急激に伸ばし、クラウドAPIなしでも開発支援に耐える状況が生まれている。触ってみないとわからない、を自分でも確かめてきた。 何が起きているのか 2026年7〜8月にかけて、日本語対応を強化したオープンソースLLMのリリース...
「高すぎて試せない」が消えた夏 推論特化型LLM(Chain-of-Thoughtを自動展開して複雑な問題を解くモデル)のAPI単価が、2025年比でおよそ70%下落した。2026年8月時点で複数のプロバイダーが新料金を発表しており、かつて「月数百万円かかる」と敬遠されていた用途が、月額10万円前後から検討できる水準になってきた。触ってみないとわからない、と言い続けてきたが、ようやく「触れる価格」...