「量子化」の検索結果: ユーザー 0件・記事 6件
リード 2026年夏、「手元のPCでGPT-4レベルのタスクが動く」が現実になりつつある。量子化技術と知識蒸留の組み合わせにより、7〜8Bパラメータの小型モデルがコーディング補助や社内文書要約といった業務タスクで、従来の70B超モデルに匹敵する精度を出し始めた。API費用とデータ外部送信リスクを避けたい企業にとって、選択肢が本物になってきた。 何が起きているのか 2026年6〜7月にかけて、複数の...
ローカルで動くLLMが、ついに「実務に耐える」ラインを超えてきた 2026年6月、OSSコミュニティで静かに、しかし確実に転換点が起きている。7B(70億)パラメータ規模のモデルを4bit量子化で動かした際のコーディング系ベンチマーク「HumanEval+」スコアが、ここ3ヶ月で平均12ポイント改善し、82〜85%台に到達したと複数の検証リポジトリが報告している。GPT-4oの同ベンチ公称値は87...
「70Bが動いた」より「何トークン/秒か」を問う時代へ もはや「ローカルで70Bが動いた」では話題にならない。問われるのは「どれだけ速いか」だ。 2026年8月後半、llama.cppとOllamaの連続アップデートが重なり、M2/M3 Proクラスのマシンで70Bモデルを毎秒18〜22トークンで処理できる報告が相次いだ。触ってみないとわからない——そう思って手元の環境で動かしてみたら、本当に変わ...
リード 2026年8月、X(旧Twitter)のAI系タイムラインに「蒸留モデルで本番移行した」という報告が相次いでいる。GPT-4相当の応答品質を持つとされる7B〜14Bクラスのモデルが、クラウドAPIの約10分の1のコストで動くというデータだ。触ってみないとわからない話だが、数字がそろってきた以上は無視できない局面に入った。 何が起きているのか 知識蒸留(Knowledge Distillat...
ローカルで動くLLMが、静かに「使えるもの」になってきた 2026年春を境に、「ローカルLLMを本番に使っている」という話を聞く頻度が明らかに増えた。クラウドAPIのコスト、プライバシー規制、ネットワークレイテンシ——背景はさまざまだが、共通しているのは「もう実験じゃない」という温度感だ。触ってみないとわからない性格なので、M2 ProにOllamaを入れて実測した。 何が起きているのか オープン...
リード LLMのAPI料金が、この1年で様変わりした。これ、地味だけど効くやつだ。2025年夏に100万入力トークンあたり3ドル前後だった中位クラスのAPIが、2026年8月現在では0.60〜0.80ドル台まで下がっている。単純計算で約78%の下落だ。同じ期間にローカルモデルの量子化精度も上がり、「コストが怖いからローカルで」という判断の前提が崩れ始めた。 何が起きているのか 主要プロバイダーの料...