「エッジAI」の検索結果: ユーザー 0件・記事 17件
リード Appleが「iOS 20 / macOS 16」で、Apple IntelligenceのオンデバイスLLMを従来の約3Bパラメータから7Bパラメータモデルへ刷新したことが、7月7日の開発者向けベータ配信で明らかになった。Neural Engine最適化により推論速度は旧比2.8倍を維持しつつ、主要ベンチマーク(MMLU・HumanEval)でOpenAIのGPT-4o miniと同等水...
リード Microsoftは2026年7月18日、軽量言語モデル「Phi-4-mini Instruct」(38億パラメータ)をAzure IoT Edge環境に全面統合すると発表した。クラウドAPIへの往復レイテンシが不要になり、産業現場での推論コストが従来比で最大85%削減できるとしている。エッジAI実装を阻んできた「コスト・遅延・ネットワーク依存」の三重障壁が同時に崩れる局面と見られる。 何...
リード Appleが2026年7月13日(現地時間)、秋公開予定の「iOS 20」に搭載するApple Intelligence新モデルの技術仕様を開発者向けドキュメントとして公開した。パラメータ規模は非開示だが、ベンチマーク上は「前世代比で推論精度31%向上」「日本語テキスト要約の応答速度が1.4秒→0.6秒に短縮」と記載されている。クラウドへの通信を必要としないオンデバイス処理が、ようやく実用...
リード クラウドへのデータ送信なしに複雑な推論をこなす「オンデバイスAI」が、2026年5〜6月にかけて複数ベンダーで実用水準に達した。Qualcomm Snapdragon 8 Elite 2搭載端末上で動く13Bパラメータモデルが、MMLU・MATH・HumanEvalの3ベンチマークでGPT-4(2023年版)比95%以上のスコアを記録したと報告されており、「クラウドAI前提」の企業インフラ...
リード GoogleがGemini 2.5 NanoをAndroid OSレベルで統合し、クラウド送信なしに端末内で推論を完結させる機能を2026年6月23日(現地時間)に発表した。対象はAndroid 14以降を搭載する全デバイス——世界約14億台、国内約6,200万台が即時アップデートの対象となる。「クラウドに送れない」という規制障壁を、アーキテクチャで丸ごと取り除く一手だ。 何が起きているの...
リード Microsoftが14Bパラメータの小型言語モデル(SLM)「Phi-4 Ultra」を2026年7月11日に公式公開した。HumanEvalおよびMATH-500ベンチマークで、それぞれ92.4%・88.7%を記録——GPT-4o(91.8%・87.2%)を上回る数値だ。クラウドAPIが前提だったLLM競争に、「ローカル推論で足りる」という新たな軸が加わった。 何が起きているのか Mi...
リード 米Cerebras Systemsは2026年8月11日(現地時間)、次世代AIアクセラレータ「Wafer-Scale Engine 4(WSE-4)」を正式発表した。単体チップで推論速度2,100トークン/秒・平均レイテンシ47ミリ秒を達成し、現行H100クラスタ(8枚構成)比で5.3倍の応答速度と公表されている。「推論コスト削減」の戦場がソフトウェア最適化からシリコン設計そのものへと移...
リード Qualcomm と Apple が2026年6月に相次いで公開した最新モバイルチップが、スマートフォン単体で130億(13B)パラメータ規模のLLM推論をリアルタイム動作させることを実証した。クラウドへのデータ送信なしに高精度な自然言語処理が完結する構造が現実化し、アプリ設計・コスト・プライバシーの3つの前提が同時に覆される局面に入った。 何が起きているのか Qualcomm は2026...
ローカルで動くAIが、今年ついに"使い物になった" これ、地味だけど効くやつだと思っている。2026年に入ってから、7〜14Bパラメータクラスのオープンソースモデルがベンチマーク上で急激に伸び、クラウドAPIなしで業務レベルのテキスト処理が回せる環境が整いつつある。今日のXでも「Ollama入れたら会社のPCだけで完結した」という声が複数流れていた。 「Qwen3-8B、手元のゲーミングPCで動か...
リード Hugging Faceが2026年8月27日、「SmolLM3-1.7B」を正式公開した。パラメータ数はわずか1.7Bだが、コーディングベンチマーク(HumanEval)でスコア72.3%を記録し、Llama 3.1 8Bの69.1%を3.2ポイント上回る。「大きいモデルほど賢い」という前提が、また一つ崩れた。 何が起きているのか 2026年8月27日 22:00(UTC)、Huggin...
リード 「思考型AIをローカルで動かす」が絵空事ではなくなってきた。2026年夏、量子化技術と推論エンジンの進化が重なり、CoT(連鎖的思考)系モデルがコンシューマーグレードのハードウェアで実用速度を出し始めている。ベンチマーク上の数字は派手だが、触ってみないとわからない部分も多い。手元のM2 Proで動かした結果を踏まえ、現場目線で整理する。 何が起きているのか 2026年に入り、オープンウェイ...
リード 2026年に入り、スマートフォン上でLLMを直接動かす「オンデバイスAI」が、実験的な取り組みから実運用フェーズへと移行し始めた。QualcommのSnapdragon 8 EliteやAppleのA18 Proは、7Bパラメータクラスのモデルを1秒あたり28〜32トークンで処理できる。クラウドに送らなくていい、という選択肢が、今年ようやく現実解になった。 何が起きているのか 2025年末...
リード スマートフォンのチップ上で動くオンデバイスAIが、OpenAIの「GPT-4o mini」と同等のベンチマーク精度を達成したと、複数のエンジニアから検証報告が相次いでいる。クラウドへの送信がゼロ——通信なし、プライバシーリスクなしでここまで到達したのは、正直驚きだった。 何が起きているのか 2026年7月初旬、QualcommのNPU(Neural Processing Unit=スマート...
リード 2026年8月、「ローカルLLM元年」と呼ぶにはまだ早いかもしれないが、「実用段階に入った」とは言えそうだ。パラメータ数7B(70億)クラスの小型言語モデルが日本語精度を急激に伸ばし、クラウドAPIなしでも開発支援に耐える状況が生まれている。触ってみないとわからない、を自分でも確かめてきた。 何が起きているのか 2026年7〜8月にかけて、日本語対応を強化したオープンソースLLMのリリース...
リード 「ローカルで動かすより API のほうが速い」という常識が、2026 年夏を境に揺らいでいる。llama.cpp の最新ビルドと Ollama v0.4 系の組み合わせで、手元の民生 GPU でも毎秒 60 トークン超えが普通に出るようになってきた。これ、地味だけど効くやつだと思っている。 何が起きているのか 今月に入ってから X(旧 Twitter)では「ローカル推論が速くなった」という...
リード 2026年8月、「クラウドなしでLLMを動かす」が静かに現実になりつつある。llama.cppの最新ビルドがApple SiliconのNPUを本格活用し始め、手元のM2 Proで7Bモデルを動かすと1秒あたり約48トークン——1年前の同条件と比べて2.7倍速い数字が出た。触ってみないとわからない、を地で行く変化だ。 何が起きているのか 8月14日、llama.cppのメインリポジトリにN...