はてなブックマーク新着レポート

2026年夏のローカルLLM事情を整理してみた

元記事:https://dev.classmethod.jp/articles/local-llm-guide-2026-summer/(DevelopersIO)
はてブ:2026-08-31 のブックマーク(ユーザー: ao41 / タグ: あとで読む)
記事公開:2026-08-30 15:35 (UTC)
はてブ数:36 users

記事概要

クラスメソッドの森茂氏による、2026年7月時点でのローカルLLM(自分のPCで動かす大規模言語モデル)の最新事情まとめ。2026年1月版から半年ぶりの改訂で、著者が DGX Spark で実機検証した実測データをもとに、モデル・ハードウェア・ツールの選び方を「2026年夏版」として更新しています。前作を読んでいなくても通して読める構成です。

結論まとめ
  • この半年で主役は 「MoE + 4bit 量子化」 に移った
  • 日本語込み汎用の第一候補は Qwen3.6-35B-A3B(投機デコード込みで実測 108.3 tok/s)
  • Ollama が 0.32 系で大幅高速化し、単一ストリームのデコード速度は vLLM と並ぶ ようになった

この半年(2026年1月→7月)で何が変わったか

観点2026年1月時点2026年7月時点
アーキテクチャdense 中心、MoE は一部(Qwen3-30B-A3B 等)新モデルはほぼ MoE(Qwen3.6-35B-A3B、Gemma 4 26B-A4B、DeepSeek V4 等)
量子化4bit はユーザー側の節約術NVFP4 / QAT など配布側が最初から 4bit 版を用意
投機デコード研究寄りの話題MTP が実用化。vLLM で 1.4〜2.4 倍、Ollama も Apple Silicon 対応
ハードウェア24GB GPU が主戦場128GB 統合メモリ機が台頭
ツールOllama は手軽だが速度は控えめ0.32 系で +28% 高速化、コーディングエージェント連携も拡大

4月に Qwen3.6・Gemma 4・DeepSeek V4 へ世代交代。Devstral 2、Kimi K2.6、Laguna S 2.1 と大型モデルが続々登場。一方で gpt-oss と Llama 4 は更新が止まっており、「オープンモデルの進化 = 中国勢 + Google の高速回転」という構図がより鮮明に。加えて NVIDIA の Nemotron 3 が学習データ・レシピ公開の方針で、ファインチューニングの土台として使える癖のないモデル群として注目されています。

用途別おすすめモデル(2026年7月版)

用途推奨モデル
汎用チャット(日本語)Qwen3.6-35B-A3B、Gemma 4 26B-A4B
コーディングQwen3.6-27B-coding、Devstral 2、Laguna S 2.1
コスト効率重視Qwen3.6-35B-A3B(MoE Active 3B)
軽量・16GB 帯Gemma 4 12B(QAT)、gpt-oss-20b
マルチモーダルGemma 4 26B-A4B(画像入力 + MoE)
巨大 MoE・推論DeepSeek V4 Flash、Kimi K2.6

Qwen3.6 と Gemma 4 はどちらも Apache 2.0 ライセンスで商用利用しやすい「2強」。日本語性能(Nejumi Leaderboard 4, 2026年7月版)では Qwen3.6 がオープン上位を独占し、Gemma 4 は 31B がオープン3位(0.8077)と前作から明確に昇格。国産勢はまだ総合上位に入っていませんが、日本語特化の Nemotron Nano 9B v2 Japanese が小型枠で健闘しています。

decode 速度は「1トークンで読むバイト量」でほぼ決まる

半年間の実測で最も役立った法則。decode(トークン生成フェーズ)はメモリ帯域で律速されるため、「Active パラメータ数 × 量子化バイト数 = 1トークン生成で読むバイト量」に反比例します。

量子化形式の勝者はモデル依存

同じ4bitでも配布元によって速度が全然違い、どちらが速いかはモデル依存というのが半年間で判明した大事な知見。

モデルNVIDIA 版 baseUnsloth 版 base勝者
Qwen3.6-35B-A3B76.66 tok/s67.52 tok/sNVIDIA 版(全構成勝ち)
Gemma 4 26B-A4B31.63 tok/s49.13 tok/sUnsloth 版(+55%)

ハードウェア要件と統合メモリ機の台頭

メモリ帯代表ハード動かせる代表モデル(Q4 前提)
8GBRTX 4060、中古 RTX 3060Qwen3.5-4B、Gemma 4 E4B、Nemotron Nano 9B v2 JP
16GBRTX 5060 Ti、M4 Mac 16GBGemma 4 12B(QAT)、gpt-oss-20b
24GB中古 RTX 3090 / 4090Qwen3.6-27B、Gemma 4 26B-A4B
32GBRTX 5090Qwen3.6-35B-A3B(Q4 で 23GB)、Gemma 4 31B
64GB+GPU 2枚、統合 64GB70B 級、Qwen3.5-122B-A10B
128GB 統合Strix Halo 機、DGX Spark(GB10)Qwen3.6-35B-A3B、Laguna S 2.1、DeepSeek V4 Flash(量子化)

ツール選定の現在地

ツール特徴向いている人
Ollama0.32 系で高速化が進み、エージェント連携ハブ化まず触りたい人、CLI エージェント併用
vLLM投機デコードと並列スループットで最速。セットアップは重め常駐サーバー、性能の限界を引きたい人
LM StudioGUI 完結、REST API で統計も取れるGUI 派、モデルを試しまくる人
llama.cpp--cpu-moe 系ノブと投機デコードを細かく制御上級者、VRAM が足りない人

Ollama の進化が目覚ましい(同じモデルで 0.20 系 59.70 → 0.32.3 で 76.19 tok/s、+28%):

LM Studio は MoE オフロードのトグルが 0.4 系で後退しており、MoE オフロード目的なら現時点では llama.cpp 直(--cpu-moe / --n-cpu-moe)が確実です。llama.cpp は --spec-type draft-mtp で投機デコードにも対応し、DeepSeek や GLM の MTP ヘッドをサポートしています。