記事概要
クラスメソッドの森茂氏による、2026年7月時点でのローカルLLM(自分のPCで動かす大規模言語モデル)の最新事情まとめ。2026年1月版から半年ぶりの改訂で、著者が DGX Spark で実機検証した実測データをもとに、モデル・ハードウェア・ツールの選び方を「2026年夏版」として更新しています。前作を読んでいなくても通して読める構成です。
- この半年で主役は 「MoE + 4bit 量子化」 に移った
- 日本語込み汎用の第一候補は Qwen3.6-35B-A3B(投機デコード込みで実測 108.3 tok/s)
- Ollama が 0.32 系で大幅高速化し、単一ストリームのデコード速度は vLLM と並ぶ ようになった
この半年(2026年1月→7月)で何が変わったか
| 観点 | 2026年1月時点 | 2026年7月時点 |
|---|---|---|
| アーキテクチャ | dense 中心、MoE は一部(Qwen3-30B-A3B 等) | 新モデルはほぼ MoE(Qwen3.6-35B-A3B、Gemma 4 26B-A4B、DeepSeek V4 等) |
| 量子化 | 4bit はユーザー側の節約術 | NVFP4 / QAT など配布側が最初から 4bit 版を用意 |
| 投機デコード | 研究寄りの話題 | MTP が実用化。vLLM で 1.4〜2.4 倍、Ollama も Apple Silicon 対応 |
| ハードウェア | 24GB GPU が主戦場 | 128GB 統合メモリ機が台頭 |
| ツール | Ollama は手軽だが速度は控えめ | 0.32 系で +28% 高速化、コーディングエージェント連携も拡大 |
4月に Qwen3.6・Gemma 4・DeepSeek V4 へ世代交代。Devstral 2、Kimi K2.6、Laguna S 2.1 と大型モデルが続々登場。一方で gpt-oss と Llama 4 は更新が止まっており、「オープンモデルの進化 = 中国勢 + Google の高速回転」という構図がより鮮明に。加えて NVIDIA の Nemotron 3 が学習データ・レシピ公開の方針で、ファインチューニングの土台として使える癖のないモデル群として注目されています。
用途別おすすめモデル(2026年7月版)
| 用途 | 推奨モデル |
|---|---|
| 汎用チャット(日本語) | Qwen3.6-35B-A3B、Gemma 4 26B-A4B |
| コーディング | Qwen3.6-27B-coding、Devstral 2、Laguna S 2.1 |
| コスト効率重視 | Qwen3.6-35B-A3B(MoE Active 3B) |
| 軽量・16GB 帯 | Gemma 4 12B(QAT)、gpt-oss-20b |
| マルチモーダル | Gemma 4 26B-A4B(画像入力 + MoE) |
| 巨大 MoE・推論 | DeepSeek V4 Flash、Kimi K2.6 |
Qwen3.6 と Gemma 4 はどちらも Apache 2.0 ライセンスで商用利用しやすい「2強」。日本語性能(Nejumi Leaderboard 4, 2026年7月版)では Qwen3.6 がオープン上位を独占し、Gemma 4 は 31B がオープン3位(0.8077)と前作から明確に昇格。国産勢はまだ総合上位に入っていませんが、日本語特化の Nemotron Nano 9B v2 Japanese が小型枠で健闘しています。
decode 速度は「1トークンで読むバイト量」でほぼ決まる
半年間の実測で最も役立った法則。decode(トークン生成フェーズ)はメモリ帯域で律速されるため、「Active パラメータ数 × 量子化バイト数 = 1トークン生成で読むバイト量」に反比例します。
- 総パラメータ数は速度の指標にならない:118B の Laguna S 2.1(Active 8.5B)が 27B dense の Qwen3.6-27B より速い逆転が普通に起きる。「何Bか」より「Active 何Bか」を見る習慣をつけるとスペック表から速度を予想できる
- 投機デコードが実用化:MTP(Multi-Token Prediction)有効で Qwen3.6-35B-A3B は 76.66 → 108.3 tok/s(1.4倍)。素が遅い dense ほど倍率が乗り、Qwen3.6-27B は 12.13 → 29.38 と2.4倍に
- 他環境への読み替えが可能:DGX Spark の帯域約273GB/s は M4 Pro / Ryzen AI Max と同クラス。RTX 3090 は約3.4倍、RTX 5090 は約6.5倍の帯域なので数値をスケールして目安にできる
量子化形式の勝者はモデル依存
同じ4bitでも配布元によって速度が全然違い、どちらが速いかはモデル依存というのが半年間で判明した大事な知見。
| モデル | NVIDIA 版 base | Unsloth 版 base | 勝者 |
|---|---|---|---|
| Qwen3.6-35B-A3B | 76.66 tok/s | 67.52 tok/s | NVIDIA 版(全構成勝ち) |
| Gemma 4 26B-A4B | 31.63 tok/s | 49.13 tok/s | Unsloth 版(+55%) |
- Qwen では NVIDIA 版全勝、Gemma では Unsloth 版全勝と真逆の結果。事前に予想する方法は現状ない
- 実践的な指針:同じモデルの4bit版が複数の配布元から出ていたら両方試して速い方を使う。これだけで5割増しの速度を取りこぼさない
- Google 公式 QAT 版の Gemma 4(
gemma4:26b-a4b-it-qat)は Ollama で実測 55.46 tok/s と、vLLM の NVFP4 base より速いことも
ハードウェア要件と統合メモリ機の台頭
| メモリ帯 | 代表ハード | 動かせる代表モデル(Q4 前提) |
|---|---|---|
| 8GB | RTX 4060、中古 RTX 3060 | Qwen3.5-4B、Gemma 4 E4B、Nemotron Nano 9B v2 JP |
| 16GB | RTX 5060 Ti、M4 Mac 16GB | Gemma 4 12B(QAT)、gpt-oss-20b |
| 24GB | 中古 RTX 3090 / 4090 | Qwen3.6-27B、Gemma 4 26B-A4B |
| 32GB | RTX 5090 | Qwen3.6-35B-A3B(Q4 で 23GB)、Gemma 4 31B |
| 64GB+ | GPU 2枚、統合 64GB | 70B 級、Qwen3.5-122B-A10B |
| 128GB 統合 | Strix Halo 機、DGX Spark(GB10) | Qwen3.6-35B-A3B、Laguna S 2.1、DeepSeek V4 Flash(量子化) |
- Strix Halo(AMD Ryzen AI Max+ 395)128GB 構成は帯域約256GB/s と DGX Spark とほぼ同じ。ただし DRAM 高騰で実売下限が $1,800〜2,000 に上昇
- Apple M3 Ultra 512GB 構成は DRAM 高騰で販売終了へ。それでも帯域 819GB/s は別格
- 注意:128GB 統合メモリ機は帯域が dGPU より細いため dense 大型モデルは数 tok/s まで落ちる。「大型 MoE を動かすためのハード」と割り切るのが現実的
- Mac mini (M4, 16GB) では 9〜12B クラス Q4 で 10 tok/s 前後。16GB 帯はモデル選びがほぼすべて
- 中古 GPU は高騰中。RTX 4090 中古が新品 RTX 5080 より高い逆転現象も。VRAM 単価では中古 RTX 3090(24GB)が引き続き本命
ツール選定の現在地
| ツール | 特徴 | 向いている人 |
|---|---|---|
| Ollama | 0.32 系で高速化が進み、エージェント連携ハブ化 | まず触りたい人、CLI エージェント併用 |
| vLLM | 投機デコードと並列スループットで最速。セットアップは重め | 常駐サーバー、性能の限界を引きたい人 |
| LM Studio | GUI 完結、REST API で統計も取れる | GUI 派、モデルを試しまくる人 |
| llama.cpp | --cpu-moe 系ノブと投機デコードを細かく制御 | 上級者、VRAM が足りない人 |
Ollama の進化が目覚ましい(同じモデルで 0.20 系 59.70 → 0.32.3 で 76.19 tok/s、+28%):
- Apple Silicon では Gemma 4 の MTP がデフォルト有効で約90%高速化
ollama launchの連携先が Claude Code だけから 16 統合(Codex、Copilot、OpenCode、Cline 等)に拡大。ローカルモデルをコーディングエージェントに繋ぐハブ化- OpenAI 互換 API の
reasoning_effortで思考モデルの思考を止められる("none"指定で即答)。ルーティング・分類用途に便利 - 新しめのモデルタグは古いクライアントを拒否するので、pull 失敗時はまずランタイム更新を疑うこと
LM Studio は MoE オフロードのトグルが 0.4 系で後退しており、MoE オフロード目的なら現時点では llama.cpp 直(--cpu-moe / --n-cpu-moe)が確実です。llama.cpp は --spec-type draft-mtp で投機デコードにも対応し、DeepSeek や GLM の MTP ヘッドをサポートしています。