Qwen3.8-Flash-NextがゲーミングPCで爆速に動く「Strata」登場

元記事https://pc.watch.impress.co.jp/docs/news/2145142.html(PC Watch / 2026年10月2日 12:59 / 劉 尭)
はてブhttps://b.hatena.ne.jp/ao41/20261002#bookmark-4793851283512379170
ブクマ日時2026-10-02T14:33:33Z はてブ数 47

ニュースの要約

総パラメータ125B(1,250億)・アクティブパラメータ6B(60億)の大規模モデル「Qwen3.8-Flash-Next」を、ビデオカード1枚のゲーミングPCで秒間60〜95トークンという高速で動かせる推論エンジン「Strata」が公開されました。開発者はNiko1221氏で、GitHubでMITライセンスとして公開されています。本来なら数百GBのVRAMが必要なモデルを、一般的なコンシューマ向け環境で動かせるようにしたのが最大のポイントです。

必要スペックと動作環境

ベンチマーク結果

環境モデル速度
RTX 5070 (12GB) + Ryzen 5 7600 + 64GB RAMQ2_0(短い対話)93 tok/s
同上(128Kコンテキスト)Q2_074 tok/s
同上IQ2_XS(推奨)79 tok/s(プロンプト読込 2,090 tok/s)
RTX 3090 (24GB)—100〜140 tok/s と見込まれる

また、RTX 5080 + RTX 3090 のマルチGPU構成では、5080単体と比べてプロンプトの読み取り速度が18〜20%高速だったとのことです。

Strataが高速な理由

セットアップと機能

量子化モデルのラインナップ

モデル必要メモリ備考
Q2_037.6GB最軽量
IQ2_XS39.2GB推奨
IQ3_XXS47GB—
IQ3_S54.8GB公開ベンチでフル精度と同等の精度

このほか、推論を短くして回答を早く返すUkisAI製ファインチューン「Swift 1.5」も選択できます。

コメント(要約者の感想)

数百GB VRAMクラスの大規模MoEモデルを、RTX 5070とメモリ64GBの「普通のゲーミングPC」で実用速度で動かせるのはかなり衝撃的。OpenAI/Anthropic互換APIをローカルで提供する点も、コーディングエージェント用途への組み込みがしやすく実用的です。