総パラメータ125B(1,250億)・アクティブパラメータ6B(60億)の大規模モデル「Qwen3.8-Flash-Next」を、ビデオカード1枚のゲーミングPCで秒間60〜95トークンという高速で動かせる推論エンジン「Strata」が公開されました。開発者はNiko1221氏で、GitHubでMITライセンスとして公開されています。本来なら数百GBのVRAMが必要なモデルを、一般的なコンシューマ向け環境で動かせるようにしたのが最大のポイントです。
| 環境 | モデル | 速度 |
|---|---|---|
| RTX 5070 (12GB) + Ryzen 5 7600 + 64GB RAM | Q2_0(短い対話) | 93 tok/s |
| 同上(128Kコンテキスト) | Q2_0 | 74 tok/s |
| 同上 | IQ2_XS(推奨) | 79 tok/s(プロンプト読込 2,090 tok/s) |
| RTX 3090 (24GB) | — | 100〜140 tok/s と見込まれる |
また、RTX 5080 + RTX 3090 のマルチGPU構成では、5080単体と比べてプロンプトの読み取り速度が18〜20%高速だったとのことです。
http://127.0.0.1:8080/v1 でOpenAI互換、/v1/messages でAnthropic互換APIを提供 → 既存のAIコーディングエージェントからローカルモデルとして利用可能。| モデル | 必要メモリ | 備考 |
|---|---|---|
| Q2_0 | 37.6GB | 最軽量 |
| IQ2_XS | 39.2GB | 推奨 |
| IQ3_XXS | 47GB | — |
| IQ3_S | 54.8GB | 公開ベンチでフル精度と同等の精度 |
このほか、推論を短くして回答を早く返すUkisAI製ファインチューン「Swift 1.5」も選択できます。
数百GB VRAMクラスの大規模MoEモデルを、RTX 5070とメモリ64GBの「普通のゲーミングPC」で実用速度で動かせるのはかなり衝撃的。OpenAI/Anthropic互換APIをローカルで提供する点も、コーディングエージェント用途への組み込みがしやすく実用的です。