Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 は、NVIDIAが開発したデプロイメント最適化大規模言語モデルです。ベースモデルは Nemotron-3-Super-120B-A12B で、Iterative Puzzle というポストトレーニング圧縮フレームワークを使用して、推論効率を大幅に向上させつつ、精度を維持しています。
| ベンチマーク | NVFP4 |
|---|---|
| MMLU-Pro (汎用知識) | 82.2 |
| AIME25 (推論・ツールなし) | 89.9 |
| HMMT Feb25 (推論・ツールなし) | 92.9 |
| GPQA (ツールなし) | 78.0 |
| ベンチマーク | NVFP4 |
|---|---|
| LiveCodeBench v5 | 79.9 |
| SciCode (subtask) | 40.3 |
| Terminal Bench (hard) | 23.4 |
| ベンチマーク | NVFP4 |
|---|---|
| RULER @ 256k | 95.3 |
| RULER @ 512k | 94.8 |
| RULER @ 1M | 93.2 |
| MMLU-ProX (多言語平均) | 76.5 |
| WMT24++ (en→xx) | 85.1 |
英語、フランス語、ドイツ語、イタリア語、日本語、スペイン語、中国語
OpenMDW-1.1(Open Model DW License)— 商用利用可能。現在コントリビューションは受け付けていません。
NVIDIAが圧縮フレームワーク「Iterative Puzzle」とNVFP4量子化を組み合わせることで、120B級モデルの性能を75B/9.3B activeという効率的なサイズで実現。特に推論効率の劇的改善(スループット2倍、同時実行数8倍)は、実際のデプロイメントにおいて非常に魅力的。精度低下もFP8と同等レベルに抑えられており、実用的なバランスが取れたモデルと言える。