NVIDIA Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

元記事:Hugging Face
ブクマ日時:2026-07-08 13:58:46 UTC
はてブ数:1 user
タグ:あとで読む

📝 モデル概要

Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 は、NVIDIAが開発したデプロイメント最適化大規模言語モデルです。ベースモデルは Nemotron-3-Super-120B-A12B で、Iterative Puzzle というポストトレーニング圧縮フレームワークを使用して、推論効率を大幅に向上させつつ、精度を維持しています。

🏗️ アーキテクチャ

⚡ パフォーマンス改善(Nemotron-3-Super比較)

🚀 推論効率の飛躍的向上

  • 単一 8×B200 ノードで 約2倍 のサーバースループット(同等のユーザースループット制約下)
  • 単一 H100 での100万トークン持続同時実行数が 1リクエスト → 8リクエスト に増加
  • 推論、コーディング、多言語、長文脈、エージェント系ベンチマークで強力な精度を維持

📊 ベンチマーク結果(NVFP4版)

汎用知識・推論

ベンチマークNVFP4
MMLU-Pro (汎用知識)82.2
AIME25 (推論・ツールなし)89.9
HMMT Feb25 (推論・ツールなし)92.9
GPQA (ツールなし)78.0

コーディング・エージェント

ベンチマークNVFP4
LiveCodeBench v579.9
SciCode (subtask)40.3
Terminal Bench (hard)23.4

長文脈・多言語

ベンチマークNVFP4
RULER @ 256k95.3
RULER @ 512k94.8
RULER @ 1M93.2
MMLU-ProX (多言語平均)76.5
WMT24++ (en→xx)85.1

🌐 サポート言語

英語、フランス語、ドイツ語、イタリア語、日本語、スペイン語、中国語

📄 ライセンス

OpenMDW-1.1(Open Model DW License)— 商用利用可能。現在コントリビューションは受け付けていません。

💡 まとめ

NVIDIAが圧縮フレームワーク「Iterative Puzzle」とNVFP4量子化を組み合わせることで、120B級モデルの性能を75B/9.3B activeという効率的なサイズで実現。特に推論効率の劇的改善(スループット2倍、同時実行数8倍)は、実際のデプロイメントにおいて非常に魅力的。精度低下もFP8と同等レベルに抑えられており、実用的なバランスが取れたモデルと言える。