概要:Jeffとは?
Jeffは、ChatGPTの共同開発者ディオゴ・アルメイダ氏がCEOを務めるTypeSafe AIが開発した意思決定モデル「Jev」と同じリクエスト形式でコードに組み込める、小型・高速・無料の意思決定モデルです。ローカル環境で動かせて、1回の意思決定あたり約22〜28ミリ秒という爆速っぷりが最大のウリ。
ポイント:Jev互換のAPI形式をそのまま使えるので、既にJevを試している人ならほぼそのまま置き換えて試せます。ゼロショット分類により、分類項目ごとのトレーニングなしで選択肢から答えを選べます。
パフォーマンス数字
約22msRTX PRO 6000搭載PC
(0.8Bモデル・1判断あたり)
約28msApple M4 Max搭載Mac
(0.8Bモデル・1判断あたり)
- パラメーターサイズ8億(0.8B)のモデルが上記速度で動作
- ローカル環境で完結するため、APIコスト不要・プライバシー面でも安心
ラインナップとライセンス
Jeffは3種類のベースモデルに追加学習(ファインチューン)した3兄弟で公開されています。
- Jeff-Qwen3.5-0.8B(Qwen3.5 0.8Bベース)
- Jeff-Qwen3.5-2B(Qwen3.5 2Bベース)
- Jeff-Gemma4-E2B(Gemma 4 E2Bベース)
オープンなライセンス構成
- コード:MITライセンス(GitHub: firelex/jeff)
- モデルの重み:Apache 2.0(Hugging Faceで3種とも公開)
トレーニングのこだわり:「クローズドモデル不使用」
- トレーニングはRTX PRO 6000 1台のワークステーションで実施。0.8Bモデルで約2時間、2Bモデルでも約3時間半と驚異的に短時間
- トレーニングデータは2台のDGX Spark上で動くオープンモデル「Qwen3.8-Flash-Next」で生成
- クラウドGPUは不使用、トレーニングデータにクローズドモデルの出力を含めないことにこだわり(クローズドモデルはサンプル品質チェックのみに使用)
- トレーニングコードはオープンソースのAutoJevがベース
ベンチマーク結果
JeffはJevと複数のベンチマークで比較されており、項目によってはJevに匹敵するスコアを記録しています。
| ベンチマーク | 測定対象 |
| BIG-Bench Hard(BBH) | 高度な論理推論・多段階思考 |
| Financial PhraseBank | 金融・経済テキストの感情分析 |
| JudgeBench | AI能力の客観的・厳格な測定 |
| RAGTruth | ハルシネーション(幻覚)検知精度 |
| WinoGrande | 常識的推論 |
| JevBench | TypeSafe AI作成の意思決定モデル向けベンチ |
※「Overall」はJevBench以外の5ベンチの総合評価スコアです。
注意点(READMEより)
- 「Jevはより大きなモデルで動作するため、推論パフォーマンスでは及ばない」と明記。Jeff自体は推論を行わない設計
- 「このパラメーターサイズのモデルに多段階の推論を期待すべきではない。迅速かつ的確な意思決定のためのもの」
- 2Bモデルは0.8Bモデルよりゲームプレイ時の意思決定が劣る傾向 → 開発者は「リスク回避傾向が強いため」と分析(さらなる調査が必要とのこと)
知っておきたい注意点・周辺動向
- JeffはJevとの互換性をうたっているが、TypeSafe AIとは無関係・非承認のサードパーティー作品である点に注意
- Jev系の意思決定モデルは他にも登場中。Qwen3.5/3.8ベースの「Kev」(jaredpalmer/kev)など、自前でトレーニング・実行可能なモデル家族が増加傾向
まとめ
- 「Jev互換APIをローカル・無料・ミリ秒台で使いたい」というニーズにバッチリハマるモデル
- ライセンスもMIT/Apache 2.0で商用利用も見込みやすく、エッジ環境やコスト削減がしたいプロジェクトに刺さる構成
- ただし「推論はしない・的確な分類と意思決定に特化」という位置づけなので、LLMの代替ではなくルーティングや分類の専用部品として使うのが正解っぽい