NvidiaのオープンなNemotron 3.5 Lightningは、最大の知能よりも速度を優先
NVIDIA
OpenAI
Meta
Google/DeepMind
Nvidiaは、パラメータ数が4分の1でありながらOpenAIのgpt-oss-120bと同等の知能を持つ、コンパクトなオープンウェイトモデルであるNemotron 3.5 Lightningをリリースしました。最終的なNVFP4ウェイトを用いた予備テストでは、毎秒約670トークンを達成し、比較したモデルの中で最も高速であるとされています。
Nvidiaは、新しいNemotron 3.5シリーズの最初のモデルとなるNemotron 3.5 Lightningを発表しました。これはNemotron 3 Nano 30B A3Bの直接の後継であり、同モデルのハイブリッドMamba-Transformerアーキテクチャを採用しています。総パラメータ数は316億で、そのうち36億がアクティブです。独立系ベンチマークプラットフォームのArtificial Analysisによると、このモデルはインテリジェンス指数24を達成し、前身モデル(15)から9ポイント上昇しました。これにより、LightningはOpenAIのgpt-oss-120b(24)と同等となり、約4倍の規模を持つNvidia自身のNemotron 3 Super(26)にわずかに劣ります。同じクラスの最もインテリジェントな小型モデル、例えばQwen3.6 35B A3B(32)やMetaの新しいMuse Glimmer(35)は、依然として明確にリードしています。Nvidiaは、Lightningを効率性のフロンティアの異なるポイントに位置づけています。最終的なNVFP4ウェイトでの予備テストでは、このモデルは毎秒約670トークンに達し、比較対象モデルの中で最高の測定値となり、GoogleのGemini 3.5 Flash-Lite(386トークン/秒)のほぼ2倍の速度です。したがって、インテリジェンス指数のタスク1件は約0.5分かかりますが、Qwen3.6 35B A3Bは約3.5分、Gemma 4 31Bは約5.8分かかります。プロプライエタリモデルは、引き続き全体の効率フロンティアを支配しています。Gemini 3.5 Flash-Liteは、同様のタスクあたりの時間でインテリジェンス指数37を達成し、GPT-5.6 Luna(最大)は2分未満で52ポイントに達します。最大の改善は、エージェント機能で見られるとArtificial Analysisは述べています。GDPval-AA v2では、LightningはEloスコア824を達成し、Nemotron 3 Nanoから334ポイント上昇し、gpt-oss-120b(800)と大型のNemotron 3 Super(698)の両方を上回りました。Terminal-Bench v2.1では、スコアは7パーセントから24.3パーセントに上昇し、gpt-oss-120b(26.2パーセント)とほぼ同等のレベルです。寛容なOpenMDW-1.1ライセンスのもと、Nvidiaはこのモデルを高スループットのエージェントパイプライン向けの効率的なワークホースとして位置づけています。Artificial Analysisによると、NvidiaはCodeRabbitやHarveyなどのパートナーと事後トレーニングに協力し、特定のドメインでのパフォーマンスを向上させました。Nvidiaは、このモデルをBF16およびNVFP4ウェイトで提供します。NVFP4バリアントも、高精度版と比較して最小限の劣化でインテリジェンス指数24を獲得しています。推論モデルはテキストのみを処理し、コンテキストウィンドウは100万トークンです。ウェイトは即座に利用可能で、サーバーレス推論はDeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoeが提供しています。
出典: The Decoder (DE) —
原文
