NVIDIA、高速かつ専門特化したエージェント向けタスクに対応するNemotron 3.5 Lightningを発表
NVIDIA
NVIDIAは、Nemotron 3モデルファミリーを拡張し、常時稼働のエージェント向けに設計されたオープンな30B混合専門家(mixture-of-experts)モデルであるNemotron 3.5 Lightningを発表しました。このモデルは、同クラスのオープンモデルと比較して、トークン生成速度が最大4倍高速、完了までの時間が30%短縮されます。また、個別のタスク向けにファインチューニングが可能で、さまざまなNVIDIAプラットフォーム上でローカルに実行できます。さらにNVIDIAは、エージェントのワークフローを精度、速度、コストの面で最適化するオープンソースのルーティングライブラリであるNeMo Switchyardも導入しました。これにより、ベンチマーク完了コストがOpus 4.8単体の約3分の1に削減されると報告されています。
NVIDIAは、常時稼働型エージェント向けのカスタマイズ可能なオープンな30B混合専門家モデル(Mixture-of-Experts、MoE)であるNemotron 3.5 Lightningを発表し、Nemotron 3ファミリーを拡張しました。このモデルは、同クラスのオープンモデルと比較して、トークン生成速度が最大4倍、完了までの時間が30%高速です。オープンウェイト(公開された重み)を持つため、開発者は特定のスタイル、専門分野、またはコーディング規約に合わせてファインチューニングでき、メール管理、スマートホームのルーチン、コーディングコンパニオンなどのパーソナライズされたローカルなエージェント型AI体験を実現できます。NVIDIAはvLLM、Ollama、llama.cpp、LM Studio、Unslothと協力し、NVFP4やGGUF形式を含む最適化されたローカル展開オプションを提供します。このモデルは、NVIDIA RTX PC、DGX Spark、Jetsonなどのデバイスでローカルに実行され、Acer、ASUS、Dell、LenovoなどのパートナーのBlackwellシステムを搭載したワークステーションやデータセンターにもスケールアップできます。さらに、NVIDIAはNeMo Switchyardを発表しました。これは、エージェントワークフローの各ステップを、精度、速度、コストに基づいて最適なモデルに誘導するオープンソースのルーティングライブラリであり、企業のトークンコスト管理を支援します。内部ベンチマークによると、NeMo Switchyardは、最先端レベルのタスク完了を維持しながら、ベンチマーク完了コストをOpus 4.8の約3分の1に削減しました。NeMo SwitchyardはGitHubで入手可能です。
出典: NVIDIA blog —
原文
