NVIDIA, 빠르고 특화된 에이전트 작업을 위한 Nemotron 3.5 Lightning 출시
NVIDIA
NVIDIA는 Nemotron 3 모델 제품군에 Nemotron 3.5 Lightning을 추가했다. 이는 항상 실행되는 에이전트를 위해 설계된 오픈 30B 전문가 혼합 모델로, 동급 오픈 모델 대비 최대 4배 빠른 토큰 생성과 30% 더 빠른 완료 시간을 제공한다. 이 모델은 개인화된 작업을 위해 미세 조정할 수 있으며 다양한 NVIDIA 플랫폼에서 로컬로 실행할 수 있다. NVIDIA는 또한 정확성, 속도, 비용을 위해 에이전트 워크플로우를 최적화하는 오픈소스 라우팅 라이브러리인 NeMo Switchyard를 도입했으며, 벤치마크 완료 비용을 Opus 4.8 단독 사용 시 대비 약 3분의 1로 줄인다고 보고했다.
NVIDIA는 항상 켜져 있는 에이전트를 위한 맞춤형 오픈 30B 혼합 전문가(MoE) 모델인 Nemotron 3.5 Lightning을 발표하며 Nemotron 3 제품군을 확장했습니다. 이 모델은 동급 오픈 모델과 비교하여 토큰 생성 속도가 최대 4배 빠르고 완료 시간이 30% 단축되었습니다. 오픈 가중치 덕분에 개발자는 특정 스타일, 전문 분야 또는 코딩 규칙에 맞게 미세 조정하여 이메일 관리, 스마트 홈 루틴, 코딩 동반자와 같은 개인화된 로컬 에이전트 AI 경험을 구현할 수 있습니다. NVIDIA는 vLLM, Ollama, llama.cpp, LM Studio 및 Unsloth와 협력하여 NVFP4 및 GGUF 형식을 포함한 최적화된 로컬 배포 옵션을 제공합니다. 이 모델은 NVIDIA RTX PC, DGX Spark부터 Jetson에 이르는 기기에서 로컬로 실행되며 Acer, ASUS, Dell 및 Lenovo와 같은 파트너의 Blackwell 시스템을 갖춘 워크스테이션과 데이터 센터로 확장됩니다. 또한 NVIDIA는 에이전트 워크플로우의 각 단계를 정확도, 속도 및 비용에 따라 가장 적합한 모델로 안내하는 오픈 소스 라우팅 라이브러리인 NeMo Switchyard를 소개하여 기업이 토큰 비용을 관리하는 데 도움을 줍니다. 내부 벤치마크에 따르면 NeMo Switchyard는 벤치마크 완료 비용을 Opus 4.8의 약 3분의 1로 줄이면서 프런티어 수준의 작업 완료를 유지했습니다. NeMo Switchyard는 GitHub에서 사용할 수 있습니다.
출처: NVIDIA blog —
원문
