разработчики могут дообучать её под конкретные стили, специализации или соглашения о написании кода, что позволяет создавать персонализированные локальные агентные ИИ-решения, такие как управление электронной почтой, сценарии умного дома или помощники по программированию. NVIDIA сотрудничала с vLLM, Ollama, llama.cpp, LM Studio и Unsloth, чтобы обеспечить оптимизированные варианты локального развертывания, включая форматы NVFP4 и GGUF. Модель работает локально на устройствах от ПК NVIDIA RTX и DGX Spark до Jetson и масштабируется до рабочих станций и центров обработки данных с системами Blackwell от таких партнеров, как Acer, ASUS, Dell и Lenovo. Кроме того, NVIDIA представила NeMo Switchyard — библиотеку маршрутизации с открытым исходным кодом, которая направляет каждый шаг рабочего процесса агента к наиболее подходящей модели с учетом точности, скорости и стоимости, помогая предприятиям управлять затратами на токены. Внутренние бенчмарки показывают, что NeMo Switchyard снизила стоимость выполнения бенчмарков примерно до одной трети от стоимости Opus 4.8, сохраняя при этом уровень выполнения задач на передовом уровне. NeMo Switchyard доступна на GitHub.