Ключевой фактор — это скидка DeepSeek на кэш в 98 процентов, что значительно выше среднего показателя по отрасли в 90 процентов. Модель также потребляет на двенадцать процентов меньше токенов, чем её предшественница. Улучшения охватывают все категории тестов, особенно агентные задачи: в бенчмарке GDPval, который измеряет сложную офисную работу в реальном мире, оценка выросла с 1189 до 1559 баллов Эло, а частота галлюцинаций снизилась. Архитектура осталась прежней: 284 миллиарда параметров, из которых активны 13 миллиардов, с контекстным окном в один миллион токенов. Веса модели распространяются по лицензии MIT на Hugging Face.