⚡ СРОЧНО
МоделиИсследования 🇺🇸 27.07.2026 17:03

От DeepSeek V3 до V3.2: архитектура, разреженное внимание и обновления RL

DeepSeekDeepSeek
DeepSeek выпустила V3.2 — флагманскую модель с открытым весом, производительность которой сопоставима с GPT-5 и Gemini 3.0 Pro. Модель внедряет DeepSeek Sparse Attention (DSA) для эффективности и развивается от выделенной модели рассуждений (R1) до гибридной модели рассуждений (V3.1, V3.2). Хронология включает V3, R1, R1-0528, V3.1, V3.2-Exp и V3.2, с архитектурными особенностями, такими как Multi-Head Latent Attention (MLA) и обучение RLVR.
Модель DeepSeek V3.2, выпущенная в праздничные выходные в США, соответствует производительности GPT-5 и Gemini 3.0 Pro, оставаясь при этом моделью с открытыми весами. Она развивает V3.1, которая добавила гибридное рассуждение (режимы instruct и reasoning) к базовой V3. Ключевая новая особенность — DeepSeek Sparse Attention (DSA, разреженное внимание), обученный механизм разреженного внимания с
Показать ещё ↓
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости