⚡ ÚLTIMA HORA
ModelosPesquisa 🇺🇸 27.07.2026 17:03

Do DeepSeek V3 ao V3.2: Arquitetura, Atenção Esparsa e Atualizações de RL

DeepSeekDeepSeek
A DeepSeek lançou o V3.2, um modelo de pesos abertos de alto desempenho comparável ao GPT-5 e ao Gemini 3.0 Pro. O modelo introduz a DeepSeek Sparse Attention (DSA) para eficiência e evolui de um modelo de raciocínio dedicado (R1) para um modelo de raciocínio híbrido (V3.1, V3.2). A linha do tempo inclui V3, R1, R1-0528, V3.1, V3.2-Exp e V3.2, com destaques arquitetônicos como Multi-Head Latent Attention (MLA) e treinamento RLVR.
DeepSeek V3.2, lançado durante um fim de semana prolongado nos EUA, iguala o desempenho do GPT-5 e do Gemini 3.0 Pro, sendo de pesos abertos. Ele se baseia no V3.1, que adicionou raciocínio híbrido (modos de instrução e raciocínio) à base do V3. A principal novidade é o DeepSeek Sparse Attention (DSA), um mecanismo de atenção esparsa aprendido com um indexador relâmpago e um seletor de tokens que melhora a eficiência, especialmente para contextos longos. O DSA substitui a atenção de janela deslizante ao selecionar dinamicamente quais tokens passados atender. O V3.2-Exp (setembro de 2025) foi um lançamento experimental para preparar a infraestrutura para o V3.2. Modelos anteriores: o V3 (dezembro de 2024) usava MoE e MLA; o R1 (janeiro de 2025) adicionou raciocínio via RLVR com GRPO; o R1-0528 foi uma atualização menor. A empresa supostamente mudou de chips NVIDIA para Huawei e depois de volta para NVIDIA. O lançamento do V3.2 visa um modelo híbrido versátil, enquanto um R2 dedicado ainda pode estar em desenvolvimento.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas