PesquisaModelos 🇺🇸 27.07.2026 17:03

Estado dos LLMs em 2025: Progresso, Desafios e Previsões

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Em 2025, o desenvolvimento de LLMs foi dominado por modelos de raciocínio que utilizam aprendizado por reforço com recompensas verificáveis (RLVR) e o algoritmo GRPO, impulsionado pelo DeepSeek R1. As principais tendências incluem foco em escalonamento no momento da inferência, arquiteturas MoE e ajustes de eficiência como Gated DeltaNets. A pesquisa acadêmica destacou variantes do GRPO com melhorias como filtragem de gradiente zero e perda no nível do token.
Ao final de 2025, o ano foi dominado por modelos de raciocínio que utilizam RLVR e GRPO, após o lançamento do DeepSeek R1 em janeiro. O DeepSeek R1 mostrou que o comportamento de raciocínio poderia ser desenvolvido com aprendizado por reforço, e seu modelo de pesos abertos teve desempenho comparável aos proprietários. O artigo também alimentou o debate sobre os custos de treinamento, com estimativas em torno de US$ 5 milhões para a execução final, embora excluindo salários de pesquisadores. O RLVR utiliza recompensas verificáveis (por exemplo, matemática, código) para pós-treinamento, reduzindo a dependência de rótulos humanos caros. Todos os grandes desenvolvedores de LLMs lançaram uma variante de raciocínio. Outros pontos de destaque: 2022 RLHF+PPO, 2023 LoRA SFT, 2024 treinamento intermediário. Previsões para 2026-2027 incluem extensões do RLVR, escalonamento em tempo de inferência e aprendizado contínuo. O GRPO tornou-se um queridinho da pesquisa, com muitas melhorias matemáticas, como filtragem de gradiente zero, amostragem ativa, perda em nível de token e ausência de perda KL, que melhoram significativamente a estabilidade do treinamento. Arquiteturalmente, os modelos de última geração ainda utilizam transformers estilo decoder com camadas MoE e atenção com eficiência ajustada (consulta agrupada, janela deslizante, atenção latente mult cabeça). Novas otimizações de eficiência incluem Gated DeltaNets no Qwen3-Next e Kimi Linear, e camadas Mamba-2 no Nemotron 3 da NVIDIA.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas