ModelosPesquisa 🇺🇸 27.07.2026 18:03

Do GPT-2 ao gpt-oss: Análise de Melhorias Arquiteturais e Comparação com Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
A OpenAI lançou seus primeiros modelos de pesos abertos desde 2019 — gpt-oss-120b e gpt-oss-20b. O artigo examina as principais mudanças arquiteturais em relação ao GPT-2: remoção do dropout, substituição das embeddings posicionais absolutas por RoPE, transição de GELU para SwiGLU, introdução de mistura de especialistas (MoE) e atenção de consulta agrupada (GQA). Também discute a otimização MXFP4 para execução em uma única GPU e comparação com Qwen3 e GPT-5.
A OpenAI finalmente lançou seus primeiros modelos de pesos abertos em seis anos — gpt-oss-120b e gpt-oss-20b. Ao contrário do GPT-2 (2019), a arquitetura passou por muitas mudanças. Em primeiro lugar, o dropout foi completamente removido: em LLMs treinados por apenas uma época em conjuntos de dados gigantescos, ele só piora os resultados. Em vez de embeddings posicionais absolutos como no GPT-2, agora é usado RoPE (Rotary Position Embedding), que codifica a posição através da rotação dos vetores de consultas e chaves. A função de ativação GELU foi substituída pela Swish, mais barata computacionalmente, e o bloco de feed-forward foi transformado em um módulo linear com portas SwiGLU, que oferece mais expressividade com menos parâmetros. Além disso, o único módulo de feed-forward foi substituído por uma mistura de especialistas (MoE): no modelo de 20B, apenas 1 dos 8 especialistas é ativado por token, permitindo aumentar a capacidade total do modelo sem aumentar os custos computacionais. Por fim, a atenção multi-cabeça deu lugar à atenção de consultas agrupadas (GQA) — chaves e valores agora são compartilhados entre várias cabeças, economizando memória e acelerando a inferência. Graças à otimização MXFP4, o modelo de 20B cabe em uma GPU de consumo com 16 GB de memória, e o de 120B, em uma única H100. O artigo também compara o gpt-oss com o Qwen3 (demonstrando o equilíbrio entre largura e profundidade) e aborda características do novo GPT-5.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas