⚡ ÚLTIMA HORA
ModelosPesquisa 🇺🇸 27.07.2026 18:03

Do GPT-2 ao gpt-oss: Analisando Avanços Arquitetônicos e Comparação com o Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
A OpenAI lançou o gpt-oss-120b e o gpt-oss-20b, seus primeiros modelos de pesos abertos desde o GPT-2. A arquitetura apresenta Mistura de Especialistas, Atenção por Consulta Agrupada, RoPE, SwiGLU e otimização MXFP4 para inferência local. Comparações com o GPT-2 e o Qwen3 destacam avanços nos trade-offs entre largura e profundidade e atençãosinks.
A OpenAI lançou o gpt-oss-120b e o gpt-oss-20b, seus primeiros modelos de linguagem de grande escala (LLMs, Large Language Models) com pesos abertos desde o GPT-2, em 2019. Os modelos incorporam diversas melhorias arquiteturais em relação ao GPT-2: remoção do dropout, substituição das embeddings posicionais absolutas por RoPE, troca da ativação de GELU para SwiGLU, adição de Mistura de Especialistas (MoE, Mixture-of-Experts) e uso de Atenção Agrupada por Consulta (GQA, Grouped Query Attention). O MoE aumenta o total de parâmetros, mas ativa apenas um subconjunto por token, mantendo a inferência eficiente. O GQA reduz as cabeças de valor-chave para diminuir o uso de memória. Os modelos utilizam a otimização MXFP4 para caber em GPUs individuais (20B em uma GPU consumidora de 16GB, 120B em uma H100 de 80GB). Em comparação com o Qwen3, o gpt-oss explora os compromissos entre largura e profundidade. Viés de atenção e sinks também são discutidos. O artigo também menciona brevemente o GPT-5 no contexto. Os benchmarks mostram desempenho competitivo, embora pontuações detalhadas não sejam fornecidas.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas