⚡ ÚLTIMA HORA
ModelosInvestigación 🇺🇸 27.07.2026 18:03

De GPT-2 a gpt-oss: Analizando Avances Arquitectónicos y Comparación con Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI lanzó gpt-oss-120b y gpt-oss-20b, sus primeros modelos de pesos abiertos desde GPT-2. La arquitectura incluye Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU y optimización MXFP4 para inferencia local. Las comparaciones con GPT-2 y Qwen3 destacan las compensaciones entre ancho y profundidad y los sumideros de atención.
OpenAI lanzó gpt-oss-120b y gpt-oss-20b, sus primeros LLM de pesos abiertos desde GPT-2 en 2019. Los modelos incorporan varias mejoras arquitectónicas respecto a GPT-2: eliminación de dropout, sustitución de embeddings posicionales absolutos por RoPE, cambio de activación de GELU a SwiGLU, incorporación de Mixture-of-Experts (MoE) y uso de Grouped Query Attention. MoE aumenta el número total de parámetros, pero solo activa un subconjunto por token, manteniendo eficiente la inferencia. GQA reduce los cabezales de clave-valor para disminuir el uso de memoria. Los modelos emplean optimización MXFP4 para caber en una sola GPU (20B en una GPU de consumo de 16 GB, 120B en una H100 de 80 GB). En comparación con Qwen3, gpt-oss explora los compromisos entre ancho y profundidad. También se discuten el sesgo de atención y los sumideros (sinks). El artículo menciona brevemente GPT-5 en contexto. Las pruebas de rendimiento muestran un rendimiento competitivo, aunque no se proporcionan puntuaciones detalladas.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas