⚡ ÚLTIMA HORA
De GPT-2 a gpt-oss: Analizando Avances Arquitectónicos y Comparación con Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI lanzó gpt-oss-120b y gpt-oss-20b, sus primeros modelos de pesos abiertos desde GPT-2. La arquitectura incluye Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU y optimización MXFP4 para inferencia local. Las comparaciones con GPT-2 y Qwen3 destacan las compensaciones entre ancho y profundidad y los sumideros de atención.
OpenAI lanzó gpt-oss-120b y gpt-oss-20b, sus primeros LLM de pesos abiertos desde GPT-2 en 2019. Los modelos incorporan varias mejoras arquitectónicas respecto a GPT-2: eliminación de dropout, sustitución de embeddings posicionales absolutos por RoPE, cambio de activación de GELU a SwiGLU, incorporación de Mixture-of-Experts (MoE) y uso de Grouped Query Attention. MoE aumenta el número total de parámetros, pero solo activa un subconjunto por token, manteniendo eficiente la inferencia. GQA reduce los cabezales de clave-valor para disminuir el uso de memoria. Los modelos emplean optimización MXFP4 para caber en una sola GPU (20B en una GPU de consumo de 16 GB, 120B en una H100 de 80 GB). En comparación con Qwen3, gpt-oss explora los compromisos entre ancho y profundidad. También se discuten el sesgo de atención y los sumideros (sinks). El artículo menciona brevemente GPT-5 en contexto. Las pruebas de rendimiento muestran un rendimiento competitivo, aunque no se proporcionan puntuaciones detalladas.
Fuente: Sebastian Raschka —
original
