МоделиИсследования 🇺🇸 20.07.2026 13:04

От GPT-2 до gpt-oss: анализ архитектурных улучшений и сравнение с Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
OpenAI выпустила открытые весовые модели gpt-oss-120b и gpt-oss-20b — первые полностью открытые модели с 2019 года. В статье подробно разбираются архитектурные изменения по сравнению с GPT-2: отказ от dropout, замена абсолютных позиционных кодировок на RoPE, переход на SwiGLU, использование Mixture-of-Experts и Grouped Query Attention.
OpenAI выпустила открытые весовые модели gpt-oss-120b и gpt-oss-20b, первые полностью открытые модели с 2019 года, когда был опубликован GPT-2. Архитектура моделей основана на трансформере, но включает несколько ключевых улучшений. Во-первых, dropout больше не используется, так как LLM обучаются только одну эпоху на огромных наборах данных, что снижает риск переобучения. Во-вторых, абсолютные позиционные кодировки заменены на RoPE, что позволяет модели эффективнее учитывать порядок токенов. В-третьих, функция активации GELU уступила место Swish/SiLU, которая вычислительно дешевле. Кроме того, стандартный feedforward-модуль заменён на SwiGLU с меньшим количеством параметров, а также используется Mixture-of-Experts, где для каждого токена активируется лишь часть экспертов, что увеличивает общую ёмкость модели без пропорционального роста вычислительных затрат. Также применяется Grouped Query Attention, которая уменьшает использование памяти за счёт группировки ключей и значений между несколькими головками внимания. Модели доступны с оптимизацией MXFP4, позволяющей запускать 20B на потребительских GPU с 16 ГБ ОЗУ, а 120B — на одном H100 с 80 ГБ. Статья также содержит сравнение с Qwen3 и упоминает о скором выходе GPT-5.
Сокращения
LLM = Large Language Model — большая языковая модель
MoE = Mixture of Experts — смесь экспертов
GQA = Grouped Query Attention — группированное внимание запросов
RoPE = Rotary Position Embedding — вращательное позиционное кодирование
GELU = Gaussian Error Linear Unit — линейный элемент с гауссовой ошибкой
SwiGLU = Swish Gated Linear Unit — затворный линейный элемент Swish
MHA = Multi-Head Attention — многоголовочное внимание
KV = Key-Value — ключ-значение
Источник: Sebastian Raschka — оригинал

Наши прошлые публикации по теме

Есть свежие новости