⚡ СРОЧНО
От GPT-2 до gpt-oss: анализ архитектурных достижений и сравнение с Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI выпустила gpt-oss-120b и gpt-oss-20b, свои первые модели с открытыми весами со времен GPT-2. Архитектура включает смесь экспертов (Mixture-of-Experts), групповое запросное внимание (Grouped Query Attention), RoPE, SwiGLU и оптимизацию MXFP4 для локального вывода. Сравнения с GPT-2 и Qwen3 подчеркивают достижения в компромиссах между шириной и глубиной, а также в механизмах внимания.
OpenAI выпустила gpt-oss-120b и gpt-oss-20b — свои первые модели с открытыми весами со времен GPT-2 в 2019 году. Модели включают несколько архитектурных улучшений по сравнению с GPT-2: удаление dropout, замена абсолютных позиционных эмбеддингов на RoPE (Rotary Position Embedding), смена активации с GELU на SwiGLU, добавление смеси экспертов (MoE, Mixture-of-Experts) и использование
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
