группированного запросного внимания (GQA, Grouped Query Attention). MoE увеличивает общее число параметров, но активирует лишь их подмножество для каждого токена, сохраняя эффективность инференса. GQA сокращает количество ключевых и ценностных головок, снижая потребление памяти. Модели используют оптимизацию MXFP4, чтобы поместиться на одном GPU (20B — на потребительском GPU с 16 ГБ, 120B — на H100 с 80 ГБ). По сравнению с Qwen3, gpt-oss исследует компромиссы между шириной и глубиной. Также обсуждаются смещение внимания и «раковины» (attention sinks). Статья вкратце упоминает GPT-5 в контексте. Бенчмарки показывают конкурентоспособную производительность, хотя детальные оценки не приводятся.