te.LayerNormMLP и te.TransformerLayer. Настраивается рецепт FP8 с отложенным масштабированием, использующий гибридные форматы E4M3/E5M2 и историю максимальных абсолютных значений (amax). Создается компактная причинная языковая модель в стиле GPT на основе объединенных блоков te.TransformerLayer, а для сравнения реализуется эквивалентная модель на чистом PyTorch. Модель обучается на детерминированных синтетических последовательностях арифметических закономерностей, с условным автокастингом FP8 при наличии поддержки. При сравнительном анализе измеряются средняя задержка шага и пиковое использование памяти GPU для режимов BF16 и FP8. Проверяются метаданные FP8, включая коэффициенты масштабирования и историю amax. Наконец, жадная авторегрессионная генерация подтверждает, что модель усваивает арифметический интервал, и предлагаются расширения, такие как более крупные модели и альтернативные форматы FP8.