попарное кодирование (Byte Pair Encoding, BPE) и загрузчики данных. Далее объясняется программирование механизмов внимания (самовнимание, причинное внимание, многоголовое внимание) с нуля, после чего демонстрируется построение архитектуры LLM. Курс также показывает предварительное обучение модели на неразмеченных данных, точную настройку для классификации (на примере спама) и инструкционную точную настройку. В качестве бонуса для платных подписчиков доступно нетехническое видео продолжительностью 2,5 часа, в котором обсуждается ландшафт LLM в 2025 году и изменения с 2018 года. Рашка отмечает, что создание LLM с нуля — лучший способ понять, как они работают, проводя аналогию со сборкой гоночного автомобиля, начиная с карта. Видео изначально создавались как дополнительный материал к книге, но также могут использоваться как самостоятельный контент.