приводится реализация кода на основе GPT-подобной модели из книги автора. Ключевые изменения: добавление буферов кэша (cache_k и cache_v) в класс MultiHeadAttention, модификация метода forward для условного использования кэша, добавление метода reset и передача флага use_cache через модель. При генерации, когда use_cache равен True, после первоначального промпта модель обрабатывает только новый токен, без кэша — полную последовательность на каждом шаге. Простое сравнение производительности показывает, что KV-кэш примерно в два раза увеличивает скорость генерации для протестированного примера.