и предназначен для управления удаленными датчиками, устройствами интернета вещей и другим оборудованием, но запускать на нем что-то вроде DeepSeek V4 Flash невозможно. Вместо этого SlvDev выбрал TinyStories, модель, разработанную Microsoft Research, с 28,9 миллиона параметров, что примерно в 10 000 раз компактнее. Даже эта модель изначально требовала около 60 МБ пространства при 16-битной точности, что было слишком много для ESP32-S3. Поэтому автор квантовал модель, сжав веса с 16 до 8 бит, а затем до 4 бит, уменьшив размер модели до 14,9 МБ, что потребовало версии микроконтроллера с 16 МБ флэш-памяти. Далее энтузиаст реализовал механизм послойного встраивания (per-layer embedding, PLE), используемый в архитектуре открытых моделей Google Gemma, что позволило переместить 25 миллионов параметров (12 МБ) во флэш-память, к которой обращение происходит относительно редко, а в оперативной памяти контроллера разместить только 2 МБ данных. В результате входные заголовки и кэш ключ-значение (KV) были размещены в PSRAM, а 520 КБ SRAM хватило для активаций. Эти меры позволили достичь генерации со скоростью 9,88 токенов в секунду, что быстрее, чем средняя скорость чтения человека. TinyStories — отличная демонстрация концепции, но она генерирует только короткие истории, которых недостаточно даже для чат-бота. Модель Barista аналогичного размера может отвечать на вопросы, генерирует токены в два раза быстрее, но только на темы, связанные с эспрессо. Обе модели слишком малы для других задач, но сам факт их работы на ESP32 впечатляет.