официальных цифр не раскрывала. Три источника, знакомых с ситуацией, сообщили FT (Financial Times), что модель сейчас находится на этапе предварительного обучения (pre-training), который обычно занимает от трёх до шести месяцев. Количество параметров определяет, сколько информации способна «удержать» модель, однако итоговая производительность зависит также от качества данных и методов обучения. Один из источников отметил, что ByteDance уже более года отказывается от дистилляции — техники донастройки на выходных данных других моделей. Основатель компании Чжан Имин призвал команду Seed, в которой работает около 2000 человек, стремиться к тому, чтобы в долгосрочной перспективе создавать модели, лидирующие в мире по своим возможностям. Между тем, как сообщается, компания xAI Илона Маска обучает варианты модели Grok с шестью и десятью триллионами параметров на своём кластере Colossus 2.