нехватку данных для нового стандарта IDS, внедрение словаря IFC, насчитывающего несколько тысяч терминов, и специфическую для IDS грамматику. Для их преодоления ONESTRUCTION использовал генерацию синтетических данных с участием отраслевых экспертов и трехэтапный конвейер обучения: продолженное предобучение (CPT), контролируемую тонкую настройку (SFT) и обучение с подкреплением на основе проверяемых вознаграждений (RLVR). Для RLVR в качестве функции вознаграждения использовался инструмент IDS-Audit-Tool от buildingSMART, что гарантировало корректность XML, структурную валидность IDS и семантическую согласованность. Обучение проводилось на инстансах Amazon EC2 P5en с использованием AWS ParallelCluster, данные хранились на Amazon FSx for Lustre. В ходе оценки с использованием собственного эталона IDS-Bench модель Ishigaki-IDS показала результат, близкий к 100 процентам по структурному соответствию XML и IDS, и выше 80 процентов по согласованности содержимого IDS, в то время как ведущие универсальные модели показали менее 25 процентов по структурному соответствию и почти ноль процентов по согласованности содержимого. Модель поддерживает масштабирование длины контекста с помощью YaRN, корректно генерируя данные при входах и выходах объемом до примерно 120 тысяч токенов. Совместная пилотная проверка с buildingSMART получила положительные отзывы как от специалистов по IDS, так и от неспециалистов. Извлеченные уроки включают важность качества синтетических данных, а не их количества, ускорение итераций благодаря проверяемым вознаграждениям и стабильную инфраструктуру, позволяющую свободно экспериментировать.