ModelosAplicaciones 🇺🇸 11.08.2026 20:02

ONESTRUCTION construye el modelo fundacional Ishigaki-IDS para BIM con AWS GenAIIC

Alibaba/QwenAlibaba/Qwen Amazon Web ServicesAmazon Web Services ONESTRUCTION, Inc.ONESTRUCTION, Inc.
ONESTRUCTION, una startup japonesa de tecnología para la construcción, ha construido Ishigaki-IDS, un modelo fundacional especializado en los flujos de trabajo BIM de la industria de la construcción, con asesoramiento técnico del AWS Generative AI Innovation Center. El modelo, basado en Qwen3, utiliza datos sintéticos y un pipeline de entrenamiento en tres etapas (CPT, SFT y RLVR) para superar la escasez de datos y lograr una alta precisión en la generación de IDS.
ONESTRUCTION, una startup de tecnología de la construcción, construyó Ishigaki-IDS, un modelo fundacional (FM) especializado en los flujos de trabajo BIM (Building Information Modeling) de la industria de la construcción, con asesoría técnica del AWS Generative AI Innovation Center como parte de la Fase 3 de GENIAC. El modelo se basa en Qwen3 y aborda tres desafíos: la escasez de datos para el nuevo estándar IDS, la inyección de un vocabulario IFC de varios miles de términos y la gramática específica de IDS. Para superarlos, ONESTRUCTION utilizó generación de datos sintéticos con expertos en el dominio y un pipeline de entrenamiento en tres etapas: preentrenamiento continuado (CPT), ajuste fino supervisado (SFT) y aprendizaje por refuerzo con recompensas verificables (RLVR). Para RLVR, utilizaron la herramienta IDS-Audit-Tool de buildingSMART como función de recompensa para garantizar la buena formación del XML, la validez estructural de IDS y la consistencia semántica. Entrenaron en instancias Amazon EC2 P5en con AWS ParallelCluster y almacenaron datos en Amazon FSx para Lustre. En la evaluación con su propio benchmark IDS-Bench, Ishigaki-IDS obtuvo una puntuación cercana al 100 por ciento en cumplimiento estructural de XML e IDS, y superior al 80 por ciento en consistencia de contenido IDS, mientras que los modelos frontera generales obtuvieron menos del 25 por ciento en cumplimiento estructural y cerca del 0 por ciento en consistencia de contenido. El modelo admite la ampliación de la longitud de contexto con YaRN, generando correctamente con entradas y salidas de hasta aproximadamente 120 mil tokens. Una prueba de concepto conjunta con buildingSMART recibió comentarios positivos tanto de especialistas como de no especialistas en IDS. Las lecciones aprendidas incluyen la importancia de la calidad de los datos sintéticos sobre la cantidad, las recompensas verificables que aceleran la iteración, y una infraestructura estable que permite experimentar libremente.
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas