Sand.ai publica el primer modelo de generación de video MoE de código abierto con 100 mil millones de parámetros: 114 mil millones, 6 mil millones activados
Sand.ai ha lanzado MAGI-2-preview, el primer modelo de generación de video de código abierto con más de 100 mil millones de parámetros que utiliza una arquitectura de Mezcla de Expertos. El modelo tiene 114 mil millones de parámetros en total, pero activa solo alrededor de 6 mil millones por pasada, lo que permite la generación de video de 10 segundos en 1080p a un costo de solo 0.5 yuanes, aproximadamente una décima parte de los modelos convencionales. Ocupa el sexto lugar en el benchmark de generación de video AA, mostrando un rendimiento sólido con una activación mínima.
Sand.ai, un equipo afiliado a la Universidad de Tsinghua, ha lanzado en código abierto MAGI-2-preview, el primer modelo de generación de video de código abierto con cien mil millones de parámetros que utiliza Mezcla de Expertos (MoE). El modelo tiene 114 mil millones de parámetros en total, pero activa solo unos 6 mil millones por inferencia, lo que reduce drásticamente los costos. Según los precios actuales de 8 tarjetas H100, generar un video de 10 segundos en 1080p cuesta solo 0,5 yuanes, aproximadamente una décima parte de los modelos convencionales. MAGI-2-preview ocupa el sexto lugar en el punto de referencia de generación de video AA, con un rendimiento cercano a los modelos de primer nivel a pesar de activar solo 6 mil millones de parámetros. El modelo utiliza una arquitectura de flujo único donde los tokens de texto, video y audio se procesan juntos en un Transformer unificado, lo que permite una mejor sincronización audiovisual. Emplea LatentMoE de múltiples cabezas, dividiendo la representación oculta de 3072 dimensiones en 12 cabezas de 256 dimensiones cada una, con enrutamiento independiente por cabeza, lo que permite que cada token active 72 pequeños expertos en 36 capas, sumando un total de 3072 expertos por capa. Sand.ai desarrolló una biblioteca de kernels personalizada llamada MagiMoE y una estrategia de paralelismo de cabezas para optimizar la comunicación y el cálculo en secuencias largas, utilizando Muon para los parámetros de la matriz y AdamW para los parámetros de los expertos. La estrategia de datos se centra en organizar datos diversos en lugar de filtrarlos, y el entrenamiento se divide en preentrenamiento para una cobertura amplia y postentrenamiento para alineación y seguridad. Publicar este modelo en código abierto cambia la industria al proporcionar a los investigadores un objeto público para estudiar, ofrecer a las empresas una opción de despliegue privado e intensificar la competencia entre lo abierto y lo cerrado. Sand.ai, fundada por Cao Yue, coautor de Swin Transformer, continúa su camino poco convencional, y su trabajo ha sido elogiado por Kai-Fu Lee como el 'DeepSeek de la generación de video con IA'.
Fuente: QbitAI 量子位 —
original
