Ant Bailing lanza el nuevo modelo híbrido de razonamiento Ling-3.0-Flash
Ant Bailing (una empresa china) ha presentado un nuevo modelo, Ling-3.0-Flash, con 124 mil millones de parámetros totales y 5.1 mil millones de parámetros activos. El modelo ya está disponible en OpenRouter, gratuito durante una semana, y luego se publicará como código abierto. Alcanza resultados comparables a modelos dos o tres veces más grandes, gracias a una nueva arquitectura de atención híbrida.
El 24 de julio, Ant Bailing (蚂蚁百灵) lanzó oficialmente una nueva generación de modelo híbrido nativo de razonamiento, Ling-3.0-Flash. El modelo cuenta con un total de 124 mil millones de parámetros, de los cuales se activan 5.1 mil millones en cada cálculo. Con una reducción significativa en el volumen y los costos computacionales, el modelo iguala o supera a los modelos líderes de la industria con 2-3 veces más parámetros en indicadores clave como razonamiento básico, seguimiento de instrucciones y procesamiento de textos largos, demostrando una mayor "relación inteligencia-eficiencia" y practicidad. Se informa que el modelo ya está disponible en OpenRouter, de forma gratuita durante una semana, y luego se abrirá por completo. La versión se ha centrado especialmente en un refinamiento profundo para escenarios de aplicación de agentes. El modelo ha ampliado el entorno de entrenamiento con más de 10,000 interacciones reales y ha optimizado los mecanismos de autocorrección y planificación a largo plazo para tareas complejas. En escenarios como escritura de código, descomposición de tareas complejas y análisis profundo de información de múltiples fuentes, el modelo muestra una capacidad mejorada para completar tareas de forma autónoma, resolviendo el problema de "desviación" o interrupción que presentan los modelos tradicionales en tareas grandes. La clave para "bajo volumen y alta inteligencia" radica en el rediseño de la arquitectura computacional básica. Ling-3.0-Flash abandonó la simple acumulación de parámetros y, en la etapa de preentrenamiento, utilizó una arquitectura de atención híbrida, alternando atención lineal KDA y MLA en una proporción de 5:1. Además, el modelo actualizó la atención Lightning de la generación anterior a KDA (Kimi Delta Attention), introduciendo un control diagonal de grano fino en la actualización del estado de la regla Delta, lo que permite recordar con mayor precisión información clave al procesar documentos largos y bases de código. Al mismo tiempo, el modelo comprimió aún más la proporción de activación de expertos por token de 1/32 a 1/64, logrando un mayor "apalancamiento de eficiencia". Para que los agentes de IA funcionen de manera más rápida y estable, Ant Bailing también proporcionó una arquitectura de ingeniería y colaboración correspondiente. En cuanto a la velocidad de respuesta, mediante la introducción de un almacenamiento en caché jerárquico de clúster, se evitaron cálculos repetidos en diálogos largos e interacciones de múltiples rondas, reduciendo la latencia del primer token en entradas largas en un 60-80%. En cuanto a la estabilidad de las tareas, la arquitectura de interacción multiagente actualizada permite que diferentes agentes trabajen juntos y se verifiquen entre sí, reduciendo efectivamente el riesgo de errores de un solo modelo.
Fuente: QbitAI 量子位 —
original
