Ant Bailing lanza su nuevo modelo híbrido de razonamiento Ling-3.0-Flash
Ant Bailing ha lanzado oficialmente su nuevo modelo nativo de razonamiento híbrido, Ling-3.0-Flash, que cuenta con 124 mil millones de parámetros totales, de los cuales solo se activan 5.1 mil millones por cómputo. Iguala o supera a modelos de dos a tres veces su tamaño en tareas de razonamiento, seguimiento de instrucciones y contexto largo, ofreciendo mayor eficiencia. El modelo está disponible en OpenRouter por una semana gratuita limitada antes de ser de código abierto.
El 24 de julio, Ant Bailing lanzó el modelo Ling-3.0-Flash con 124B parámetros totales y 5.1B activados por paso, logrando un rendimiento comparable al de modelos de 2 a 3 veces más grandes, a la vez que reduce los costos computacionales. Está diseñado para aplicaciones de agente con más de 10,000 entornos de interacción real y capacidades mejoradas de autocorrección y planificación a largo plazo. El modelo utiliza una arquitectura de atención híbrida con una proporción de 5:1 de atención lineal KDA y capas MLA, y actualiza Lightning Attention a KDA para un mejor seguimiento del estado. La activación de expertos por token se reduce de 1/32 a 1/64, aumentando la eficiencia. Las mejoras de ingeniería incluyen almacenamiento en caché a nivel de clúster para reducir la latencia del primer token en un 60-80% y un marco de colaboración multiagente para la estabilidad.
Fuente: QbitAI 量子位 —
original
