Ant Bailing Lança Novo Modelo de Raciocínio Híbrido Ling-3.0-Flash
A Ant Bailing lançou oficialmente seu novo modelo de raciocínio nativo híbrido, Ling-3.0-Flash, com 124B parâmetros totais e apenas 5,1B ativados por computação. Ele iguala ou supera modelos de 2 a 3 vezes seu tamanho em tarefas de raciocínio, seguimento de instruções e contexto longo, oferecendo maior eficiência. O modelo está disponível no OpenRouter por uma semana gratuita limitada antes de ser aberto.
Em 24 de julho, a Ant Bailing lançou o modelo Ling-3.0-Flash, com 124B parâmetros totais e 5,1B ativados por etapa, alcançando desempenho comparável a modelos 2 a 3 vezes maiores, ao mesmo tempo que reduz os custos computacionais. Ele é projetado para aplicações de agente com mais de 10.000 ambientes de interação reais e melhorias no autocorreção e planejamento de longo prazo. O modelo utiliza uma arquitetura de atenção híbrida com uma proporção de 5:1 entre atenção linear KDA e camadas MLA, e atualiza a Lightning Attention para KDA para melhor rastreamento de estado. A ativação de especialistas por token é reduzida de 1/32 para 1/64, aumentando a eficiência. As melhorias de engenharia incluem cache em nível de cluster para reduzir a latência do primeiro token em 60-80% e um framework de colaboração multiagente para estabilidade.
Fonte: QbitAI 量子位 —
original
