모델에이전트 🇨🇳 27.07.2026 06:02

Ant Bailing, 새로운 하이브리드 추론 모델 Ling-3.0-Flash 출시

Ant Bailing이 새로운 네이티브 하이브리드 추론 모델인 Ling-3.0-Flash를 공식 출시했습니다. 이 모델은 총 124B 파라미터를 보유하고 있으며, 연산당 활성화되는 파라미터는 5.1B에 불과합니다. 추론, 명령 수행, 긴 컨텍스트 작업에서 자체 크기의 2~3배에 달하는 모델과 일치하거나 능가하는 성능을 보이며 더 높은 효율성을 제공합니다. 이 모델은 오픈소스화되기 전에 OpenRouter에서 제한된 무료 주간으로 제공됩니다.
7월 24일, Ant Bailing은 총 파라미터 124B, 단계당 활성화 파라미터 5.1B의 Ling-3.0-Flash 모델을 출시했습니다. 이 모델은 2~3배 더 큰 모델과 유사한 성능을 달성하면서도 계산 비용을 절감합니다. 에이전트 애플리케이션을 위해 설계되었으며, 10,000개 이상의 실제 상호작용 환경을 갖추고 있으며, 자기 교정 및 장기 계획 능력이 개선되었습니다. 이 모델은 KDA 선형 어텐션과 MLA 레이어를 5:1 비율로 적용한 하이브리드 어텐션 구조를 사용하며, Lightning Attention을 KDA로 업그레이드하여 상태 추적을 개선했습니다. 토큰당 전문가 활성화 비율이 1/32에서 1/64로 줄어 효율성이 높아졌습니다. 엔지니어링 개선 사항으로는 클러스터 수준 캐싱을 통해 최초 토큰 지연 시간을 60~80% 단축하고, 안정성을 위한 다중 에이전트 협업 프레임워크가 포함됩니다.
출처: QbitAI 量子位 — 원문
관련 게시물 ↓
새로운 뉴스