MallitLiiketoiminta ja markkinat 🇨🇳 28.07.2026 01:05

Qwen2.5-Max: Suuren MoE-mallin kyvykkyyksiä tutkimassa

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen julkaisi Qwen2.5-Maxin, suuren kielimallin, joka perustuu Mixture-of-Experts-arkkitehtuuriin ja on koulutettu yli 20 biljoonalla tokenilla. Malli suoriutuu DeepSeek V3:ta paremmin useilla vertailuarvoilla ja on saatavilla Alibaba Cloud -rajapintojen ja Qwen Chatin kautta.
Qwen-tiimi on julkaissut Qwen2.5-Maxin, suuren kielimallin, joka perustuu Mixture-of-Experts (MoE) -arkkitehtuuriin ja on esikoulutettu yli 20 biljoonalla tokenilla. Esikoulutuksen jälkeen sovellettiin ohjattua hienosäätöä (Supervised Fine-Tuning, SFT) ja ihmispalautteeseen perustuvaa vahvistusoppimista (Reinforcement Learning from Human Feedback, RLHF). Mallia verrattiin DeepSeek V3:een, GPT-4o:hon ja Claude-3.5-Sonnetiin MMLU-Pro-, LiveCodeBench-, LiveBench-, Arena-Hard- ja GPQA-Diamond-vertailuissa. Qwen2.5-Max suoriutui DeepSeek V3:ta paremmin Arena-Hardissa, LiveBenchissa, LiveCodeBenchissa ja GPQA-Diamondissa, kun taas MMLU-Prossa tulokset olivat kilpailukykyisiä. Pohjamalleja verrattiin DeepSeek V3:een, Llama-3.1-405B:hen ja Qwen2.5-72B:hen – Qwen2.5-Max osoitti merkittäviä etuja useimmissa testeissä. Malli on saatavilla Qwen Chatissa ja Alibaba Cloud API:n kautta (mallinimi: qwen-max-2025-01-25). API on yhteensopiva OpenAI API:n kanssa.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset