MallitAvoin lähdekoodi 🇨🇳 28.07.2026 16:03

Alibaba julkaisi Qwen2.5-VL: uuden lippulaivan multimodaalimallin

Alibaba/QwenAlibaba/Qwen
Alibaba esitteli Qwen2.5-VL:n, uuden sukupolven vision-language-mallin, joka on saatavilla koissa 3B, 7B ja 72B. Malli erottuu parantuneesta visuaalisesta ymmärryksestä, yli tunnin pituisen videon tuesta, kyvystä agenttitoimintoihin ja jäsenneltyyn tulostukseen.
Alibaba Group'n Qwen-tiimi on julkaissut Qwen2.5-VL:n, uuden lippulaivamallin näkö- ja kielitehtäviin. Se on saatavilla kolmessa koossa: 3B, 7B ja 72B, sekä base- että instruct-versioina, Hugging Facessa ja ModelScopessa. Malli pystyy tunnistamaan esineitä, tekstejä ja kaavioita sekä toimimaan visuaalisena agenttina: se voi hallita tietokonetta tai puhelinta. Se ymmärtää yli tunnin mittaisia videoita ja pystyy paikantamaan tapahtumia ajallisesti. Malli tukee esineiden tarkkaa paikannusta bounding boxien ja avainpisteiden avulla sekä strukturoitua JSON-tulostetta asiakirjoille, laskuille ja taulukoille. Lippulaivamalli Qwen2.5-VL-72B-Instruct saavuttaa kilpailukykyisiä tuloksia vertailutesteissä, mukaan lukien yliopistotason tehtävät, matematiikka, dokumenttien ja videoiden ymmärtäminen. Pienemmät versiot (7B) ylittävät GPT-4o-minin useissa tehtävissä, ja reunalaskentaan tarkoitettu 3B-malli ylittää edellisen 7B-mallin. Lisäksi kuvantunnistusta on parannettu: malli kattaa nyt valtavan määrän luokkia, mukaan lukien kasvit, eläimet, maamerkit, elokuvahahmot ja tuotteet. Malli käyttää HTML-muotoa asiakirjojen merkitsemiseen (QwenVL HTML).
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset