MallitTutkimus 🇨🇳 28.07.2026 00:03

Alibaba Qwen julkaisee QVQ-Max-mallin: visuaalinen päättelymalli todisteineen

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen on julkaissut virallisesti QVQ-Max-mallin, ensimmäisen version visuaalisesta päättelymallistaan. Se pystyy tunnistamaan kuvien ja videoiden lisäksi myös analysoimaan niitä ratkaisten tehtäviä matematiikasta luovuuteen. Kehittäjät totesivat, että mallin tarkkuus MathVision-vertailutestissä kasvaa päättelyprosessin pituuden myötä.
Alibaba Qwen on julkaissut QVQ-Maxin, ensimmäisen version visuaalisen ajattelun mallista, joka on astunut joulukuussa julkaistun varhaisemman QVQ-72B-Preview-mallin ulkopuolelle. Malli ymmärtää kuvien ja videoiden sisällön, analysoi ja päättää niiden perusteella auttaen ratkaisemaan ongelmia matematiikasta arkipäivän kysymyksiin ja luovuuteen. MathVision-vertailuarvossa, joka kokoaa yhteen monimutkaisia multimodaalisia matemaattisia tehtäviä, mallin tarkkuus paranee ajatusprosessin maksimipituuden kasvaessa. QVQ-Maxilla on kolme keskeistä kyvykkyyttä: yksityiskohtainen havainnointi (objektien, tekstin ja pienten yksityiskohtien tunnistaminen), syvällinen päättely (päätelmät visuaalisen tiedon ja taustatietojen perusteella) ja joustava soveltaminen (ongelmanratkaisusta kuvitusten ja skenaarioiden luomiseen). Esittelyesimerkkeihin kuuluu apua työssä (datan analysointi, koodin kirjoittaminen), oppimisessa (kaavioihin liittyvät tehtävät) ja arjessa (vaatetus- ja reseptisuositukset). Tuleviin suunnitelmiin kuuluu tunnistustarkkuuden parantaminen varmistusmekanismien avulla, visuaalisen agentin kehittäminen monivaiheisiin tehtäviin (älypuhelimen tai tietokoneen ohjaus) ja vuorovaikutuksen parantaminen lisäämällä työkaluja ja visuaalista generointia.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset