Alibaba Qwen julkaisee QVQ-Max: visuaalinen päättelymalli todisteineen
Alibaba/Qwen
Alibaba Qwen on julkaissut virallisesti QVQ-Maxin, ensimmäisen versionsa visuaalisesta päättelymallista. Malli pystyy paitsi tunnistamaan kuvia ja videoita, myös analysoimaan niitä, tekemään päättelyä ja tarjoamaan ratkaisuja. MathVision-vertailussa QVQ-Max osoittaa johdonmukaista tarkkuuden paranemista ajatteluprosessin pituuden kasvaessa.
Alibaban Qwen on esitellyt QVQ-Maxin, ensimmäisen versionsa visuaalisesta päättelymallista. Malli pystyy analysoimaan ja päättämään kuvien ja videoiden perusteella ratkaisten tehtäviä matemaattisista ongelmista arkipäivän haasteisiin. MathVision-vertailussa, joka sisältää monipuolisia multimodaalisia matematiikkatehtäviä, QVQ-Max osoittaa parantuvaa tarkkuutta ajatusketjun maksimipituuden kasvaessa. Mallin keskeisiä kyvykkyyksiä ovat yksityiskohtainen havainnointi, syvällinen päättely ja joustava soveltaminen. Käyttötapauksiin kuuluvat apu työssä, oppimisessa ja jokapäiväisessä elämässä. Tulevaisuuden suunnitelmia ovat tunnistustarkkuuden parantaminen, monivaiheisten tehtävien suorittaminen ja vuorovaikutus muiden modaliteettien kanssa.
Lähde: Alibaba Qwen —
Alkuperäinen
