Qwen2-VL: Alibaba julkaisee uuden sukupolven näkö-kielimalleja SoTA-suorituskyvyllä
Alibaba/Qwen
Alibaba esitteli Qwen2-VL:n, uuden sukupolven vision-language-malleja, jotka ylittävät edeltäjänsä selvästi kuvien, videoiden ja multimodaalisten agenttiominaisuuksien ymmärtämisessä. 2B- ja 7B-mallit on avoimesti lisensoitu Apache 2.0 -lisenssillä, ja 72B on saatavilla API:n kautta. Qwen2-VL-72B osoittaa suorituskykyä, joka ylittää GPT-4o:n ja Claude 3.5 Sonnetin monilla vertailuarvoilla, erityisesti asiakirjojen ymmärtämisessä.
Alibaba on julkaissut Qwen2-VL:n, uuden sukupolven vision-language-mallit, jotka perustuvat Qwen2:een. 2B- ja 7B-mallit on avoimesti saatavilla Apache 2.0 -lisenssillä, kun taas 72B-malli on käytettävissä API:n kautta. Qwen2-VL saavuttaa huippuluokan tulokset MathVista-, DocVQA-, RealWorldQA- ja MTVQA-vertailuarvoissa. Malli pystyy ymmärtämään yli 20 minuutin pituisia videoita ja integroitumaan laitteisiin automaattisia toimintoja varten. Se tukee monikielisyyttä, mukaan lukien eurooppalaiset kielet, japani, korea, arabia ja vietnam. Qwen2-VL käyttää Vision Transformeria, jossa on 600 miljoonaa parametria, ja se tukee dynaamista resoluutiota. Mukana on multimodaalinen paikkaupotus M-ROPE, joka mahdollistaa teksti-, visuaali- ja videotiedon samanaikaisen käsittelyn. Malli osoittaa erinomaisuutta asiakirjojen ymmärtämisessä ja tehtävien ratkaisemisessa ylittäen GPT-4o:n ja Claude 3.5-Sonnetin. Mallin rajoituksia ovat äänen puuttuminen videoista, tietämys päättyen kesäkuuhun 2023 sekä vaikeudet laskemisessa ja merkkien tunnistamisessa.
Lähde: Alibaba Qwen —
Alkuperäinen
