ModellenOpen Source 🇨🇳 28.07.2026 16:03

Alibaba heeft Qwen2.5-VL uitgebracht: nieuwe vlaggenschip multimodale model

Alibaba/QwenAlibaba/Qwen
Alibaba heeft Qwen2.5-VL gepresenteerd, een nieuwe generatie vision-language model beschikbaar in de formaten 3B, 7B en 72B. Het model onderscheidt zich door verbeterd visueel begrip, ondersteuning voor video van meer dan een uur, vermogen tot agent-acties en gestructureerde output.
Het team Qwen van Alibaba heeft Qwen2.5-VL uitgebracht, een nieuw vlaggenschipmodel voor visie en taal. Het is beschikbaar in drie formaten: 3B, 7B en 72B, zowel als base- als instruct-versie, op Hugging Face en ModelScope. Het model kan objecten, teksten en diagrammen herkennen en ook functioneren als een visuele agent: het kan een computer of telefoon bedienen. Het begrijpt video's van meer dan een uur lang en kan gebeurtenissen in de tijd lokaliseren. Het model ondersteunt nauwkeurige lokalisatie van objecten met behulp van bounding boxes en sleutelpunten, evenals gestructureerde uitvoer in JSON voor documenten, facturen en tabellen. Het vlaggenschip Qwen2.5-VL-72B-Instruct laat concurrerende resultaten zien op benchmarks, waaronder taken op universitair niveau, wiskunde, document- en videobegrip. Kleinere versies (7B) overtreffen GPT-4o-mini in een aantal taken, en de 3B-versie, bedoeld voor edge AI, overtreft het vorige 7B-model. Ook de beeldherkenning is verbeterd: het model dekt nu een enorm aantal categorieën, waaronder planten, dieren, bezienswaardigheden, filmpersonages en producten. Het model gebruikt HTML-formaat voor documentopmaak (QwenVL HTML).
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws