Modellen RSS

Modellen 🇨🇳

Binnenlandse open-source wereldklasse model: Wat is de kracht van Kimi K3?

Moonshot AI (月之暗面) heeft zijn nieuwe open-source grote taalmodel, Kimi K3, uitgebracht. Het model behaalt indrukwekkende resultaten op internationale benchmarks: het staat eerste op LiveCodeBench (programmeertaken), waarmee het GPT-4o en Claude 3.5 Sonnet overtreft, en laat ook hoge scores zien op AIME 2025 (wiskunde) en MMLU-Pro (algemene kennis).

Moonshot AIMoonshot AI
Moonshot Kimi (GNews)24.07 · 15:04
Onderzoek 🇷🇺

RUMBA: Een nieuwe benchmark voor het evalueren van langetermijngeheugen van dialoogsystemen in het Russisch

RUMBA (Russian User Memory Benchmark), de eerste Russischtalige benchmark voor het evalueren van langetermijngeheugen in multi-sessiedialogen, is geïntroduceerd. Het omvat 85 dialogen en 1.543 vragen die informatieopvraging, redeneren en het vermogen om antwoorden te weigeren testen. De benchmark houdt rekening met temporele context en maakt diagnose van knelpunten in de geheugenarchitectuur mogelijk.

СбербанкСбербанк
Habr — хаб ИИ24.07 · 15:02
Vers nieuws