Modèles RSS

Modèles 🇨🇳

Modèle open-source domestique de classe mondiale : quelle est la force de Kimi K3 ?

Moonshot AI (月之暗面) a publié son nouveau grand modèle de langage open-source, Kimi K3. Le modèle obtient des résultats impressionnants sur les benchmarks internationaux : il se classe premier sur LiveCodeBench (tâches de programmation), surpassant GPT-4o et Claude 3.5 Sonnet, et affiche également des scores élevés sur AIME 2025 (mathématiques) et MMLU-Pro (connaissances générales).

Moonshot AIMoonshot AI
Moonshot Kimi (GNews)24.07 · 15:04
Recherche 🇷🇺

RUMBA : un nouveau benchmark pour évaluer la mémoire à long terme des systèmes de dialogue en russe

RUMBA (Russian User Memory Benchmark), le premier benchmark en langue russe pour évaluer la mémoire à long terme dans les dialogues multi-sessions, a été introduit. Il comprend 85 dialogues et 1 543 questions testant la récupération d'informations, le raisonnement et la capacité à s'abstenir de répondre. Le benchmark prend en compte le contexte temporel et permet de diagnostiquer les goulots d'étranglement dans l'architecture mémoire.

СбербанкСбербанк
Habr — хаб ИИ24.07 · 15:02
Infos fraîches