Modelle RSS

Modelle 🇨🇳

Einheimisches Open-Source-Weltklasse-Modell: Wie stark ist Kimi K3?

Moonshot AI (月之暗面) hat sein neues Open-Source-Großsprachmodell Kimi K3 veröffentlicht. Das Modell erzielt beeindruckende Ergebnisse auf internationalen Benchmarks: Es belegt den ersten Platz auf LiveCodeBench (Programmieraufgaben), schlägt GPT-4o und Claude 3.5 Sonnet und zeigt auch hohe Punktzahlen auf AIME 2025 (Mathematik) und MMLU-Pro (Allgemeinwissen).

Moonshot AIMoonshot AI
Moonshot Kimi (GNews)24.07 · 15:04
Forschung 🇷🇺

RUMBA: Ein neuer Benchmark zur Bewertung des Langzeitgedächtnisses von Dialogsystemen auf Russisch

RUMBA (Russian User Memory Benchmark), der erste russischsprachige Benchmark zur Bewertung des Langzeitgedächtnisses in multisession-Dialogen, wurde vorgestellt. Er umfasst 85 Dialoge und 1.543 Fragen, die Informationsabruf, logisches Denken und die Fähigkeit, Antworten zu verweigern, testen. Der Benchmark berücksichtigt den zeitlichen Kontext und ermöglicht die Diagnose von Engpässen in der Gedächtnisarchitektur.

СбербанкСбербанк
Habr — хаб ИИ24.07 · 15:02
Aktuelle Nachrichten