Modelos RSS

Modelos 🇨🇳

Modelo mundial de código abierto doméstico: ¿Cuál es la fortaleza de Kimi K3?

Moonshot AI (月之暗面) ha lanzado su nuevo modelo de lenguaje grande de código abierto, Kimi K3. El modelo logra resultados impresionantes en puntos de referencia internacionales: ocupa el primer lugar en LiveCodeBench (tareas de programación), superando a GPT-4o y Claude 3.5 Sonnet, y también demuestra puntuaciones altas en AIME 2025 (matemáticas) y MMLU-Pro (conocimiento general).

Moonshot AIMoonshot AI
Moonshot Kimi (GNews)24.07 · 15:04
Investigación 🇷🇺

RUMBA: Un Nuevo Benchmark para Evaluar la Memoria a Largo Plazo de Sistemas de Diálogo en Ruso

Se ha presentado RUMBA (Russian User Memory Benchmark), el primer benchmark en lengua rusa para evaluar la memoria a largo plazo en diálogos de múltiples sesiones. Incluye 85 diálogos y 1,543 preguntas que evalúan recuperación de información, razonamiento y la capacidad de abstenerse de responder. El benchmark considera el contexto temporal y permite diagnosticar cuellos de botella en la arquitectura de la memoria.

СбербанкСбербанк
Habr — хаб ИИ24.07 · 15:02
Noticias frescas