Modelos RSS

Modelos 🇨🇳

Modelo de código aberto doméstico de classe mundial: qual é a força do Kimi K3?

A Moonshot AI (月之暗面) lançou seu novo modelo de linguagem grande de código aberto, o Kimi K3. O modelo alcança resultados impressionantes em benchmarks internacionais: ocupa o primeiro lugar no LiveCodeBench (tarefas de programação), superando GPT-4o e Claude 3.5 Sonnet, e também demonstra altas pontuações no AIME 2025 (matemática) e MMLU-Pro (conhecimento geral).

Moonshot AIMoonshot AI
Moonshot Kimi (GNews)24.07 · 15:04
Pesquisa 🇷🇺

RUMBA: Um Novo Benchmark para Avaliar a Memória de Longo Prazo de Sistemas de Diálogo em Russo

RUMBA (Russian User Memory Benchmark), o primeiro benchmark em língua russa para avaliar a memória de longo prazo em diálogos de múltiplas sessões, foi introduzido. Ele inclui 85 diálogos e 1.543 questões que testam recuperação de informação, raciocínio e a capacidade de se abster de responder. O benchmark leva em conta o contexto temporal e permite diagnosticar gargalos na arquitetura de memória.

СбербанкСбербанк
Habr — хаб ИИ24.07 · 15:02
Notícias frescas