Forschung RSS

Anwendungen 🇷🇺

Test-Checkliste für Such- und RAG-Systeme: Sechs Ebenen von Prüfungen

Eine Checkliste zum Testen von Such- und RAG-Systemen (Retrieval-Augmented Generation) wird vorgestellt, die sechs Prüfebenen abdeckt – von der grundlegenden Funktionalität bis zur Handhabung unvollständiger Daten. Metriken, Werkzeuge und ein Glossar mit über 50 Begriffen werden beschrieben. Die Bedeutung der Ebenen-Reihenfolge wird betont: Es bringt nichts, RAG zu evaluieren, wenn die Nullstufe nicht bestanden wurde.

Habr — хаб NLP27.07 · 09:05
Forschung 🇨🇳

Chinesische Akademie der Wissenschaften behebt die schwierigste Schwäche von KI: soziale Intelligenz

Das Team 'ZhiJing' der Chinesischen Akademie der Wissenschaften hat ein vollständiges technisches System für sozialen Verstand in großen Modellen veröffentlicht, darunter den SoMBench-Benchmark, das Zing-Trainingsframework und die Actio-Bereitstellungsarchitektur. SoMBench bewertet soziale Intelligenz in 71 feinkörnigen Aufgaben, während Zing adaptives Training zur Leistungsverbesserung einsetzt und Actio eine explizite Bereitstellung mentaler Zustände ermöglicht. In Tests übertraf Zing-27B GPT-5.5 in sozialen Verstand-Benchmarks.

Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, ChineИнститут вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
QbitAI 量子位27.07 · 09:03
Aktuelle Nachrichten