Forschung RSS

Forschung 🇷🇺

QuantCode-Bench: ein neuer Benchmark zur Bewertung der Fähigkeit von LLMs, ausführbare algorithmische Handelsstrategien zu generieren

Forscher haben QuantCode-Bench entwickelt, einen Benchmark, der bewertet, wie gut große Sprachmodelle (Large Language Models, LLMs) aus textuellen Spezifikationen ausführbare algorithmische Handelsstrategien generieren können. Der Benchmark bewertet nicht nur die Code-Korrektheit, sondern auch die semantische Übereinstimmung mit der ursprünglichen Handelsidee in vier Phasen: Kompilierung, Backtesting, Handelsgenerierung und Prüfverifikation.

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Habr — хаб NLP27.07 · 03:03
Forschung 🇺🇸

Real World VoiceEQ vorgestellt: Ein neuer Maßstab zur Bewertung der Sprach-KI-Qualität

Hume AI führt Real World VoiceEQ ein, einen Benchmark zur Bewertung menschenähnlicher Sprachinteraktion. Basierend auf über einer Million menschlicher Bewertungen umfasst er über 40 Modelle in mehr als 60 Metriken, darunter ASR (automatische Spracherkennung), TTS (Text-to-Speech), S2S (Speech-to-Speech) und Sprachverständnis. Der Benchmark zeigte, dass kein einzelnes Modell in allen Kategorien herausragt, und hob Schwächen aktueller Systeme bei der Emotions- und Kontexterkennung hervor.

Hume AIHume AI
Hugging Face blog27.07 · 02:04
Aktuelle Nachrichten