Forschung RSS

Forschung 🇺🇸

RL ohne TD-Lernen: Neuer Divide-and-Conquer-Algorithmus

Forscher schlagen Transitives RL (TRL) vor, einen neuen Divide-and-Conquer-Verstärkungslernalgorithmus, der das zeitliche Differenzlernen vermeidet. TRL skaliert auf langfristige Aufgaben, indem es Trajektorien rekursiv aufteilt, und erzielt hochmoderne Ergebnisse auf anspruchsvollen Benchmarks, ohne den Schrittparameter n abstimmen zu müssen.

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
BAIR (Berkeley AI)27.07 · 17:04
Forschung 🇺🇸

Jenseits der Standard-LLMs: Lineare Attention-Hybride, Textdiffusion, Code-World-Modelle und kleine rekursive Transformer

Der Artikel von Sebastian Raschka untersucht Alternativen zu standardmäßigen autoregressiven Transformer-LLMs, darunter lineare Attention-Hybride (z.B. MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-World-Modelle und kleine rekursive Transformer. Er diskutiert die Wiederbelebung linearer Attention-Mechanismen und Herausforderungen, wie etwa dass MiniMax in seinem M2-Modell aufgrund schwacher Leistung bei Denkaufgaben zur Standard-Attention zurückkehrte.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face
Sebastian Raschka27.07 · 17:04
Aktuelle Nachrichten