Verwaltung von Reasoning-Levels in großen Sprachmodellen
Der Artikel erklärt, wie Reasoning-Modelle wie DeepSeek-R1 und GPT-5.6 lernen, Reasoning-Traces mittels Reinforcement Learning mit verifizierbaren Belohnungen (RLVR) zu erzeugen. Er beschreibt den Trainingsprozess, Inferenz-Scaling, Denktoken und wie Reasoning-Aufwand-Modi (niedrig/mittel/hoch) durch überwachte Feinabstimmung und Tokenizer-Wechsel implementiert werden.
OpenAI
DeepSeek
Moonshot AI


