Kategorien des Inference-Time Scalings zur Verbesserung des LLM-Reasonings
OpenAI
Inference-Time Scaling verbessert die Antwortqualität von Large Language Models (LLMs), indem während der Inferenz mehr Rechenleistung eingesetzt wird. Dieser Artikel kategorisiert die Ansätze und bespricht aktuelle Arbeiten, die zeigen, dass große LLM-Anbieter auf solche Techniken setzen.
Inferenzzeit-Skalierung hat sich zu einer Schlüsselmethode entwickelt, um die Leistung großer Sprachmodelle (LLMs) zu verbessern, indem während der Inferenz zusätzliche Rechenleistung bereitgestellt wird. Der Artikel unterteilt Techniken in Kategorien wie Chain-of-Thought-Prompting, Self-Consistency, Best-of-N-Ranking, Rejection Sampling mit einem Verifizierer, Self-Refinement und Suche über Lösungswege. Er gibt außerdem einen Überblick über neuere Arbeiten und weist darauf hin, dass proprietäre LLMs diese Methoden verwenden. Der Autor hat ein Buchkapitel zu diesem Thema in zwei Teile aufgeteilt, die im Vorabzugang verfügbar sind, und teilt zusätzliche Ideen und Notizen, die nicht in das endgültige Kapitel aufgenommen wurden.
Quelle: Sebastian Raschka —
Original
