Was Tarot, Viterbi und große Sprachmodelle gemeinsam haben: Wie ein Algorithmus eine von vielen Bedeutungen auswählt
Der Artikel stellt ein Lehrmodell vor, das eine Sequenz von Tarotkarten als Suche nach dem kohärentesten bedeutungsvollen Pfad interpretiert und dabei eine Analogie zu Algorithmen wie Viterbi und Beam Search zieht, die in der Spracherkennung, maschinellen Übersetzung und Sprachmodellen verwendet werden. Das Modell behandelt jede Karte als Funktion, die Kontext und ursprüngliche Bedeutung auf einen Raum von Interpretationen abbildet, und findet dann den besten globalen Pfad. Es kontrastiert gierige Auswahl, Viterbi, Beam Search und andere Methoden und diskutiert Erweiterungen mit Faktorgraphen, bedingten Zufallsfeldern (Conditional Random Fields, CRFs), semantischen Einbettungen und LLM-Reranking.
Der Artikel auf Habr untersucht, wie die Interpretation von Tarotkarten als Auswahl des besten kohärenten Bedeutungspfads aus mehreren Kandidaten modelliert werden kann, analog zu Algorithmen wie Viterbi und Beam Search. Der Autor beginnt mit der Idee, dass eine Karte als Abbildungsfunktion von Kontext und ursprünglicher Bedeutung auf eine Menge möglicher Interpretationen fungiert, argumentiert jedoch, dass die Sucheinheit ein vollständiger semantischer Pfad sein sollte, nicht eine einzelne Interpretation. Ein konkretes Beispiel mit fünf Zuständen (Stagnation, Umdenken, Ressourcen, Handlung, Übergang) und drei Karten (Gehängter, Magier, Streitwagen) zeigt, dass ein gieriger Ansatz im Vergleich zum globalen Optimum des Viterbi-Algorithmus einen suboptimalen Pfad wählt. Das formale Modell ist eine bedingte inhomogene Markov-Kette, bei der die Viterbi-Dekodierung den exakten Maximalpfad in O(n*S^2) Zeit findet. Wenn die Bewertung jedoch von der gesamten Geschichte oder freiem Text abhängt, geht die optimale Substruktur verloren, und Beam Search wird als approximative Methode eingesetzt, wobei auch diversifizierte Beam Search diskutiert wird. Der Artikel vergleicht Viterbi, Beam Search, diversifizierte Beam Search, A*, MCTS und LLM-Reranking und erwähnt Faktorgraphen und lineare Ketten-CRFs als allgemeinere Formulierungen. Außerdem wird darauf hingewiesen, dass reale Bedeutungen möglicherweise nicht in diskrete Zustände passen, weshalb semantische Einbettungsvektoren und LLM-Reranking verwendet werden können, und es werden Richtungen für die Umwandlung der Illustration in Forschung zur KI-gestützten Tarot-Praxis vorgeschlagen.
Quelle: Habr — хаб NLP —
Original
