Aufbau eines persönlichen Wikis ohne Claude Code: Eine MapReduce-basierte Pipeline
Anthropic
OpenAI
Ollama
Der Artikel beschreibt, wie man ein persönliches Wiki mit schwachen Modellen wie gpt-5-mini und gemma4:26b ohne Claude Code aufbaut. Nach zwei fehlgeschlagenen Strategien gelang ein MapReduce-basierter Ansatz mit Extraktion von Schlüsselbegriffen, LLM-Filterung und Linkgenerierung. Die Pipeline namens Wiki-assembler ist in Python mit einfachen LangChain-Agenten implementiert und kostet weniger als Claude Code.
Inspiriert von Andrej Karpathys Idee von LLM-generierten Wikis untersucht der Autor (ein Habr-Nutzer) Alternativen zu Claude Code für den Aufbau eines persönlichen Wikis. Drei Strategien wurden getestet: sequentielle Extraktion mit Kontextspeicher, Batch-Extraktion mit einem separaten Integrationsagenten und ein MapReduce-Ansatz. Die erste scheiterte, weil schwache Modelle Elemente verloren, wenn die Anzahl zehn überschritt. Die zweite scheiterte aufgrund schlechter Integration, die nicht zusammengehörige Elemente verschmolz. Die dritte, MapReduce, war erfolgreich: Jede Quelle wird annotiert und Schlüsselbegriffe extrahiert, dann werden die Begriffe invertiert, um jeden Begriff seinen Quellen zuzuordnen. Ein LLM-Richter filtert Begriffe nach Wichtigkeit; für wichtige Begriffe wird ein Wiki-Element mit Zusammenfassung, Eigenschaften und Links zu verwandten Elementen erstellt. Die Pipeline verwendet gpt-5-mini von einem Proxy-Anbieter und gemma4:26b von lokalem Ollama. gpt-5-mini neigt dazu, die Bedeutung zu überschätzen und fügt manchmal eigene Begriffe hinzu, aber ein Linker fängt dies ab; gemma4:26b ist strenger, hat aber Schwierigkeiten mit strukturierter Ausgabe, was Aufteilungen im Code erfordert. Kosten: Claude Code kostet 3-4 Dollar pro 100 KB Quelltext, gpt-5-mini kostet 1,1-1,3 Dollar, während gemma4:26b nur Strom kostet, aber langsam ist (12 Tokens pro Sekunde, was einen ganzen Tag für die Pipeline dauert). Die Implementierung, Wiki-assembler, ist eine Python-Pipeline mit fünf oder sechs einfachen LangChain-Agenten und zwei hartcodierten Blöcken, die ReAct vermeidet, da Gemma endlose Gedankengänge produziert. Die Pipeline-Schritte umfassen Annotation und Kategorisierung, Filterung von Schlüsselbegriffen durch einen LLM-Richter, Erstellung von Wiki-Elementen und deren Verknüpfung.
Quelle: Habr — хаб ИИ —
Original
