Recherche 🇷🇺 12.08.2026 13:04

Construire un wiki personnel sans Claude Code : un pipeline basé sur MapReduce

AnthropicAnthropic OpenAIOpenAI OllamaOllama
L'article décrit comment construire un wiki personnel en utilisant des modèles faibles comme gpt-5-mini et gemma4:26b sans Claude Code. Après deux stratégies infructueuses, une approche basée sur MapReduce avec extraction de termes clés, filtrage par LLM et génération de liens a réussi. Le pipeline, appelé Wiki-assembler, est implémenté en Python avec de simples agents LangChain et coûte moins cher que Claude Code.
Inspiré par l'idée d'Andrej Karpathy sur les wikis générés par LLM, l'auteur (un utilisateur de Habr) explore des alternatives à Claude Code pour construire un wiki personnel. Trois stratégies ont été testées : l'extraction séquentielle avec mémoire contextuelle, l'extraction par lots avec un agent d'intégration séparé, et une approche MapReduce. La première a échoué car les modèles faibles perdaient des éléments lorsque le nombre dépassait dix. La deuxième a échoué en raison d'une mauvaise intégration qui fusionnait des éléments non liés. La troisième, MapReduce, a réussi : chaque source est annotée et les termes clés sont extraits, puis les termes sont inversés pour mapper chaque terme à ses sources. Un juge LLM filtre les termes selon leur importance ; pour les termes importants, un élément de wiki est créé avec un résumé, des propriétés et des liens vers des éléments connexes. Le pipeline utilise gpt-5-mini d'un fournisseur proxy et gemma4:26b d'Ollama local. gpt-5-mini a tendance à surestimer l'importance et ajoute parfois des termes de son propre chef, mais un lieur attrape cela ; gemma4:26b est plus strict mais a du mal avec la sortie structurée, nécessitant des divisions dans le code. Coûts : Claude Code coûte 3 à 4 dollars par 100 Ko de texte source, gpt-5-mini coûte 1,1 à 1,3 dollar, tandis que gemma4:26b ne coûte que l'électricité mais est lent (12 tokens par seconde, prenant une journée entière pour le pipeline). L'implémentation, Wiki-assembler, est un pipeline Python avec cinq ou six agents LangChain simples et deux blocs codés en dur, évitant ReAct en raison du raisonnement infini de Gemma. Les étapes du pipeline comprennent l'annotation et la catégorisation, le filtrage des termes clés via un juge LLM, la construction des éléments de wiki et leur liaison.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches