بناء موسوعة شخصية دون كود كلود: خط أنابيب يعتمد على MapReduce
Anthropic
OpenAI
Ollama
تصف المقالة كيفية بناء موسوعة شخصية باستخدام نماذج ضعيفة مثل gpt-5-mini وgemma4:26b دون كود كلود. بعد استراتيجيتين فاشلتين، نجح نهج يعتمد على MapReduce مع استخراج المصطلحات الأساسية، وتصفية النماذج اللغوية الكبيرة، وتوليد الروابط. يُطلق على هذا الخط اسم Wiki-assembler، وهو مُنفَّذ بلغة بايثون مع وكلاء LangChain بسيطين، وتكلفته أقل من تكلفة كود كلود.
بإلهام من فكرة أندريه كارباثي حول إنشاء الويكيات بواسطة نماذج اللغة الكبيرة، يستكشف المؤلف (مستخدم هابر) بدائل لـ Claude Code لبناء ويكيا شخصية. تم اختبار ثلاث استراتيجيات: الاستخراج التسلسلي مع ذاكرة السياق، والاستخراج الدفعي مع وكيل تكامل منفصل، ونهج MapReduce. فشلت الأولى لأن النماذج الضعيفة فقدت العناصر عندما تجاوز العدد عشرة. وفشلت الثانية بسبب ضعف التكامل الذي دمج عناصر غير مرتبطة. أما الثالثة، MapReduce، فقد نجحت: يتم تعليق كل مصدر واستخراج المصطلحات الرئيسية، ثم يتم عكس المصطلحات لربط كل مصطلح بمصادره. يقوم حكم LLM بتصفية المصطلحات حسب الأهمية؛ وبالنسبة للمصطلحات المهمة، يتم إنشاء عنصر ويكي بملخص وخصائص وروابط لعناصر ذات صلة. تستخدم الخط أنابيب gpt-5-mini من مزود وكيل وgemma4:26b من Ollama المحلي. يميل gpt-5-mini إلى المبالغة في تقدير الأهمية وأحياناً يضيف مصطلحات من تلقاء نفسه، لكن الرابط يكتشف ذلك؛ أما gemma4:26b فهو أكثر صرامة لكنه يواجه صعوبة مع الإخراج المنظم، مما يتطلب تقسيمات في الكود. التكاليف: تبلغ تكلفة Claude Code 3-4 دولارات لكل 100 كيلوبايت من النص المصدر، وgpt-5-mini تبلغ 1.1-1.3 دولار، بينما gemma4:26b لا تكلف سوى الكهرباء لكنها بطيئة (12 رمزًا في الثانية، وتستغرق يوماً كاملاً للأنابيب). التنفيذ، Wiki-assembler، هو خط أنابيب Python مع خمسة أو ستة وكلاء LangChain بسيطين وكتلتين مبرمجتين، مع تجنب ReAct بسبب الاستدلال اللانهائي في Gemma. تشمل خطوات الأنابيب التعليق والتصنيف، وتصفية المصطلحات الرئيسية عبر حكم LLM، وبناء عناصر الويكي، وربطها.
المصدر: Habr — хаб ИИ —
الأصلي
