L'analyse des causes racines en IA passe du raisonnement du modèle à l'ingénierie du contexte
Anthropic
OpenAI
Google/DeepMind
Dynatrace
Coroot
LangChain
Mezmo
Alibaba/Qwen
Les praticiens de l'observabilité constatent de plus en plus que le raisonnement des modèles de langage (LLM) n'est plus le goulot d'étranglement dans l'analyse des causes racines assistée par IA ; le défi réside plutôt dans la décision des données à fournir au modèle. Les recherches de Coroot suggèrent qu'investir dans la préparation du contexte offre de meilleurs rendements que de poursuivre des modèles plus performants. Le secteur évolue vers une analyse causale déterministe, basée sur la topologie, plutôt que vers des boucles d'agents ouvertes.
Un nombre croissant d'ingénieurs en observabilité estiment que la capacité de raisonnement des grands modèles de langage n'est plus le goulot d'étranglement pour l'analyse de cause racine assistée par IA ; le problème le plus pressant est plutôt le pipeline de traitement qui décide quelles données sont transmises au modèle. La plupart des travaux d'ARC assistée par IA se répartissent en deux catégories : les conceptions basées sur des agents qui donnent au modèle des outils pour enquêter de manière autonome, et les conceptions déterministes qui pré-établissent des corrélations entre les signaux et fournissent un contexte pré-emballé. La recherche de Coroot, dirigée par l'ingénieur Nikolay Sivko, divise le processus en deux tâches : le raisonnement sur les données présentées et le « cadre de collecte de données » qui décide quelles données vont au modèle. Le pipeline de Coroot corrèle les signaux en résultats et les transmet au modèle comme un contexte unique et ciblé, évitant les boucles d'agents, permettant ainsi d'attribuer les erreurs au modèle lui-même. Sivko a construit un scénario utilisant Chaos Mesh NetworkChaos pour injecter une latence entre un service d'annuaire et sa base de données Postgres, provoquant des requêtes lentes et des erreurs 502, avec des signaux trompeurs. Il a testé onze modèles avec la même invite (environ 9800 jetons), demandant à chacun de fournir la cause racine, la chaîne causale et le correctif immédiat. Les modèles de pointe Claude Opus 4.8, GPT-5.5 et Gemini 3.1 Pro ont réussi, identifiant l'expérience et la nécessité de la supprimer ainsi que sa tâche cron. Parmi les modèles plus petits, Gemma 4 31B a été le seul modèle auto-hébergé à identifier la cause racine, tandis que les plus grands Qwen3.6 35B et Qwen3 Coder Next ont échoué. Les approches basées sur des agents présentent des avantages, comme la capacité de détecter des signaux inattendus, mais elles souffrent de problèmes de débogabilité en production, comme on le voit dans les cas de ZenML et Incident.io. De nombreux praticiens préfèrent désormais des flux de travail déterministes avec une étape LLM étroite en raison de la fiabilité et des coûts de jetons inférieurs. Sivko note qu'un seul appel court aux modèles de pointe ne coûte que quelques centimes puisque l'analyse de corrélation est effectuée avant l'appel ; il estime que la partie raisonnement est « essentiellement résolue » et que l'accent actuel est mis sur la préparation d'un contexte approprié et compact. Cela s'aligne sur la tendance plus large de l'ingénierie de contexte, comme le soulignent les recommandations d'Anthropic, LangChain et Mezmo sur l'importance d'un ensemble de contexte minimal et à haute signalétique pour le raisonnement et l'observabilité basés sur les LLM.
Source: InfoQ 中国 —
original
