AnwendungenModelle 🇷🇺 29.07.2026 12:04

Wie wir 15.000 Tabellen in sechs Monaten statt 500 in einem Jahr beschrieben haben – und aufgehört haben, Dokumentation von Hand zu schreiben

ЯндексЯндекс
Yandex automatisierte die Tabellendokumentation mit einem LLM-gestützten Roboter, der Metadaten aus verschiedenen Quellen sammelt und Entwurfsbeschreibungen generiert. In sechs Monaten wurden 15.000 Tabellen beschrieben, statt 500 pro Jahr mit manueller Arbeit, was etwa fünf Jahre Analystenzeit einspart.
Yandex stand vor einer massiven Herausforderung bei der Datenbeschreibung: Von 40.000 gefilterten Tabellen erhielten in einem Jahr nur 500 manuelle Beschreibungen. Roman Gridnev, ein technischer Manager, entwickelte einen Python-Roboter, der große Sprachmodelle (Large Language Models, LLMs) und interne Datenquellen (Datenpfade, Schemata, Beispieldaten, Wiki-Glossare, Graph-Nachbarn aus Memgraph, Ordner-Nachbarn) nutzt, um Entwurfsbeschreibungen zu generieren. Der Roboter sammelt zunächst objektive Daten und sendet sie dann an ein LLM, um einen Titel und eine Beschreibung zu erstellen, sodass keine leere Seite entsteht. Die Beschreibungen werden in den Datenkatalog geladen, wo Menschen sie überprüfen können. Innerhalb von sechs Monaten wurden 15.000 Tabellen beschrieben, was etwa fünf Jahren Analystenzeit entspricht. Die Qualität wurde durch Umfragen und semantischen Vergleich gemessen (92 % semantische Übereinstimmung, 71 % der Felder unverändert akzeptiert). Zukünftige Pläne umfassen die Anbindung an regelmäßige Datenlieferungen und die Ausweitung der Beschreibung auf einzelne Spalten.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten