AgentenForschung 🇷🇺 05.08.2026 09:02

Zeitalter der Autorecherche: Ich ging schlafen und über Nacht wurden 40 Hypothesen getestet — Was soll ich tun und wie weiterarbeiten?

Google/DeepMindGoogle/DeepMind OpenAIOpenAI DeepMindDeepMind AnthropicAnthropic
Ein Ingenieur beschreibt, wie er das Testen von Hypothesen mit einem KI-Agenten automatisierte, der über Nacht 40 Hypothesen testete. Er erläutert den Wandel vom Finden von Lösungen zum Bauen von Systemen, die Lösungen finden, und diskutiert Beispiele von Sankalp, Karpathy und DeepMind. Außerdem behandelt er Fallstricke wie Verlustparität und Orakeldesign sowie die Bedeutung der Modellwahl.
Ein Ingenieur beschreibt, wie er anstatt Hypothesen manuell zu testen, eine textuelle Beschreibung der Pipeline zur Hypothesengenerierung schrieb, Gemini bat, jeden Versuch zu bewerten, und einen Agenten über Nacht laufen ließ. Am Morgen zeigte das Protokoll 40 getestete Hypothesen. Er stellt seine frühen naiven Versuche (zehn Agenten parallel ohne Plan laufen zu lassen) und seinen zweiten Versuch (den Agenten eine detaillierte Agenda zu geben) dem faulen Abendansatz gegenüber, der funktionierte. Er erklärt, dass der Schlüssel nicht in besserer Kontrolle der Agenten lag, sondern darin, wer das Ergebnis bewertet. Er führt Präzedenzfälle an: sankalps QR-Zerlegung erreicht eine 232-fache Beschleunigung bei gestapelter QR-Zerlegung, Karpathys 630-Zeilen-Autoresearch-Skript führte Hunderte von Experimenten über Nacht durch, und DeepMinds AlphaEvolve verbesserte Lösungen für 20 % von 50 offenen Mathematikproblemen und beschleunigte Googles Rechenzentren, Chipdesign und KI-Training. Er teilt zwei persönliche Fälle: Im ersten verbrachte er zwei Wochen damit, Datenbankfilter von Hand zu erstellen, aber ein auf Gemini basierendes Orakel mit einem VLM schlug das in ein paar Durchläufen. Im zweiten erzielte er eine 30-prozentige Trainingsbeschleunigung, stieß aber auf Fallstricke: Er vergaß, einen Verlust-Paritätscheck einzubauen (was zu NaN-Verlust führte), und ein unzureichend detailliertes Orakel übersah Artefakte wie übrig gebliebene Buchstaben bei der Bild-Text-Entfernung. Er betont, dass der Aufbau eines guten Orakels und einer guten Schleife die eigentliche Arbeit ist und dass das Modell in der Schleife wichtig ist. Er schließt, dass sich Fachwissen von „eine Lösung finden“ zu „ein System bauen, das Lösungen findet“ verschiebt.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten