AgentenOnderzoek 🇷🇺 05.08.2026 09:02

Tijdperk van Automatisch Onderzoek: Ik Ging Slapen en 40 Hypotheses Werden Overnacht Getest — Wat Moet Ik Doen en Hoe Verder Werken?

Google/DeepMindGoogle/DeepMind OpenAIOpenAI DeepMindDeepMind AnthropicAnthropic
Een ingenieur beschrijft hoe hij het testen van hypotheses automatiseerde met een AI-agent, en die testte 's nachts 40 hypotheses. Hij legt de verschuiving uit van het vinden van oplossingen naar het bouwen van systemen die oplossingen vinden, en bespreekt voorbeelden van sankalp, Karpathy en DeepMind. Ook behandelt hij valkuilen zoals verlies-pariteit en het ontwerp van orakels, en het belang van de keuze van het model.
Een ingenieur beschrijft hoe hij, in plaats van hypothesen handmatig te testen, een tekstuele beschrijving van de pijplijn voor het genereren van hypothesen schreef, Gemini vroeg om elke poging te beoordelen, en een agent een nacht lang liet draaien. 's Ochtends toonde het logboek 40 geteste hypothesen. Hij contrasteert zijn vroege naïeve pogingen (tien agenten parallel laten draaien zonder plan) en zijn tweede poging (agenten een gedetailleerde agenda geven) met de luie avondaanpak die werkte. Hij legt uit dat de sleutel niet betere controle over agenten was, maar wie het resultaat evalueert. Hij citeert precedenten: sankalp's QR-decompositie behaalt een 232x versnelling op gebatchte QR, Karpathy's 630-regelig autoresearch-script draaide 's nachts honderden experimenten, en DeepMind's AlphaEvolve verbeterde oplossingen voor 20% van 50 open wiskundeproblemen en versnelde Google's datacenters, chipontwerp en AI-training. Hij deelt twee persoonlijke gevallen: in het eerste besteedde hij twee weken aan het handmatig ontwerpen van datasetfilters, maar een op Gemini gebaseerde oracle met een visueel-taalmodel versloeg dat in een paar runs; in het tweede behaalde hij een 30% trainingsversnelling maar stuitte op valkuilen: hij vergat een loss-pariteitscontrole op te nemen (wat leidde tot NaN-loss), en een onvoldoende gedetailleerde oracle miste artefacten zoals achtergebleven letters bij het verwijderen van beeld-tekst. Hij benadrukt dat het bouwen van een goede oracle en loop het echte werk is, en dat het model binnen de loop ertoe doet. Hij concludeert dat expertise verschuift van 'een oplossing vinden' naar 'een systeem bouwen dat oplossingen vindt'.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws