Era de la autoinvestigación: Me fui a dormir y se probaron 40 hipótesis durante la noche — ¿Qué debería hacer y cómo trabajar a continuación?
Google/DeepMind
OpenAI
DeepMind
Anthropic
Un ingeniero describe cómo automatizó la prueba de hipótesis con un agente de inteligencia artificial, y durante la noche se probaron 40 hipótesis. Explica el cambio de encontrar soluciones a construir sistemas que encuentran soluciones, y analiza ejemplos de sankalp, Karpathy y DeepMind. También aborda problemas como la paridad de pérdida y el diseño de oráculos, así como la importancia de elegir el modelo adecuado.
Un ingeniero describe cómo, en lugar de probar hipótesis manualmente, escribió una descripción en texto del pipeline de generación de hipótesis, pidió a Gemini que evaluara cada intento y dejó que un agente trabajara durante la noche. Por la mañana, el registro mostraba 40 hipótesis probadas. Contrasta sus primeros intentos ingenuos (ejecutar diez agentes en paralelo sin un plan) y su segundo intento (dar a los agentes una agenda detallada) con el enfoque perezoso de la tarde que funcionó. Explica que la clave no fue un mejor control de los agentes, sino quién evalúa el resultado. Cita precedentes: la descomposición QR de sankalp logra una aceleración de 232 veces en QR por lotes, el script de autoresearch de 630 líneas de Karpathy ejecutó cientos de experimentos durante la noche, y AlphaEvolve de DeepMind mejoró soluciones para el 20% de 50 problemas matemáticos abiertos y aceleró los centros de datos, el diseño de chips y el entrenamiento de IA de Google. Comparte dos casos personales: en el primero, pasó dos semanas elaborando manualmente filtros de datos, pero un oráculo basado en Gemini con un VLM superó eso en un par de ejecuciones; en el segundo, obtuvo una aceleración del 30% en el entrenamiento pero encontró obstáculos: olvidó incluir una verificación de paridad de pérdida (lo que llevó a una pérdida NaN), y un oráculo insuficientemente detallado pasó por alto artefactos como letras sobrantes en la eliminación de texto de imágenes. Enfatiza que construir un buen oráculo y bucle es el verdadero trabajo, y que el modelo dentro del bucle importa. Concluye que la experiencia se está desplazando de 'encontrar una solución' a 'construir un sistema que encuentre soluciones'.
Fuente: Habr — хаб ИИ —
original
