Cuando los bancos de preguntas no siguen el ritmo, la IA empieza a plantear sus propios problemas: el equipo Endless Frontier ejecuta el RSI a nivel de datos
DP Technology
DeepSeek
Un equipo chino de la Universidad Jiao Tong de Shanghái, DP Technology y el Instituto de Algoritmos de Shanghái ha publicado BigBang-V1, el primer modelo base entrenado de forma nativa mediante automejora recursiva. El modelo de 35 mil millones de parámetros, con datos de entrenamiento 100% sintetizados por IA, supera a modelos de billones de parámetros en varios benchmarks científicos, mostrando un pipeline de datos autoevolutivo.
El equipo de Endless Frontier, compuesto por investigadores del Instituto de IA de la Universidad Jiao Tong de Shanghái, DP Technology y el Instituto de Innovación de Algoritmos de Shanghái, ha lanzado BigBang-V1, el primer modelo base entrenado de forma nativa utilizando la auto-mejora recursiva (RSI, por sus siglas en inglés). En este enfoque, la IA se encarga de la generación, resolución y verificación de problemas, produciendo datos sintéticos de alta calidad que se auto-evolucionan sin intervención humana por tarea. El modelo, con 35 mil millones de parámetros y aproximadamente 3 mil millones activos durante la inferencia, admite un contexto largo de 262 mil y está completamente entrenado con datos sintéticos generados por IA centrados en tareas científicas de vanguardia. Logró 10 primeros lugares entre los modelos de 35 mil millones en puntos de referencia que incluyen búsqueda de horizonte largo, codificación, investigación científica e investigación en IA, e incluso superó al modelo DeepSeek V4 Pro Preview de 1 billón de parámetros en tareas científicas difíciles como FrontierScience Research y PaperBench. Ejemplos de su capacidad incluyen localizar con precisión un sitio de inserción de transposones mediante evidencia de uniones, y replicar un artículo en código ejecutable autocorrigiéndose durante las pruebas de humo. El equipo enfatiza que el sistema de producción de datos en sí mismo puede optimizarse, requiriendo tareas que sean tanto de vanguardia como verificables, e implementan un pipeline de doble bucle: un bucle interno con agentes Generador y Crítico que producen y evalúan datos, y un bucle externo impulsado por resultados de entrenamiento reales para calibrar el sistema. Este bucle de RSI a nivel de datos evita el colapso de datos sintéticos, mientras que los humanos aún definen objetivos, presupuestos, riesgos y criterios de aceptación. El modelo y el código son de código abierto en Hugging Face y GitHub.
Fuente: QbitAI 量子位 —
original
