Seguridad de IAInvestigación 🇺🇸 27.07.2026 21:04

Import AI 461: 'El alineamiento no va por buen camino'; FrontierCode; y pasantes de investigación sintéticos

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Investigadores del UK AI Security Institute y Timaeus lanzan Sequent, una organización sin fines de lucro que busca desarrollar técnicas de alineamiento basadas en principios para IA superinteligente, recaudando inicialmente entre 100 y 150 millones de dólares. Cognition publica FrontierCode, un exigente benchmark de codificación donde Claude Opus 4.8 obtiene un 13.4% en el nivel más difícil. Xiaomi publica detalles sobre MiMo-V2.5-Pro-UltraSpeed, un modelo de 1 billón de parámetros que logra 1000 tokens por segundo mediante co-diseño y cuantización. Un nuevo benchmark, AARRI-Bench, evalúa sistemas de IA en tareas de investigación de nivel inicial.
Una nueva organización de investigación sin fines de lucro llamada Sequent ha sido formada por investigadores del Instituto de Seguridad de IA del Reino Unido y la startup de teoría de alineación Timaeus para desarrollar técnicas de alineación para sistemas de IA superinteligentes. Sequent pretende recaudar entre 100 y 150 millones de dólares inicialmente y crecer hasta tener entre 40 y 80 empleados, explorando diversas direcciones de investigación que incluyen supervisión escalable, teoría del aprendizaje, argumentos heurísticos, teoría de juegos y personajes (personas) para lograr una confianza fundamentada en la alineación. Cognición, la empresa detrás de Devin, lanzó FrontierCode, un punto de referencia de codificación con 150 tareas en tres niveles de dificultad (Diamond, Main, Extended) que mide la calidad del código, la capacidad de fusión y la adherencia a los estándares del código base; Claude Opus 4.8 logró solo un 13,4% en el nivel Diamond, lo que indica un margen sustancial de mejora. Xiaomi presentó MiMo-V2.5-Pro-UltraSpeed, un modelo de lenguaje grande (LLM) de 1 billón de parámetros que alcanza 1000 tokens por segundo de inferencia en un nodo de 8 GPU de consumo mediante cuantización FP4, decodificación especulativa a través de DFlash y el software TileRT de la startup Tile AI. Investigadores de la Universidad de Xi'an Jiaotong y la Universidad de Xidian desarrollaron los puntos de referencia AARR (Actúa como un Investigador Real), comenzando con AARRI-Bench, para evaluar sistemas de IA en tareas de investigación de nivel inicial; el sistema con mejor rendimiento, Claude-Opus-4.7 con Mini-Swe-Age, obtuvo un 42,13% en el escenario de Ciencias.
Fuente: Import AI — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas