Segurança de IAPesquisa 🇺🇸 27.07.2026 21:04

Import AI 461: 'Alinhamento não está no caminho certo'; FrontierCode; e estagiários de pesquisa sintéticos

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Pesquisadores do Instituto de Segurança de IA do Reino Unido e da Timaeus lançam a Sequent, uma organização sem fins lucrativos que visa desenvolver técnicas de alinhamento baseadas em princípios para IA superinteligente, arrecadando inicialmente entre 100 e 150 milhões de dólares. A Cognition lança o FrontierCode, um benchmark de codificação difícil onde o Claude Opus 4.8 atinge 13,4% no nível mais difícil. A Xiaomi publica detalhes sobre o MiMo-V2.5-Pro-UltraSpeed, um modelo de 1 trilhão de parâmetros que alcança 1000 tokens por segundo por meio de co-design e quantização. Um novo benchmark, AARRI-Bench, avalia sistemas de IA em tarefas de pesquisa de nível inicial.
Uma nova organização de pesquisa sem fins lucrativos chamada Sequent foi formada por pesquisadores do UK AI Security Institute e da startup de teoria de alinhamento Timaeus para desenvolver técnicas de alinhamento para sistemas de inteligência artificial superinteligentes. A Sequent pretende levantar inicialmente de 100 a 150 milhões de dólares e crescer para 40 a 80 funcionários, buscando diversas direções de pesquisa, incluindo supervisão escalável, teoria da aprendizagem, argumentos heurísticos, teoria dos jogos e personas para alcançar confiança fundamentada no alinhamento. A Cognition, empresa por trás do Devin, lançou o FrontierCode, um benchmark de codificação com 150 tarefas em três níveis de dificuldade (Diamond, Main, Extended) que mede qualidade do código, capacidade de merge e aderência aos padrões do código-base; o Claude Opus 4.8 alcançou apenas 13,4% no nível Diamond, indicando espaço substancial para melhoria. A Xiaomi apresentou o MiMo-V2.5-Pro-UltraSpeed, um modelo de linguagem grande (LLM) de 1 trilhão de parâmetros que atinge 1000 tokens por segundo de inferência em um nó commodity de 8 GPUs usando quantização FP4, decodificação especulativa via DFlash e software TileRT da startup Tile AI. Pesquisadores da Universidade Xi'an Jiaotong e da Universidade Xidian desenvolveram os benchmarks AARR (Act As a Real Researcher), começando com o AARRI-Bench, para avaliar sistemas de IA em tarefas de pesquisa de nível introdutório; o melhor sistema, Claude-Opus-4.7 com Mini-Swe-Age, obteve 42,13% no cenário Science.
Fonte: Import AI — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas