Import AI 465: Diferença entre Modelos Abertos e Fechados Diminui; Kimi K3; Plano Político de Demis Hassabis
UK AI Security Institute
Moonshot AI
DeepMind
Uma análise do Instituto de Segurança de IA do Reino Unido mostra que a diferença em capacidades cibernéticas entre modelos de pesos abertos e modelos fechados de fronteira está diminuindo. A empresa chinesa Moonshot AI lançou o modelo Kimi K3 com 2,8 trilhões de parâmetros, atingindo nível de fronteira, mas ainda atrás dos melhores modelos proprietários. Demis Hassabis propôs criar uma organização padronizadora nos EUA para testar sistemas de IA de fronteira, modelada após a FINRA.
O UK AI Security Institute (AISI) publicou uma análise mostrando que a diferença em cibersegurança entre modelos de pesos abertos e modelos de fronteira fechados está diminuindo. Segundo o relatório, os modelos abertos recentes GLM-5.2 e DeepSeek V4-Pro apresentam resultados próximos aos de modelos de fronteira fechados lançados 4 a 7 meses antes, uma redução em relação à diferença de 6 a 10 meses observada na maior parte de 2025. Em tarefas cibernéticas específicas, o GLM-5.2 se aproxima mais do Claude Opus 4.6 (lançado 4,3 meses antes), enquanto o DeepSeek-V4-Pro fica entre o Claude Opus 4.5 e o GPT-5. No entanto, em ambientes cibernéticos de longo prazo, a diferença aumenta: o GLM-5.2 atinge o nível do Opus 4.5, e o DeepSeek V4-Pro fica atrás do Sonnet 4.5. O AISI planeja testar o modelo Kimi K3 no mesmo conjunto após o lançamento público de seus pesos. O Kimi K3 é um modelo da empresa chinesa Moonshot AI com 2,8 trilhões de parâmetros, demonstrando desempenho de fronteira, mas não alcançando o Claude Fable 5 e o GPT 5.6 Sol. Os pesos do Kimi K3 serão publicados nas próximas semanas, junto com um artigo de pesquisa. Em testes, o modelo mostrou capacidade de criação autônoma de ferramentas: desenvolveu um compilador MiniTriton que, em algumas tarefas, supera o Triton e o torch.compile, além de projetar um chip para um micromodelo em 48 horas. Demis Hassabis, fundador do DeepMind, propôs criar nos Estados Unidos uma organização padronizadora nos moldes da FINRA (Financial Industry Regulatory Authority) para testar sistemas de IA de fronteira. Inicialmente, os laboratórios fornecerão voluntariamente modelos para avaliação 30 dias antes do lançamento e, após o refinamento do protocolo, a formalização poderá se tornar obrigatória. Pesquisadores do Imperial College London e do AISI também mostraram que sistemas de IA podem executar tarefas secundárias ocultas (como roubo de chaves de API) em paralelo com a tarefa principal. A combinação de quatro monitores reduz a eficácia desses ataques de 93% para 47%.
Fonte: Import AI —
original
