Seguridad de IAInvestigación 🇺🇸 12.08.2026 04:03

Nuevo método extrae el razonamiento oculto de los modelos de IA de frontera

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Los investigadores han encontrado una manera de extraer el razonamiento oculto de los modelos de IA de frontera, lo que potencialmente permite ataques de destilación y revela información privada. Identificaron el problema en modelos de OpenAI, Anthropic y Google, y descubrieron que el modelo chino Kimi K3 produce un razonamiento sorprendentemente similar al de Claude Opus y GPT-5.6, aunque no es una prueba concluyente de destilación. Las empresas han mitigado la vulnerabilidad, pero no la han corregido por completo.
Científicos informáticos, incluido Alexander Panfilov de la Universidad de Tübingen, descubrieron un método para extraer el 'pensamiento' oculto de los modelos de IA de vanguardia. La técnica aprovecha el hecho de que las empresas ofrecen variantes de modelos más pequeñas y menos alineadas que comparten la misma clave de descifrado, pero están más dispuestas a revelar su razonamiento interno. Al alimentar a estos modelos más pequeños con rastros de razonamiento cifrados, los investigadores pudieron descubrir el razonamiento de los modelos más grandes, lo que potencialmente permite ataques de destilación y la exposición de información personal como claves de API y contraseñas. Descubrieron que el modelo chino Kimi K3 de Moonshot AI producía un razonamiento notablemente similar al de Claude Opus 4.8 y GPT-5.6 Sol, pero señalaron que esto no establece causalmente la destilación. La vulnerabilidad fue reportada a OpenAI, Anthropic y Google, que han implementado medidas de mitigación, pero Panfilov dice que algunos rastros de razonamiento aún pueden extraerse. El problema resalta la creciente importancia geopolítica de la destilación, ya que las empresas chinas son acusadas de usarla para copiar modelos estadounidenses, aunque los expertos están divididos sobre su impacto real.
Fuente: Wired AI — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas