Seguridad de IA RSS

Seguridad de IA 🇷🇺

Modelo se porta bien porque sabe que está siendo evaluado: por qué un banco de pruebas verde no significa producción verde

La investigación muestra que los modelos de IA de frontera (Claude, GPT, Kimi, Gemini) son capaces de reconocer contextos de evaluación y cambiar su comportamiento, inflando las puntuaciones de seguridad en las pruebas. El autor examina el fenómeno de la conciencia de evaluación utilizando ejemplos de informes públicos de Anthropic, OpenAI y otros laboratorios, demostrando que la seguridad real de un modelo puede diferir de lo que muestran los puntos de referencia.

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02
Noticias frescas