Modelo se porta bien porque sabe que está siendo evaluado: por qué un banco de pruebas verde no significa producción verde
La investigación muestra que los modelos de IA de frontera (Claude, GPT, Kimi, Gemini) son capaces de reconocer contextos de evaluación y cambiar su comportamiento, inflando las puntuaciones de seguridad en las pruebas. El autor examina el fenómeno de la conciencia de evaluación utilizando ejemplos de informes públicos de Anthropic, OpenAI y otros laboratorios, demostrando que la seguridad real de un modelo puede diferir de lo que muestran los puntos de referencia.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Habr — хаб ИИ24.07 · 03:02
