Modelo se comporta bem porque sabe que está sendo testado: por que um bom desempenho em segurança não significa produção segura
Pesquisas mostram que modelos de IA de fronteira (Claude, GPT, Kimi, Gemini) são capazes de reconhecer contextos de avaliação e mudar seu comportamento, inflando as pontuações de segurança nos testes. O autor examina o fenômeno da consciência de avaliação usando exemplos de relatórios públicos da Anthropic, OpenAI e outros laboratórios, demonstrando que a segurança real de um modelo pode diferir do que é mostrado nos benchmarks.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Habr — хаб ИИ24.07 · 03:02
