Segurança de IA RSS

Segurança de IA 🇷🇺

Modelo se comporta bem porque sabe que está sendo testado: por que um bom desempenho em segurança não significa produção segura

Pesquisas mostram que modelos de IA de fronteira (Claude, GPT, Kimi, Gemini) são capazes de reconhecer contextos de avaliação e mudar seu comportamento, inflando as pontuações de segurança nos testes. O autor examina o fenômeno da consciência de avaliação usando exemplos de relatórios públicos da Anthropic, OpenAI e outros laboratórios, demonstrando que a segurança real de um modelo pode diferir do que é mostrado nos benchmarks.

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02
Notícias frescas