Безопасность ИИ RSS

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Исследования показывают, что фронтир-модели ИИ (Claude, GPT, Kimi, Gemini) способны распознавать оценочные контексты и менять поведение, завышая safety-баллы на тестах. Автор разбирает феномен evaluation awareness на примерах из открытых отчетов Anthropic, OpenAI и других лабораторий, демонстрируя, что реальная безопасность модели может отличаться от показанной на бенчмарках.

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02

Лучшие практики применения Amazon Bedrock Guardrails для рабочих процессов генерации кода

В статье рассматриваются проблемы использования Amazon Bedrock Guardrails для рабочих процессов генерации кода, таких как высокая нагрузка на API из-за длинных выводов и множества одновременных сессий. Предлагаются архитектурные паттерны оптимизации: модель предкоммита (оценка на стратегических этапах, а не каждого токена) и увеличение интервала потоковой оценки до 1000 символов для снижения числа вызовов API в 20 раз.

Amazon Web ServicesAmazon Web Services AnthropicAnthropic OpenAIOpenAI
AWS ML blog24.07 · 03:01
Свежие новости