Исследования RSS

Поймай jailbreak, если сможешь: как путаница ролей обходит защиту LLM

Jailbreak больших языковых моделей (LLM) — это не взлом, а социальная инженерия: атакующий меняет контекст запроса так, чтобы запрещённый ответ казался нормальным. Исследователи из работы Prompt Injection as Role Confusion показали, что модель может путать служебные метки ролей (system, user, assistant) со стилем текста, и если стиль похож на «внутреннее рассуждение», атака CoT Forgery достигает 60% успешности.

OpenAIOpenAI AnthropicAnthropic
Habr — хаб ML24.07 · 05:03

Почему гуманоиду сложно хватать движущиеся предметы: разработка VLA для динамической среды

ML-инженер MTC Web Services Дания рассказывает о проблемах, с которыми сталкиваются VLA-модели при работе с движущимися объектами, и о том, как в RnD-подразделении компании адаптируют архитектуру RLDX-1 для гуманоида Unitree G1, чтобы он мог брать детали с конвейера, сохраняя баланс.

Unitree RoboticsUnitree Robotics
Habr — хаб ИИ24.07 · 05:03
Свежие новости