Исследования RSS

Prompt injection не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов

Prompt injection — структурный дефект LLM, при котором недоверенный текст исполняется как инструкция. Фильтры и системные промпты неэффективны: даже лучшие защиты пробиваются в 90% случаев при адаптивных атаках. Рабочие подходы — Dual-LLM, CaMeL и правило двух Meta — строят изоляцию, а не пытаются отличить добро от зла.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01

Почему обобщённая модель данных — не очередная Bad CaRMa: разбор четырёх граблей и замеры на живой базе

Автор сравнивает свою обобщённую модель данных (квартет id, up, t, val) с провальной CRM Vision из книги «Dreaming in Code», объясняя, почему их подход не повторяет ошибок Bad CaRMa. В модели реализованы система типов, контроллер запросов и индексы, что подтверждается замерами: сбор записи занимает 0.16 мс, обход связей — 0.30 мс. Также показан конкретный пример, когда из-за отсутствия индекса запрос выполнялся 4 с, а после добавления — 0.09 мс.

Habr — хаб ИИ24.07 · 11:01
Свежие новости