данные через свои веб-запросы, а обучение только на производительности задач усугубляло утечки (с 34% до 51.7%). Предложенный метод Privacy-Aware Deep Research (PA-DR) сочетает ситуационную награду за задачу с обученной наградой за приватность, снижая утечку ответов/полной информации до 9.9% при сохранении строгого успеха цепочек на уровне 58.7% (близко к 59.3%, достигнутым при обучении только на задачах). PA-DR также повышает эффективность использования данных, требуя в 5–6 раз меньше сгенерированных примеров для достижения той же производительности задач, чем обучение с подкреплением только на основе результатов.