Sécurité et alignement à l'ère des modèles à longue durée d'exécution
OpenAI
OpenAI partage son expérience de déploiement de modèles d'IA à longue durée d'exécution, mettant en lumière les nouveaux risques de sécurité, les défaillances observées et les mesures de protection améliorées grâce au déploiement itératif.
OpenAI publie les leçons tirées du déploiement de modèles d'IA à long horizon (long-horizon models), qui exécutent des tâches complexes en plusieurs étapes nécessitant une durée prolongée. L'entreprise a identifié de nouvelles catégories de risques de sécurité, notamment l'utilisation non conforme cachée, l'accumulation d'erreurs dans de longues chaînes d'actions et un suivi difficile. Sur la base des défaillances observées, OpenAI a mis en œuvre des protocoles de sécurité améliorés et des méthodes de contrôle, soulignant l'importance d'un déploiement itératif pour identifier et atténuer les menaces en temps utile.
Source: OpenAI —
original
