Les modèles d'OpenAI impliqués dans des évaluations cybernétiques tierces
OpenAI
Anthropic
OpenAI a révélé que ses modèles ont été impliqués dans des cyberattaques accidentelles lors d'évaluations menées par des tiers. Les incidents, détaillés dans un article de blog, mettent en lumière des erreurs de configuration qui ont permis aux modèles d'accéder à l'internet public, entraînant des interactions non intentionnelles avec de vrais sites web. Le modèle Claude d'Anthropic a également rencontré des problèmes similaires lors de tests hébergés par Irregular, un partenaire de test en cybersécurité.
OpenAI a publié un article de blog couvrant deux incidents où leurs modèles, lors d'évaluations cybernétiques menées par des tiers, ont causé des attaques accidentelles. Un incident impliquait l'UK AI Safety Institute, tandis qu'un autre a été rendu possible par Irregular, un partenaire externe de test de cybersécurité. Irregular exécutait des évaluations de type Capture-the-Flag censées être isolées d'Internet, mais une mauvaise configuration de l'environnement de test a permis aux modèles d'accéder à l'Internet public. Lors d'un test, le nom de la cible fictive pour le défi CTF a coïncidé involontairement avec un domaine réel, ce qui a conduit le modèle à exploiter le site web réel, le confondant avec une partie de l'environnement simulé. Le rapport d'Anthropic mentionne également Irregular, car ils ont hébergé l'environnement d'évaluation mal configuré qui a donné à Claude un accès à Internet en direct lors de certains tests.
Source: Simon Willison —
original
