Matériel et InférenceSécurité de l'IA 🇷🇺 05.08.2026 06:03

Stop d'alimenter Claude et GPT : comment mettre en place votre propre LLM sur site

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen
Les employés divulguent de plus en plus de données sensibles de l'entreprise à des outils d'IA externes, une tendance connue sous le nom d'IA fantôme (Shadow AI). Plutôt que d'interdire complètement, les experts suggèrent d'offrir des alternatives sur site. Cependant, louer des GPU dans le cloud ne constitue pas une véritable isolation. L'article explique les risques, les comparaisons des différentes options de déploiement et des conseils pratiques pour exécuter un modèle interne.
L'IA fantôme, où les employés utilisent des outils d'IA non autorisés, est un problème croissant. Une enquête d'ISACA a révélé que 90 % des auditeurs informatiques constatent que les employés utilisent l'IA, mais seulement 38 % des organisations ont des politiques en place. Le rapport DBIR de Verizon montre que l'IA fantôme est la troisième action involontaire la plus courante de la part des initiés, avec une augmentation quadruple chaque année. Le code source et les images sont les données les plus souvent divulguées. L'interdiction de ChatGPT par Samsung en 2023 après plusieurs incidents illustre l'inefficacité de l'interdiction, car elle ne fait que conduire l'utilisation à devenir clandestine. L'achat d'API d'entreprise avec une conservation des données nulle est également insuffisant, car les invites restent visibles pour le fournisseur, et les tribunaux ont forcé OpenAI à remettre les journaux. L'article avertit que la location de GPU partagés ou même dédiés dans le cloud n'est pas une solution complète, citant des vulnérabilités comme CVE-2026-46229 où la mémoire vidéo peut fuir entre les locataires, et que les hyperviseurs peuvent tout voir. Pour la plupart des besoins des entreprises, l'hébergement dédié sur bare-metal est suffisant, mais pour la sécurité maximale, il faut posséder son propre matériel. L'article suggère de commencer avec des modèles plus simples comme Qwen3-32B pour les tâches courantes, d'utiliser Ollama pour un petit nombre d'utilisateurs ou vLLM pour les charges lourdes, et de mettre LiteLLM en passerelle pour l'authentification unique et l'audit. Le point d'équivalence des coûts se situe à environ 2 millions de jetons par jour, au-delà duquel l'installation sur site est plus économique.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches