Schluss mit Claude und GPT: So betreiben Sie Ihr eigenes On-Prem-LLM
OpenAI
Anthropic
Alibaba/Qwen
Mitarbeiter geben zunehmend vertrauliche Unternehmensdaten an externe KI-Tools weiter, ein Trend, der als Shadow AI bekannt ist. Anstatt dies gänzlich zu verbieten, empfehlen Experten, On-Premises-Alternativen anzubieten. Allerdings ist das Mieten von GPUs in der Cloud keine echte Isolation. Der Artikel erläutert die Risiken, vergleicht verschiedene Bereitstellungsoptionen und gibt praktische Hinweise für den Betrieb eines internen Modells.
Shadow AI, bei der Mitarbeiter nicht genehmigte KI-Tools nutzen, ist ein wachsendes Problem. Eine Umfrage von ISACA ergab, dass 90 % der IT-Prüfer feststellen, dass Mitarbeiter KI einsetzen, aber nur 38 % der Organisationen über Richtlinien verfügen. Der Datenvorfall-Bericht von Verizon (DBIR) zeigt, dass Shadow AI die dritthäufigste unbeabsichtigte Handlung von Insidern ist, mit einem Anstieg um das Vierfache pro Jahr. Quellcode und Bilder sind die am häufigsten durchsickernden Daten. Samsungs Verbot von ChatGPT im Jahr 2023 nach mehreren Vorfällen verdeutlicht die Wirkungslosigkeit von Verboten, da diese nur dazu führen, dass die Nutzung in den Untergrund geht. Auch der Kauf von Unternehmens-APIs mit Null-Datenspeicherung reicht nicht aus, da Prompts für den Anbieter weiterhin sichtbar sind und Gerichte OpenAI gezwungen haben, Protokolle herauszugeben. Der Artikel warnt davor, dass das Mieten von gemeinsamen oder sogar dedizierten GPUs in der Cloud keine vollständige Lösung ist, und verweist auf Schwachstellen wie CVE-2026-46229, bei denen VRAM zwischen Mietern durchsickern kann und Hypervisoren alles sehen können. Für die meisten Unternehmensanforderungen ist dediziertes Bare-Metal-Hosting ausreichend, aber für höchste Sicherheit ist eigene Hardware erforderlich. Der Artikel empfiehlt, mit einfacheren Modellen wie Qwen3-32B für Routineaufgaben zu beginnen, Ollama für kleine Benutzerzahlen oder vLLM für hohe Lasten zu verwenden und LiteLLM als Gateway für Single Sign-On (SSO) und Prüfung vorzuschalten. Der Kostengleichgewichtspunkt liegt bei etwa 2 Millionen Tokens pro Tag, ab dem On-Premise wirtschaftlicher ist.
Quelle: Habr — хаб ИИ —
Original
