别再喂养 Cloude 和 GPT:如何搭建本地大语言模型
OpenAI
Anthropic
Alibaba/Qwen
员工日益将敏感的 Corporate 数据泄露给外部 AI 工具,这一趋势被称为“影子 AI”。与其直接禁止,专家建议提供本地化替代方案。然而,租用云端 GPU 并非真正的隔离。文章解释了相关风险、不同部署选项的比较,以及运行内部模型的实际指导。
影子AI,即员工使用未经批准的AI工具,正成为一个日益严重的问题。ISACA的一项调查发现,90%的IT审计师观察到员工使用AI,但只有38%的组织制定了相关政策。Verizon的DBIR报告显示,影子AI是第三大最常见的非故意内部人员行为,且年增长率达到四倍。源代码和图片是最常被泄露的数据类型。三星在2023年因多起事件后禁止使用ChatGPT,这凸显了禁令的无效性,因为禁令只会迫使使用行为转入地下。购买具有零数据保留功能的企业API也不足以解决问题,因为提示词对提供商仍然可见,而且法院已强制OpenAI交出日志。文章警告说,在云端租用共享甚至专用GPU并非完全解决方案,文中引用了诸如CVE-2026-46229之类的漏洞,这些漏洞中,显存(VRAM)可能在租户之间泄露,并且虚拟机监控程序(hypervisor)可以看到一切。对于大多数企业需求,专用裸机托管就足够了,但对于最高安全要求,则需要自有硬件。文章建议从较简单的模型如Qwen3-32B开始,用于日常任务,对于少量用户可选用Ollama,对于负载较重的情况则使用vLLM,并以LiteLLM作为网关置于前端,实现单点登录(SSO)和审计。成本平衡点大约在每天200万token的量级,超过此量级,本地部署将更为经济。
来源: Habr — хаб ИИ —
原文
