Lakera

来自以下厂商的最新 AI 新闻、模型与发布: Lakera.

AI安全 🇷🇺

大语言模型的阴暗面:它们如何以及为何被武器化(以及应对之策)

大语言模型(LLM)容易受到越狱攻击,这类攻击会绕过其安全机制,使其能够生成有害内容,例如犯罪指导。威胁行为者还会使用专门的黑客大语言模型进行网络犯罪。防御措施包括分层过滤、对抗性训练,以及通过 Gandalf 等项目众包攻击数据收集。

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
最新新闻