大语言模型的阴暗面:它们如何以及为何被武器化(以及应对之策)
大语言模型(LLM)容易受到越狱攻击,这类攻击会绕过其安全机制,使其能够生成有害内容,例如犯罪指导。威胁行为者还会使用专门的黑客大语言模型进行网络犯罪。防御措施包括分层过滤、对抗性训练,以及通过 Gandalf 等项目众包攻击数据收集。
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
