Mặt tối của các mô hình ngôn ngữ lớn: Cách thức và lý do chúng bị biến thành vũ khí (và cách khắc phục)
Các mô hình ngôn ngữ lớn (LLM) dễ bị tấn công jailbreak, vượt qua các cơ chế an toàn của chúng, cho phép tạo ra nội dung có hại như hướng dẫn phạm tội. Các tác nhân đe dọa cũng sử dụng các mô hình ngôn ngữ lớn chuyên dụng dành cho hacker để phạm tội mạng. Các biện pháp phòng thủ bao gồm lọc nhiều lớp, huấn luyện đối kháng và thu thập dữ liệu tấn công từ cộng đồng thông qua các dự án như Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
