Lakera

Tin tức, mô hình và bản phát hành AI mới nhất từ Lakera.

An toàn AI 🇷🇺

Mặt tối của các mô hình ngôn ngữ lớn: Cách thức và lý do chúng bị biến thành vũ khí (và cách khắc phục)

Các mô hình ngôn ngữ lớn (LLM) dễ bị tấn công jailbreak, vượt qua các cơ chế an toàn của chúng, cho phép tạo ra nội dung có hại như hướng dẫn phạm tội. Các tác nhân đe dọa cũng sử dụng các mô hình ngôn ngữ lớn chuyên dụng dành cho hacker để phạm tội mạng. Các biện pháp phòng thủ bao gồm lọc nhiều lớp, huấn luyện đối kháng và thu thập dữ liệu tấn công từ cộng đồng thông qua các dự án như Gandalf.

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
Tin mới