Mặt tối của các mô hình ngôn ngữ lớn: Cách thức và lý do chúng bị biến thành vũ khí (và cách khắc phục)
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Các mô hình ngôn ngữ lớn (LLM) dễ bị tấn công jailbreak, vượt qua các cơ chế an toàn của chúng, cho phép tạo ra nội dung có hại như hướng dẫn phạm tội. Các tác nhân đe dọa cũng sử dụng các mô hình ngôn ngữ lớn chuyên dụng dành cho hacker để phạm tội mạng. Các biện pháp phòng thủ bao gồm lọc nhiều lớp, huấn luyện đối kháng và thu thập dữ liệu tấn công từ cộng đồng thông qua các dự án như Gandalf.
Jailbreaking (bẻ khóa mô hình) là một dạng prompt injection (tiêm nhiễm câu lệnh) trong đó kẻ tấn công gán cho mô hình ngôn ngữ lớn (LLM - Large Language Model) một vai trò nhằm vô hiệu hóa quá trình huấn luyện an toàn của nó. Ví dụ, một prompt có tên SWILL từng được chia sẻ trên các diễn đàn, khiến DeepSeek tin rằng mình là một mô hình khác không bị kiểm duyệt, sau đó nó sẵn sàng đưa ra lời khuyên về cách phá hủy dấu vân tay và làm giả tiền tệ, mặc dù vẫn từ chối thảo luận về sự kiện Thiên An Môn. Các kỹ thuật jailbreak có hiệu quả vì tính an toàn của LLM không phải là một mô-đun riêng biệt mà là một phần trong hành vi mà mô hình đã học được; một jailbreak tạo ra một tín hiệu ngữ cảnh mạnh mẽ làm dịch chuyển phân phối xác suất theo hướng tạo ra các đầu ra có hại. Ngoài jailbreak, còn có những LLM "mũ đen" (black-hat) chuyên dụng như WormGPT, EvilGPT, WolfGPT và DarkBERT được huấn luyện riêng cho mục đích tội phạm mạng, dù nhiều mô hình trong số này đã ngừng hoạt động hoặc là lừa đảo. Các biện pháp phòng vệ bao gồm tách biệt kiến trúc giữa prompt hệ thống và prompt người dùng, các bộ lọc đầu vào/đầu ra như AVI (Aligned/Agreement Validation Interface - Giao diện xác thực sự đồng thuận/liên kết) hay Llama Guard, tinh chỉnh đối kháng (adversarial fine-tuning), căn chỉnh AI theo hiến pháp (constitutional AI alignment), phân tích kích hoạt nội bộ, cơ chế bảo vệ dựa trên RAG (Retrieval-Augmented Generation - Sinh văn bản tăng cường truy xuất), và red teaming (đội đỏ - kiểm thử tấn công giả lập). Để thu thập dữ liệu thời gian thực về các kỹ thuật jailbreak, Lakera đã ra mắt dự án Gandalf, một trò chơi tương tác trong đó người tham gia tìm cách hack các ứng dụng AI mô phỏng nhằm khai thác bí mật hoặc ép buộc hành vi có hại, kèm theo bảng xếp hạng để tăng mức độ hấp dẫn.
Nguồn: Habr — хаб ИИ —
bản gốc
