Sisi Gelap LLM: Bagaimana dan Mengapa Mereka Diubah Menjadi Senjata (dan Apa yang Harus Dilakukan)
Model Bahasa Besar (LLM) rentan terhadap serangan jailbreak yang melewati mekanisme keamanannya, sehingga memungkinkan mereka menghasilkan konten berbahaya seperti instruksi untuk kejahatan. Aktor ancaman juga menggunakan LLM black-hat khusus untuk kejahatan siber. Pertahanan mencakup penyaringan berlapis, pelatihan adversarial, dan pengumpulan data serangan dari kerumunan melalui proyek seperti Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
