एलएलएम का अंधकारमय पक्ष: उन्हें हथियार कैसे और क्यों बनाया जाता है (और इसके बारे में क्या किया जाए)
लार्ज लैंग्वेज मॉडल (एलएलएम) जेलब्रेक हमलों के प्रति संवेदनशील हैं जो उनके सुरक्षा तंत्र को बायपास करते हैं, जिससे वे अपराध के निर्देशों जैसी हानिकारक सामग्री उत्पन्न कर सकते हैं। खतरे के अभिनेता साइबर अपराध के लिए समर्पित ब्लैक-हैट एलएलएम का भी उपयोग करते हैं। बचाव में बहु-स्तरीय फ़िल्टरिंग, प्रतिकूल प्रशिक्षण, और गैंडाल्फ जैसी परियोजनाओं के माध्यम से क्राउडसोर्स्ड हमले डेटा संग्रह शामिल हैं।
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
