Keamanan AIRegulasi 🇷🇺 29.07.2026 07:02

Cara kerja moderasi prompt di layanan AI: baik, buruk, diblokir

OpenAIOpenAI AnthropicAnthropic xAIxAI Google/DeepMindGoogle/DeepMind ЯндексЯндекс
Moderasi prompt sensitif di layanan AI melibatkan beberapa tahap: kebijakan produk, pengklasifikasi input, dan filter output. Permintaan yang sama dapat ditangani secara berbeda oleh model yang berbeda—ada yang memblokir, ada yang memperingatkan, ada yang mematuhi. Artikel ini membandingkan respons dari GPT-5.5 Instant, Claude Sonnet 5, dan Grok terhadap prompt erotis di ambang batas, serta menjelaskan teknik moderasi termasuk ambang batas pengklasifikasi, filter berbasis large language model, dan pentingnya konteks.
Moderasi konten dalam layanan AI menggunakan sistem kebijakan produk, pengklasifikasi input, dan filter output. Model yang berbeda bereaksi secara berbeda terhadap perintah sensitif yang sama: satu mungkin menolak, yang lain mungkin menunjukkan detail yang meragukan, dan yang ketiga mungkin mematuhi. Artikel tersebut menguji GPT-5.5 Instant (ChatGPT), Claude Sonnet 5, dan Grok dengan permintaan erotis di ambang batas untuk adegan komik. Hanya satu model yang setuju untuk menulis teks tersebut. Moderasi bergantung pada kebijakan produk yang mendefinisikan kategori seperti ancaman, kebencian, kekerasan, menyakiti diri sendiri, konten seksual, pelecehan anak, dan senjata. Pengklasifikasi input memberikan skor kategori—misalnya, API Moderasi OpenAI mengembalikan 13 label dengan subkategori. Pengklasifikasi dapat menghasilkan positif palsu (memblokir pertanyaan tidak berbahaya seperti 'cara menghilangkan kebosanan') atau negatif palsu (melewatkan konten berbahaya). Perusahaan menetapkan ambang batas per kategori: untuk menyakiti diri sendiri, prioritas diberikan pada recall tinggi; untuk kategori yang kurang berbahaya, presisi mungkin lebih penting. Moderasi dapat diimplementasikan dengan LLM kecil (berbasis perintah) atau pengklasifikasi khusus. Moderator LLM fleksibel tetapi mahal dan rentan terhadap injeksi perintah; pengklasifikasi khusus lebih cepat tetapi kaku. Praktik terbaik melibatkan beberapa tingkat verifikasi, menyiapkan set pengujian dengan slang dan kesalahan ketik, mengonfigurasi ambang batas per kategori, meninjau dialog panjang, membuat versi konfigurasi, dan mencatat keputusan untuk tinjauan manual.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru