RisetKeamanan AI 🇷🇺 15.08.2026 08:02

Murah untuk Menghasilkan, Mahal untuk Memverifikasi: Biaya Tersembunyi dari Output AI

DeepMindDeepMind Google/DeepMindGoogle/DeepMind AnthropicAnthropic OpenAIOpenAI DeepSeekDeepSeek
Artikel ini mengeksplorasi asimetri yang diperkenalkan oleh AI: sementara menghasilkan draf dan jawaban kini murah, memverifikasi keakuratannya tetap sulit dan mahal. Ini menyoroti penelitian yang menunjukkan bahwa bahkan fakta-fakta yang benar secara individual dapat bergabung menjadi kesimpulan yang salah, dan bahwa alat verifikasi, baik manusia maupun otomatis, memiliki keterbatasan yang signifikan.
Artikel ini membahas tantangan verifikasi konten yang dihasilkan AI, dengan menekankan asimetri antara biaya pembuatan yang rendah dan biaya verifikasi yang tinggi. Para peneliti di National Taiwan University menemukan bahwa model bahasa dapat menggabungkan fakta-fakta yang dapat diverifikasi tentang orang-orang yang berbeda menjadi satu biografi orang yang tidak ada; metrik faktualitas standar melewatkan hal ini, dan setelah menyesuaikan ambiguitas entitas, skor untuk empat model terbuka turun lebih dari 10%. Sebuah studi yang disebut Verify with Caution menguji lima metrik faktualitas pada sebelas set data, menemukan inkonsistensi dan kesalahan, terutama ketika teks pendukung jauh dari klaim. Dalam eksperimen manusia, bantuan AI mempercepat verifikasi tetapi menyebabkan kepercayaan berlebihan ketika model memberikan penjelasan yang meyakinkan namun salah; menampilkan pro dan kontra mengurangi hal ini tetapi tidak memberikan keuntungan signifikan dibandingkan pencarian. Artikel ini membandingkan verifikasi di berbagai domain: kode memiliki kompiler dan pengujian, matematika menggunakan verifikasi pembuktian formal (misalnya, AlphaProof dan AlphaGeometry 2 memecahkan empat masalah di Olimpiade Matematika Internasional 2024), tetapi analitik dan strategi lebih sulit diverifikasi. Saran termasuk menyajikan sumber terlebih dahulu, seperti dalam Attribute First, lalu Generate, dan menggunakan hadiah proses (ThinkPRM) untuk memeriksa langkah-langkah penalaran. Artikel ini juga menyebutkan pendekatan berbasis risiko NIST dan Undang-Undang AI Eropa, yang memerlukan lebih banyak dokumentasi dan pengawasan untuk sistem berisiko tinggi.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru