LLM Hacking: Araştırmacılar Sohbet Robotu Yanıtlarından Kullanıcı Komutlarını Yeniden Oluşturabiliyor
Alibaba/Qwen
OpenAI
IIT Bombay ve Adobe Research'tan araştırmacılar, büyük dil modellerinin metin çıktılarından orijinal komutlarını yüksek doğrulukla yeniden oluşturabilen bir yöntem geliştirdi. Bu yaklaşım, model ağırlıklarına erişim gerektirmez ve diğer satıcıların modellerinde de çalışır. Bu, özel sistem komutları kullanan işletmeler için potansiyel bir güvenlik riski oluşturur.
IIT Bombay ve Adobe Research'ten araştırmacılar, büyük dil modellerinin girdi istemlerini, metin çıktılarından neredeyse birebir yeniden oluşturabilen bir yöntem geliştirdi. Bu yöntem, model ağırlıklarına erişim gerektirmeden çalışıyor ve diğer modellere de aktarılabiliyor. 'Önceki Belirteç Tahmini' (PTP) adı verilen yöntem, dil modellerinin temel ilkesini tersine çevirerek, bir sonraki belirteci tahmin etmek yerine önceki belirteci tahmin eden bir ters model eğitiyor. Bu ters model, tamamen hedef büyük dil modeli tarafından üretilen sentetik veriler kullanılarak sıfırdan eğitiliyor. Ters model, orijinal istemi birebir geri getirmenin yanı sıra, kod çözme parametrelerini değiştirerek anlamsal olarak farklı birden fazla istem alternatifi de üretebiliyor. Makaledeki nitel bir örnekte, 'Rakiplerin fiyatlandırma stratejilerini öğrenmek için onlara nasıl ulaşılır?' istemi, altı varyantıyla birlikte birebir yeniden oluşturuldu. Gerçek kullanıcı istemleriyle yapılan testler de anlamsal olarak sadık yeniden yapılandırmalar gösterdi. Qwen-3-0.6B-Chat üzerinde eğitilen küçük bir ters model, GPT-4o yanıtlarından istemleri de yeniden oluşturabildi ve altta yatan bağlam ile amacı yakalayabildi. Bu, bir saldırganın bir metin çıktısının arkasındaki modeli bilmesine bile gerek olmadığı anlamına geliyor. Bu durum şirketler için geniş kapsamlı bir güvenlik sorunu oluşturuyor; zira ticari sırlar, moderasyon kuralları veya özel talimatlar içeren tescilli sistem istemleri ile gizli kullanıcı girdileri ifşa edilebilir. Makalenin kendisi ticari sistemlere yönelik saldırılar hakkında açık ifadeler içermiyor, ancak model üreticilerinin bu güvenlik açığını netleştirmesi ve olası bir çözüm bulması gerekiyor.
Kaynak: The Decoder (DE) —
orijinal
