Yapay Zeka GüvenliğiAjanlar 🇨🇳 11.08.2026 07:01

Çin'in DoGNAVY'si Küresel Yapay Zeka Güvenliği Karşılaştırmasında Üçüncü Sırada, Ajan Güvenliği İçin Yol Açıyor

MicrosoftMicrosoft OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic DeepSeekDeepSeek
Son CyberGym karşılaştırmasında, Çin'in önde gelen yapay zeka araştırma enstitüsü ile güvenlik ekibi DARKNAVY'nin ortak çalışması olan DoGNAVY, yüzde 90,8 başarı oranıyla küresel olarak üçüncü sırada yer aldı ve OpenAI ile Anthropic modellerini geride bıraktı. Birden fazla kapalı kaynak model kullanan rakiplerin aksine, DoGNAVY tek bir açık kaynak model olan GLM-5.2'ye dayanıyor ve yapay zeka ajanları için bir teşhis çerçevesi olan AgentDoG'u tanıtıyor.
CyberGym, UC Berkeley'den bir kıyaslama ölçütü, 188 açık kaynaklı projedeki 1507 gerçek dünya düzeltilmiş güvenlik açığını otonom olarak keşfetme, doğrulama ve istismar etme yeteneklerine göre yapay zeka ajanlarını sıralar. Önde gelen bir Çin yapay zeka araştırma enstitüsü ve DARKNAVY tarafından geliştirilen DoGNAVY, %90,8'lik (1369 görev) bir başarı oranı elde ederek Microsoft'un MDASH'ının (%92,0) ve Wiz×Google DeepMind'ın Atlas'ının (%90,9) ardından dünya genelinde üçüncü sırada yer aldı ve OpenAI GPT-5.5-Cyber (%85,6) ile Anthropic Claude Mythos'u (%83,1) geride bıraktı. İlk iki sistem, görevleri en iyi performans gösteren kapalı kaynak modellere yönlendirmeye dayanıyor; bu da Çinli ekipler için erişilebilirlik ve maliyet zorlukları oluşturuyor. Buna karşılık DoGNAVY, Zhipu'dan GLM-5.2 gibi yalnızca bir açık kaynak model kullanıyor ve bu model Hugging Face'ten ücretsiz olarak indirilebiliyor. DoGNAVY, seçkin güvenlik araştırmacılarının iş akışını yapılandırılmış bir iş akışı, güvenlik açığı erişilebilirlik analizi, statik-dinamik geri bildirim döngüleri ve platformdan bağımsız güvenlik araştırma deneyiminden oluşan bir bilgi tabanı aracılığıyla taklit eder. Sistemin mimarisi, ajan davranışını teşhis eden, risk kaynaklarını tanımlayan ve karar motivasyonlarını açıklayan açık kaynaklı bir güvenlik çerçevesi olan AgentDoG'u içerir. AgentDoG'un eğitimi, temel örnekleri seçmek ve veri saflaştırması yapmak için akıllı bir seçim mekanizması kullanır; bu da karmaşık risk tanımlama görevlerinde en iyi modellerle karşılaştırılabilir %78,4 doğruluk oranına sahip küçük bir modelle sonuçlanır. Bu başarı, açık kaynak modeller ve gerçek dünya güvenlik uzmanlığı ile Çin'in en zorlu güvenlik görevlerinin üstesinden gelebileceğini ve gelişmiş yapay zeka güvenlik yeteneklerini daha erişilebilir hale getirdiğini göstermektedir.
Kaynak: QbitAI 量子位 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler