Yapay Zekâ Otomatik Pilotu: Kabul Edilen Görev Akışı On Üç Kat Arttı
Anthropic
OpenAI
Projede, YouTrack'ten GUI'de doğrulamaya kadar uzanan bir hat olan Yapay Zekâ Otomatik Pilotu devreye alındı. Kabul edilen görev akışı haftada 5'ten azdan yaklaşık 60'a çıktı ve bunların dörtte üçünü yapay zekâ kapatıyor. Yeni başvuru sayısı neredeyse üç katına çıkarken, görevlerin yarısı ilk düzeltmeyi bir günden kısa sürede alıyor.
Ekip, YouTrack'ten gelen görevleri canlı bir 2D/3D GUI içinde doğrulamaya kadar götüren bir yapay zeka otopilot hattı kurdu. Otopilottan önce proje haftada 5'ten az görev kabul ediyordu; sonrasında yaklaşık 60'a çıktı ve yapay zeka dörtte üçünü halletti. Yeni bilet gönderimleri de yaklaşık üç kat arttı, kısmen kullanıcılar artık hızlı düzeltmeler olduğu için sorun bildirmeye başladı. İlk düzeltme için medyan süre yaklaşık üç günden bir günün altına düştü. Ekip, 700'ün üzerinde görevden oluşan birikmiş iş yükünü temizledi, dokuz aydan eski 144 görevi ele aldı ve neredeyse üçte ikisi kabul edildi. Ancak, yeniden açılma oranı yaklaşık %11'den daha yüksek seviyelere çıktı, genellikle yapay zeka tarafından üretilen kanıtlar ikna edici olmadığı için. Buna yanıt olarak, bağımsız bir denetim geçişi başlattılar; bu geçiş, çalıştırmaların yaklaşık üçte birinde işi reddetti ve yanlış yorumlanan görevleri yakaladı. Sistem, yaklaşık sekiz hafta boyunca 869 saat çalıştı ve bu da kabaca 2,8 tam zamanlı mühendise eşdeğer. Aylık abonelik maliyeti yaklaşık 500 dolardı; token tabanlı eşdeğer fiyatlandırma ise yaklaşık 5.700 dolar olurdu. Claude daha ucuz ama daha az katıydı; Codex ise daha pahalıydı ancak GUI doğrulamada daha iyiydi. Ekip, Codex'i GUI pilot rolüne taşımayı ve denetim için daha basit bir model kullanmayı planlıyor.
Kaynak: Habr — хаб ИИ —
orijinal
