Troubleshooting AI Bug Hunting: How Not to Become a Free Triage for Your Agent
Anthropic
Cursor
HackerOne
OpenAI
Ollama
LM Studio
vLLM
AWS Bedrock
Google Vertex AI
Bugcrowd
AI agents generate many false positives, turning bug hunters into triagers. The article examines approaches to AI bug hunting, model payment methods, and verification architecture using rules, RAG, and MCP. It includes data from HackerOne and Bugcrowd on the increase in reports and the share of valid findings.
बगबाउंटी पर AI एजेंट चलाने में मिनट लगते हैं, लेकिन सत्यापन के बिना यह बड़ी संख्या में झूठी सकारात्मकता उत्पन्न करता है, और शोधकर्ता एक मुफ़्त ट्राइएजर में बदल जाता है। उदाहरण के लिए, 67 रिपोर्टों में से केवल 3 मान्य हो सकती हैं। HackerOne के अनुसार, 2026 में आने वाली रिपोर्टों की मात्रा में साल-दर-साल 76% की वृद्धि हुई, जबकि पुष्टि की गई शोषण योग्य खोजों का हिस्सा 25% पर बना हुआ है, लेकिन क्रिटिकल और हाई का हिस्सा बढ़कर 32% हो गया। साथ ही, मान्य AI रिपोर्टों में 210% की वृद्धि हुई। प्लेटफ़ॉर्म प्रतिबंध लगा रहे हैं: curl ने 1 फरवरी 2026 को HackerOne पर अपना प्रोग्राम बंद कर दिया, HackerOne ने Internet Bug Bounty में रिपोर्ट स्वीकार करना अस्थायी रूप से रोक दिया, BI.ZONE और Standoff 365 ने प्रति दिन रिपोर्टों की संख्या की सीमा लगा दी, और Brave दो स्पैम रिपोर्ट के बाद प्रतिबंध लगाता है। 9942 रिपोर्टों पर किए गए अध्ययन (Zheng et al., 2025) से पता चला कि XSS 13.8% सबमिशन बनाते हैं, Information Disclosure 9.4%, और Access Control के साथ Authentication 10% से अधिक। आधुनिक LLM अमान्य रिपोर्ट स्वीकार करने की प्रवृत्ति रखते हैं, लेकिन RAG इस समस्या को हल करने में मदद करता है। Bugcrowd के सर्वेक्षणों के अनुसार, 2026 में 82% शोधकर्ता जनरेटिव AI का उपयोग करते हैं। लेखक AI बगहंटिंग के चार दृष्टिकोणों पर प्रकाश डालता है: LLM सलाहकार के साथ मैन्युअल विश्लेषण, LLM व्याख्या के साथ ऑटोस्कैनर, बॉक्स्ड एजेंट और सत्यापित पाइपलाइन। मॉडलों के भुगतान के लिए स्थानीय (Ollama, LM Studio, vLLM), API (मजबूत मॉडल), सब्सक्रिप्शन (Cursor, Claude.ai, ChatGPT) या कॉर्पोरेट प्लेटफ़ॉर्म (Bedrock, Azure OpenAI, Vertex AI) का उपयोग किया जाता है। खोजों के सत्यापन की आर्किटेक्चर में तीन परतें शामिल हैं: एजेंट के लिए नियम (जैसे, SQLi के लिए time-based जांच, SSRF के लिए OOB, XSS के लिए headless ब्राउज़र), RAG (भेद्यता पैटर्न के साथ ज्ञान आधार तक पहुंच) और MCP (परिकल्पनाओं की सक्रिय जांच के लिए उपकरण)।
स्रोत: Habr — хаб ИИ —
मूल
