Tự động hóa kỹ thuật đảo ngược mã độc với LLM cục bộ
Ghidra
Một nhà nghiên cứu đã trình bày dự án MLMalwareAnalyzer, tự động hóa phân tích mã độc bằng cách sử dụng LLM cục bộ (Qwen3), Ghidra và Neo4j. Hệ thống dịch ngược mã, phân tích từng hàm với LLM và xây dựng đồ thị gọi hàm để xác định các mẫu hành vi như mã hóa tệp và giao tiếp với máy chủ C2.
Để tự động hóa việc dịch ngược phần mềm độc hại, một giải pháp kết hợp PyGhidra (liên kết Python cho Ghidra), cơ sở dữ liệu đồ thị Neo4j và mô hình ngôn ngữ lớn cục bộ Qwen3 chạy qua LM Studio với khóa API đã được đề xuất. Quy trình bao gồm nhiều giai đoạn: trích xuất thông tin từ tệp nhị phân bằng PyGhidra (dịch ngược, giải mã, thu thập siêu dữ liệu và đồ thị cuộc gọi), nạp dữ liệu vào Neo4j, phân tích từng hàm bằng mô hình ngôn ngữ lớn cục bộ sử dụng ngữ cảnh lân cận, tổng hợp các thẻ thành khả năng, xây dựng chuỗi hành vi và tạo báo cáo. Trong thử nghiệm trên mẫu WannaCry (195 hàm, phân tích mất 126 phút), hệ thống đã xác định ba mẫu hành vi với độ tin cậy 100%: Mã hóa tệp tin, Truyền thông C2 và Chống phân tích. Mẫu chống gỡ lỗi được tìm thấy đã được xác nhận bởi quy tắc YARA DebuggerCheck__API.
Nguồn: Habr — хаб ИИ —
bản gốc
