Từ lập trình đến vận hành: Thực tiễn kỹ thuật của các tác nhân SRE gốc AI | AICon Thâm Quyến
Tencent
Tencent Cloud
Hội nghị Phát triển và Ứng dụng AI AICon Thâm Quyến 2026 sẽ được tổ chức vào ngày 21-22 tháng 8, với sự tham gia của hơn 50 chuyên gia từ các công ty công nghệ hàng đầu. Yao Binbin từ Tencent Cloud sẽ trình bày về các tác nhân SRE gốc AI, bao gồm nền tảng dữ liệu, hiểu biết ngữ nghĩa và thực tiễn kỹ thuật cho quản trị vận hành.
Khi năng lực của các mô hình AI ngày càng trở nên phổ biến và không còn là lợi thế khác biệt, lợi thế cạnh tranh đang dịch chuyển từ sức mạnh của mô hình sang việc xây dựng các hệ thống thông minh có khả năng mở rộng và năng lực kỹ thuật (engineering). Hội nghị 2026 AICon Shenzhen, dự kiến diễn ra từ ngày 21-22 tháng 8, sẽ tập trung vào hạ tầng AI, hệ thống mô hình lớn, kỹ thuật agent, trí tuệ dữ liệu, công nghệ đa phương thức (multimodal) và các ứng dụng trong ngành.
Ông Yao Binbin, trưởng nhóm kỹ thuật CloudQ của Tencent Cloud, sẽ có bài trình bày mang tên 'From Coding to Running: Engineering Practices of AI-Native SRE Agent' (Từ viết mã đến vận hành: Thực tiễn kỹ thuật của SRE Agent thuần AI). Ông sẽ thảo luận về cách các SRE Agent (Site Reliability Engineering Agent - Agent kỹ thuật đảm bảo độ tin cậy hệ thống) giải quyết bài toán quản trị vận hành sau khi phần mềm được đưa vào sử dụng thực tế, khác với các Coding Agent chỉ tập trung nâng cao hiệu suất phát triển.
Bài trình bày của ông sẽ đề cập đến việc xây dựng nền tảng dữ liệu cho 'thế giới vận hành' (running world) bằng cách tích hợp hạ tầng, dữ liệu quan sát (observability data) và tri thức; tạo ra một Running World Model (Mô hình Thế giới Vận hành) thống nhất dựa trên ontology, tầng ngữ nghĩa (semantic layer) và đồ thị toàn cảnh (panoramic graph); hỗ trợ các kịch bản vận hành như trực quan hóa kiến trúc, kiểm tra tình trạng hệ thống, phân tích nguyên nhân gốc rễ, lập kế hoạch năng lực, kiểm soát rủi ro khi thay đổi và tối ưu hóa FinOps (Financial Operations - quản trị tài chính vận hành). Ngoài ra, ông cũng sẽ giới thiệu việc sử dụng Harness để đánh giá, tái hiện (replay), tích lũy kinh nghiệm và không ngừng tiến hóa từ trạng thái 'có thể trả lời' sang 'có thể kiểm chứng, tái tạo và duy trì bền vững'.
Một trường hợp sự cố thực tế sẽ được dùng để minh họa toàn bộ quy trình khép kín, từ cảnh báo CPU cho đến việc xác định nguyên nhân gốc rễ và đưa ra khuyến nghị xử lý.
Nguồn: InfoQ 中国 —
bản gốc
