Supabase công bố mã nguồn mở Evals: Đánh giá tác nhân mã AI trên các tác vụ thực tế
Anthropic
OpenAI
Moonshot AI
Supabase đã công bố mã nguồn mở Supabase Evals, một bộ tiêu chuẩn và khung đánh giá để kiểm tra mức độ hiệu quả của các tác nhân mã AI khi xây dựng với Supabase. Khung này chạy các tác nhân như Claude Code, Codex và OpenCode trên các tác vụ thực tế, chấm điểm kết quả bằng sự kết hợp giữa kiểm tra xác định (deterministic checks) và LLM-as-a-judge (mô hình ngôn ngữ lớn đóng vai trò giám khảo). Khung này được phát hành theo giấy phép Apache-2.0 và cung cấp cho một bảng xếp hạng công khai.
Supabase đã mã nguồn mở Supabase Evals, một chuẩn đánh giá (benchmark) và khung làm việc (framework) để kiểm tra mức độ tốt của các tác tử AI (AI agents) khi xây dựng bằng Supabase. Nó chạy các tác tử viết mã như Claude Code, Codex và OpenCode với các nhiệm vụ thực tế như xây dựng lược đồ (schema), gỡ lỗi một Edge Function bị lỗi, hoặc sửa một chính sách RLS (Row Level Security) bị hỏng, sau đó chấm điểm kết quả. Chuẩn đánh giá này hỗ trợ một bảng xếp hạng công khai tại supabase.com/evals và một bộ kiểm tra hồi quy nội bộ được theo dõi hàng ngày. Khung làm việc có sẵn dưới giấy phép Apache-2.0 và chạy cục bộ thông qua pnpm. Các tình huống bao gồm các khía cạnh như sản phẩm (cơ sở dữ liệu, xác thực, lưu trữ) và các chủ đề (RLS, bảo mật), và mỗi tình huống chạy trên một ngăn xếp Supabase thực tế được chứa trong container. Việc chấm điểm kết hợp các kiểm tra xác định (deterministic checks) với LLM-as-a-judge (mô hình ngôn ngữ lớn làm giám khảo), và các tác tử được phép thử lại một lần. Các phát hiện chính cho thấy các mô hình hàng đầu như Opus 5 và Kimi K3 đạt 100% điểm mà không cần hỗ trợ, trong khi các kỹ năng (skills) giúp các mô hình nhỏ hơn thu hẹp khoảng cách. Các điểm yếu bao gồm việc viết migration bằng tay thay vì sử dụng lược đồ khai báo (declarative schemas), xác minh xác thực thủ công, và việc sử dụng tài liệu không nhất quán giữa các tác tử.
Nguồn: MarkTechPost —
bản gốc
