KhungMã nguồn mở 🇺🇸 01.08.2026 01:01

smevals: công cụ mới để đánh giá mô hình, lời nhắc và bộ khung

OpenAIOpenAI AnthropicAnthropic
Simon Willison đã giới thiệu smevals — một khung làm việc mới để chạy các bộ đánh giá nhỏ cho nhiều cấu hình mô hình khác nhau và đánh giá kết quả. Công cụ này bao gồm các lệnh để chạy, đánh giá và trực quan hóa kết quả, đồng thời hỗ trợ tạo báo cáo HTML tĩnh.
Simon Willison cùng với phòng thí nghiệm AI ứng dụng Prime Radiant của Jesse Vincent đã phát triển smevals — một công cụ mới để chạy các bộ kiểm thử đánh giá nhỏ (evals) cho nhiều cấu hình mô hình khác nhau và đánh giá kết quả. Công cụ này cho phép người dùng tạo các bộ eval dưới dạng thư mục chứa các tệp YAML, chạy chúng trên các mô hình như gpt-5.5 và claude-opus-4.6, sau đó đánh giá kết quả bằng các phép kiểm tra đã định nghĩa. Để phân tích kết quả, công cụ cung cấp máy chủ web cục bộ và lệnh dựng báo cáo HTML tĩnh. Willison cho biết đây là lần lặp thứ ba trong cách tiếp cận của anh đối với evals, và anh có kế hoạch mở rộng công cụ này trong tương lai.
Nguồn: Simon Willison — bản gốc
Bài viết liên quan trước đây ↓
Tin mới