Simula: Một khuôn khổ thiết kế tập dữ liệu tổng hợp dựa trên cơ chế và lý luận
Google/DeepMind
Google Research giới thiệu Simula, một khuôn khổ tái định nghĩa việc tạo dữ liệu tổng hợp như một thiết kế cơ chế ở cấp độ tập dữ liệu. Phương pháp này ưu tiên lý luận để xây dựng toàn bộ tập dữ liệu từ các nguyên lý cơ bản, cho phép kiểm soát chi tiết về độ phủ, độ phức tạp và chất lượng. Simula đã là yếu tố then chốt cho hệ sinh thái Gemma và các bộ phân loại an toàn tại Google.
Google Research đã giới thiệu Simula, một khung nền tảng cho việc tạo dữ liệu tổng hợp, coi việc xây dựng tập dữ liệu như một bài toán thiết kế cơ chế. Không giống như các phương pháp hiện có dựa vào lời nhắc thủ công hoặc dữ liệu khởi tạo, Simula áp dụng cách tiếp cận ưu tiên suy luận, xây dựng các tập dữ liệu từ những nguyên lý cơ bản mà không cần dữ liệu ban đầu. Nó phân tách quá trình tạo thành bốn trục: phân loại sâu để đảm bảo độ phủ, đa dạng hóa cục bộ để tăng sự phong phú, phức tạp hóa để điều chỉnh độ khó và kiểm tra chất lượng thông qua vòng lặp phản biện kép. Simula sử dụng các chỉ số dựa trên suy luận như Độ phủ phân loại và xếp hạng Elo để đánh giá. Nó đã được sử dụng với Gemini 2.5 Flash làm giáo viên và Gemma-3 4B làm học sinh trên các lĩnh vực như an ninh mạng, suy luận pháp lý, toán học (GSM8k) và kiến thức đa ngôn ngữ (Global MMLU). Trong nội bộ Google, Simula hỗ trợ hệ sinh thái Gemma (ShieldGemma, FunctionGemma, MedGemma), các bộ phân loại an toàn cho Gemini và các tính năng như phát hiện lừa đảo cho cuộc gọi Android và lọc thư rác trong Google Messages. Khung nền tảng này hướng tới việc biến việc tạo dữ liệu thành một khoa học có thể kiểm soát cho các ứng dụng AI chuyên biệt.
Nguồn: Google Research —
bản gốc
