Google giới thiệu TabFM: Mô hình nền tảng cho dữ liệu dạng bảng với khả năng học zero-shot
Google/DeepMind
Google Research đã công bố TabFM, một mô hình nền tảng cho dữ liệu dạng bảng sử dụng phương pháp học trong ngữ cảnh zero-shot để thực hiện phân loại và hồi quy mà không cần huấn luyện thủ công hoặc kỹ thuật đặc trưng. Mô hình được huấn luyện hoàn toàn trên hàng trăm triệu bộ dữ liệu tổng hợp được tạo ra thông qua các mô hình nhân quả cấu trúc và vượt trội hơn các thuật toán truyền thống như XGBoost trên benchmark TabArena. TabFM sẽ được tích hợp vào Google BigQuery, cho phép người dùng chạy các dự đoán chỉ với một lệnh SQL đơn giản.
Google Research đã giới thiệu TabFM, một mô hình nền tảng mới được thiết kế dành riêng cho phân loại và hồi quy dữ liệu dạng bảng. Mô hình sử dụng phương pháp học trong ngữ cảnh (in-context learning - ICL), coi toàn bộ tập dữ liệu như một prompt thống nhất để diễn giải mối quan hệ giữa các cột và hàng tại thời điểm suy luận, loại bỏ nhu cầu tinh chỉnh siêu tham số và kỹ thuật đặc trưng. TabFM tổng hợp điểm mạnh từ các kiến trúc như TabPFN và TabICL thành một thiết kế lai mới để xử lý tính hai chiều và không thứ tự của bảng. Được huấn luyện hoàn toàn trên hàng trăm triệu tập dữ liệu tổng hợp được tạo ra bằng mô hình nhân quả cấu trúc (structural causal models - SCMs), TabFM khái quát hóa tốt với dữ liệu thực tế chưa từng thấy. Được đánh giá trên chuẩn TabArena với 38 tập dữ liệu phân loại và 13 tập dữ liệu hồi quy, mô hình liên tục vượt trội so với các thuật toán có giám sát được tinh chỉnh kỹ như XGBoost. TabFM sẽ được tích hợp vào Google BigQuery, cho phép người dùng thực hiện hồi quy và phân loại nâng cao chỉ với một lệnh SQL AI.PREDICT đơn giản.
Nguồn: Google Research —
bản gốc
