PRX Phần 4: Chiến lược Dữ liệu của Chúng tôi – Xây dựng Kho ngữ liệu Tiền huấn luyện Đa dạng
Photoroom
Nhóm PRX của Photoroom trình bày chi tiết chiến lược dữ liệu của họ: tập hợp một tập dữ liệu tiền huấn luyện đa dạng từ các nguồn công khai và nội bộ, viết lại chú thích cho tất cả hình ảnh bằng VLM, và lưu trữ dữ liệu ở định dạng Lance để quản lý và MDS để truyền phát. Họ nhấn mạnh bề rộng hơn tính thẩm mỹ, sử dụng JPEG ở chất lượng 92, và tính toán các vector tiềm ẩn văn bản một cách động với Qwen3-VL.
Nhóm PRX của Photoroom chia sẻ chiến lược dữ liệu của họ để tiền huấn luyện một mô hình 7B sinh ảnh từ văn bản (text-to-image). Họ tập hợp dữ liệu huấn luyện từ sự kết hợp giữa các tập dữ liệu nội bộ và công khai, ưu tiên tính đa dạng và phạm vi rộng hơn là sự hoàn hảo của từng hình ảnh. Tất cả hình ảnh đều được chú thích lại bằng một mô hình ngôn ngữ - thị giác (VLM) để có các chú thích dài và nhất quán. Dữ liệu được lưu trữ ở định dạng Lance để phục vụ kỹ thuật tính năng (feature engineering) và khám phá, sau đó được chuyển đổi sang định dạng Mosaic Data Shards (MDS) cho quá trình huấn luyện phân tán. Hình ảnh được mã hóa dưới dạng JPEG với chất lượng 92, điều này cho thấy mức độ suy giảm chất lượng không đáng kể so với PNG. Các biểu diễn tiềm ẩn (latents) của văn bản được tính toán ngay trong quá trình huấn luyện bằng Qwen3-VL, chỉ tiêu tốn thêm 3-4% chi phí thông lượng (throughput). Nhóm đã xây dựng một giao diện người dùng (UI) để duyệt tập dữ liệu bằng cách sử dụng tìm kiếm toàn văn (full-text search) và tương tự vector (vector similarity), giúp đánh giá định tính và phát hiện sớm các vấn đề.
Nguồn: Hugging Face blog —
bản gốc
