연구모델 🇺🇸 27.07.2026 08:03

PRX 4부: 데이터 전략 – 다양한 사전 학습 코퍼스 구축

PhotoroomPhotoroom
Photoroom의 PRX 팀이 데이터 전략을 상세히 설명합니다: 공개 및 내부 소스에서 다양한 사전 학습 데이터셋을 구성하고, 모든 이미지를 VLM으로 다시 캡션화하며, Lance에 데이터를 저장하여 큐레이션하고 MDS로 스트리밍합니다. 미적 요소보다 폭에 중점을 두고, JPEG 품질 92를 사용하며, Qwen3-VL로 텍스트 잠재 변수를 즉석에서 계산합니다.
Photoroom의 PRX 팀이 7B 텍스트-이미지 모델 사전 학습을 위한 데이터 전략을 공유합니다. 공개 데이터셋과 내부 데이터셋을 혼합하여 학습 데이터를 구성하며, 개별 이미지의 완벽성보다 다양성과 폭을 우선시합니다. 모든 이미지는 일관되고 긴 캡션을 위해 VLM을 사용하여 다시 캡셔닝됩니다. 특징 엔지니어링과 탐색을 위해 데이터를 Lance 형식으로 저장한 후, 분산 학습을 위해 Mosaic Data Shards (MDS)로 변환합니다. 이미지는 JPEG로 인코딩되며 품질은 92로 설정되어 PNG 대비 무시할 수준의 품질 손실을 보입니다. 텍스트 잠재 변수는 학습 중 Qwen3-VL을 사용하여 실시간으로 계산되며, 이로 인한 처리량 비용은 3-4%에 불과합니다. 팀은 전체 텍스트 검색과 벡터 유사도를 활용해 데이터셋을 탐색할 수 있는 UI를 구축하여 정성적 평가와 초기 문제 탐지를 가능하게 했습니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스