Lens: 기반 텍스트-이미지 모델의 학습 효율성 재고
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
TL;DR AI
1분핵심 요약
Lens는 38억 파라미터의 컴팩트한 텍스트-투-이미지 모델로, 더 큰 시스템과 비슷하거나 더 나은 성능을 내면서도 Z-Image 학습 연산의 약 19.3%만 사용했다.
이 모델은 촘촘한 캡션이 달린 Lens-800M 데이터셋과 멀티 해상도 배치, 그리고 효율성 중심의 최적화 기법으로 학습됐다.
다국어 생성과 다양한 종횡비를 지원해 실제 활용 범위가 넓다.
또한 RL 미세조정과 4스텝 증류 turbo 버전을 제공해 더 빠른 추론이 가능하다.
