언어 바꾸기English
이전 목록

Lens: 기반 텍스트-이미지 모델의 학습 효율성 재고

Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

TL;DR AI

핵심 요약

1분
  1. Lens는 38억 파라미터의 컴팩트한 텍스트-투-이미지 모델로, 더 큰 시스템과 비슷하거나 더 나은 성능을 내면서도 Z-Image 학습 연산의 약 19.3%만 사용했다.

  2. 이 모델은 촘촘한 캡션이 달린 Lens-800M 데이터셋과 멀티 해상도 배치, 그리고 효율성 중심의 최적화 기법으로 학습됐다.

  3. 다국어 생성과 다양한 종횡비를 지원해 실제 활용 범위가 넓다.

  4. 또한 RL 미세조정과 4스텝 증류 turbo 버전을 제공해 더 빠른 추론이 가능하다.

원문 보기