언어 바꾸기English
이전 목록

RiT: 표현 공간에서는 바닐라 확산 트랜스포머로 충분하다

RiT: Vanilla Diffusion Transformers Suffice in Representation Space

TL;DR AI

핵심 요약

1분
  1. RiT-XL 체크포인트, 가중치, 평가 코드가 공개되며 ImageNet 256×256 생성용 모델을 사용할 수 있게 됐다.

  2. 이 모델은 고정된 DINOv2-Small 특징을 활용하고, 추가 증류 없이 표준 샘플링으로 동작한다.

  3. FID 성능은 CFG=1에서 1.45, CFG≈3.7과 Heun 25 step에서 1.14를 기록했다.

  4. 여러 기존 diffusion transformer 변형보다 좋은 결과로, frozen encoder만으로도 기본형 diffusion transformer가 매우 강력할 수 있음을 보여준다.

원문 보기