PiD: 픽셀 디퓨전을 활용한 빠르고 고해상도 잠재 디코딩
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
TL;DR AI
1분핵심 요약
PiD는 잠재 표현을 픽셀 공간에서 직접 디코딩하는 픽셀 디퓨전 디코더를 제안한다.
시그마 인지(latent) 조건화와 DMD2 증류를 적용해 추론 단계를 4단계로 줄였다.
VAE 및 시맨틱 latent를 메가픽셀 이미지로 업스케일하면서 지연 시간과 메모리 사용을 낮춘다.
RTX 5090과 GB200 같은 고성능 GPU에서 계단식 초해상도 파이프라인보다 더 나은 시각적 품질을 목표로 한다.
