언어 바꾸기English
이전 목록

PiD: 픽셀 디퓨전을 활용한 빠르고 고해상도 잠재 디코딩

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

TL;DR AI

핵심 요약

1분
  1. PiD는 잠재 표현을 픽셀 공간에서 직접 디코딩하는 픽셀 디퓨전 디코더를 제안한다.

  2. 시그마 인지(latent) 조건화와 DMD2 증류를 적용해 추론 단계를 4단계로 줄였다.

  3. VAE 및 시맨틱 latent를 메가픽셀 이미지로 업스케일하면서 지연 시간과 메모리 사용을 낮춘다.

  4. RTX 5090과 GB200 같은 고성능 GPU에서 계단식 초해상도 파이프라인보다 더 나은 시각적 품질을 목표로 한다.

원문 보기