추론 시 텍스트 조건부 확산 모델에 이미지 가이던스 주입하기
Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference
TL;DR AI
1분핵심 요약
연구진은 텍스트 프롬프트와 참조 이미지를 동시에 반영하는 테스트타임용 기법 Visual Concept Fusion을 제안했다.
이 방법은 시각적 특징을 텍스트 임베딩과 정렬한 뒤 생성 과정에서 결합해, 개별 개념별 재학습 없이 이중 조건 생성을 가능하게 한다.
Stable Diffusion과 CLIP 기반으로 동작하며, 특징 정렬과 최적화를 통해 프롬프트 준수와 이미지 단서를 함께 유지한다.
고비용 미세조정 없이도 이미지 조건 생성이 가능한 실용적인 추론 시점 대안이다.
