이전 목록

Meituan, LongCat-Video-Avatar 1.5 오픈소스 공개: 사실적인 디지털 휴먼 영상 프레임워크

Meituan Open-Sources LongCat-Video-Avatar 1.5: Photorealistic Digital Human Video Framework

TL;DR AI

핵심 요약

1분
  1. 메이투안이 상용 활용을 겨냥한 디지털 휴먼 영상 프레임워크 LongCat-Video-Avatar 1.5를 오픈소스로 공개했다.

  2. 오디오 인코딩을 Whisper-Large로 바꿔 입술 동기화와 아바타 사실감을 높였다.

  3. DMD2 단계 증류를 적용해 추론을 8단계로 줄여 생성 속도를 크게 개선했다.

  4. 대규모 사용자 연구를 포함한 평가에서 전반적인 품질도 우수한 것으로 나타났다.

원문 보기