ThinkOmni: 오디오 위조 탐지 및 위치 특정화를 위한 추론 기반 옴니모달 LLM 프레임워크
ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

TL;DR AI
1분핵심 요약
연구진은 오디오 위조 탐지와 시간적 위치 추정을 위한 추론 중심의 옴니모달 LLM, ThinkOmni를 제안했다.
이 모델은 10만 샘플 규모의 포렌식 추론 데이터셋과 의미·음향·스펙트럼 단서를 정렬하는 손실로 학습됐다.
ThinkOmni는 오디오 딥페이크의 탐지 성능과 조작 구간 단위의 위치 추정 성능을 모두 높인 것으로 보고됐다.
또한 여러 데이터셋 간 일반화 성능이 좋아, 다양한 공격 유형에서도 더 신뢰할 수 있는 분석을 목표로 한다.
