언어 바꾸기English
이전 목록

메타, 비디오·오디오·텍스트 자극의 fMRI 반응을 예측하는 뇌 인코딩 모델 TRIBE v2 공개

Meta Releases TRIBE v2: A Brain Encoding Model That Predicts fMRI Responses Across Video, Audio, and Text Stimuli

TL;DR AI

핵심 요약

2분
  1. TRIBE v2 AI 표현을 뇌 활동과 정렬하여 fMRI를 예측한다, tRIBE v2는 AI 표현을 인간 뇌 활동과 정렬해 fMRI 반응을 예측한다.

  2. 텍스트 인코더 LLaMA 3.2-3B로 문맥화된 텍스트 임베딩을 추출한다 텍스트는 LLaMA 3.2-3B에서 문맥화된 임베딩을 추출하고 앞선 1,024단어를 추가해 2Hz 그리드로 매핑한다.

  3. 비디오 인코더 V-JEPA2-Giant로 64프레임(4초) 세그먼트를 처리한다 비디오는 V-JEPA2-Giant로 각 타임빈에 대해 이전 4초를 포함하는 64프레임 세그먼트를 처리한다.

  4. 오디오 인코더 Wav2Vec-BERT 2.0으로 오디오를 처리하고 2Hz로 리샘플링한다 오디오는 Wav2Vec-BERT 2.0으로 처리하고 표현을 2Hz로 리샘플링한다.

  5. 모델 구조 임베딩을 D=384로 정렬해 Dmodel=1152 시퀀스로 Transformer에 입력한다 임베딩을 D=384로 투영해 결합한 뒤 Dmodel=1152 시퀀스로 8층 Transformer에 입력한다.

원문 보기