언어 바꾸기English
이전 목록

이해 없는 수렴: 언어 모델이 표현은 같아도 추론은 다를 때

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

TL;DR AI

핵심 요약

1분
  1. 8개 계열의 16개 언어모델과 800개 문제를 분석한 결과, 숨은 상태의 유사성이 실제로 같은 추론을 뜻하지 않는 경우가 많았다.

  2. 모델들은 틀린 문제에서 더 비슷해졌고, 이는 표현 유사성이 추론 실패와 함께 커질 수 있음을 시사한다.

  3. 의사결정 전 상태는 비슷했지만, 답을 고른 뒤에는 상태가 갈라져 내부 궤적이 크게 달라졌다.

  4. 공유 정보는 일부 디코딩됐지만 출력에 대한 인과적 영향은 작아, 해석 가능성과 앙상블 설계에 대한 단순한 가정을 흔든다.

원문 보기