적응적 사고: 대규모 언어 모델은 잠재 공간에서 언제 생각해야 하는지 안다
Adaptive Thinking: Large Language Models Know When to Think in Latent Space

TL;DR AI
1분핵심 요약
연구진은 프리필링 단계의 hidden state로 질문 난도를 예측하는 경량 어댑터 Sonata를 제안했다.
Sonata는 self-consistency를 신호로 활용해 생성 전에 더 많은 또는 더 적은 thinking budget을 배분한다.
여러 모델과 추론 벤치마크에서 thinking token을 크게 줄이면서도 정확도는 유지하거나 소폭 향상했다.
이 방법은 도움이 될 때만 추가 추론에 계산을 쓰는, 더 효율적인 LLM 추론 가능성을 보여준다.