LLM은 변화하는 사용자 의도에 혼란을 겪는다
LLMs Get Lost in Evolving User Intent
TL;DR AI
1분핵심 요약
새 연구는 사용자 의도가 대화 중에 변하는 다중 턴 상황에서 LLM을 평가했다.
연구진은 단일 턴 벤치마크를 의도 공개, 수정, 전환이 가능한 통제된 대화로 바꿨다.
그 결과 여러 모델 계열에서 성능이 크게 떨어졌고, 바뀌는 의도를 제대로 추적하지 못하는 것으로 나타났다.
이는 정적 벤치마크가 놓치기 쉬운 한계를 보여주며, 좋은 답변이 곧바로 좋은 대화형 지원을 뜻하지는 않는다.