대규모 언어 모델 사전학습에 미치는 데이터 시계열성의 영향 이해
Understanding the Impact of Data Temporality on Large Language Model Pre-training
TL;DR AI
1분핵심 요약
연구 결과, 시간 순서대로 정렬된 Common Crawl 데이터로 사전학습한 LLM은 셔플 학습 모델보다 더 최신 정보에 강하고 시간 인식도 높았습니다.
7,000개가 넘는 질문으로 구성된 벤치마크에서, 순서형 모델은 더 나은 시간적 근거와 사실의 최신성을 보였습니다.
일반 언어 작업 성능은 경쟁력을 유지해, 시간 순서를 보존하는 학습이 신뢰성을 높이면서도 범용 성능을 해치지 않음을 보여줬습니다.
