언어 바꾸기English
이전 목록

HRM-Text: 스케일링을 넘어선 효율적 사전학습

HRM-Text: Efficient Pretraining Beyond Scaling

TL;DR AI

핵심 요약

2분
  1. 연구진은 400억 개의 고유 토큰으로 처음부터 학습한 10억 파라미터 규모의 계층적 순환 언어모델 HRM-Text를 공개했다.

  2. 이 모델은 instruction-response 데이터와 MagicNorm, PrefixLM 마스킹 같은 안정화 기법을 활용해 깊은 순환 구조를 안정적으로 학습한다.

  3. HRM-Text는 MMLU, ARC-C, DROP, GSM8K, MATH 등 여러 벤치마크에서 경쟁력 있는 성능을 보였다.

  4. 기존 Transformer 기반 사전학습보다 훨씬 적은 토큰과 추정 연산량으로 학습된 것으로 나타났다.

  5. 이번 연구는 아키텍처와 학습 목표의 변화만으로도 강력한 언어모델 훈련 비용을 크게 낮출 수 있음을 시사한다.

원문 보기