MaxText, 후훈련 기능 확장: 단일 호스트 TPU에서 SFT와 RL 도입
MaxText Expands Post-Training Capabilities: Introducing SFT and RL on Single-Host TPUs

TL;DR AI
1분핵심 요약
MaxText가 단일 호스트 TPU 환경에서의 포스트 트레이닝을 지원하며, v5p-8과 v6e-8에서 SFT와 RL 워크플로를 제공한다.
이번 업데이트는 Hugging Face 데이터셋과 체크포인트를 지원해, 더 작은 TPU 구성에서도 JAX 기반 학습을 쉽게 만든다.
또한 vLLM 기반 추론과 함께 GRPO, GSPO 같은 RL 기법을 추가해 더 고도화된 학습 루프를 가능하게 한다.
이로써 지시문 튜닝과 추론 중심 적응의 진입 장벽이 낮아지고, 이후 대규모 확장으로 이어질 수 있다.