언어 바꾸기English
이전 목록

FreeToken 소개: 단일 워크스테이션 GPU에서 753B GLM-5.2를 실행하는 엣지 네이티브 MoE 서빙 엔진

Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU

TL;DR AI

핵심 요약

1분
  1. UC 버클리와 UT 오스틴 연구진이 단일 개인용 기기에서 MoE 대규모 언어 모델을 구동하는 엣지 네이티브 서빙 엔진 FreeToken을 공개했다.

  2. FreeToken은 GPU·CPU·메모리·PCIe 대역폭에 맞춰 추론을 조정해 35B, 284B, 최대 753B 규모의 GLM-5.2 같은 모델 실행을 지원한다고 밝혔다.

  3. Apache-2.0으로 공개됐으며 CLI, PyPI 패키지, 데스크톱 앱과 OpenAI 호환 엔드포인트를 제공한다.

  4. 개발자와 소규모 팀은 클라우드 추론 비용을 줄이고 민감한 워크로드를 로컬 기기에서 처리할 수 있다.

원문 보기