Unweight: 품질 저하 없이 LLM을 22% 압축한 방법
Unweight: how we compressed an LLM 22% without sacrificing quality

TL;DR AI
1분핵심 요약
Cloudflare가 LLM 가중치를 무손실로 압축하는 Unweight를 공개해 모델 크기를 15%~22% 줄였다.
Llama-3.1-8B 기준으로 약 3GB의 VRAM을 절감하면서도 출력은 그대로 유지한다.
Unweight는 NVIDIA H100 GPU에서 온칩 디컴프레션과 작업별 실행 전략을 활용한다.
가중치를 줄이되 품질은 유지해 GPU당 더 많은 모델을 돌릴 수 있어, 비용 절감과 추론 속도 향상에 도움이 된다.


