이전 목록

Unweight: 품질 저하 없이 LLM을 22% 압축한 방법

Unweight: how we compressed an LLM 22% without sacrificing quality

TL;DR AI

핵심 요약

1분
  1. Cloudflare가 LLM 가중치를 무손실로 압축하는 Unweight를 공개해 모델 크기를 15%~22% 줄였다.

  2. Llama-3.1-8B 기준으로 약 3GB의 VRAM을 절감하면서도 출력은 그대로 유지한다.

  3. Unweight는 NVIDIA H100 GPU에서 온칩 디컴프레션과 작업별 실행 전략을 활용한다.

  4. 가중치를 줄이되 품질은 유지해 GPU당 더 많은 모델을 돌릴 수 있어, 비용 절감과 추론 속도 향상에 도움이 된다.

원문 보기