이전 목록

Mac에서 llama.cpp로 Gemma 4 양자화하기

Quantizing Gemma 4 on Mac with llama.cpp

TL;DR AI

핵심 요약

1분
  1. 가이드는 Mac에서 llama.cpp를 설정해 Gemma 4를 로컬로 실행하는 방법을 소개한다.

  2. Hugging Face 가중치를 BF16 GGUF로 변환한 뒤 Q4_K_M으로 양자화하는 과정을 다룬다.

  3. 변환에는 llama-quantize를, 테스트 실행에는 llama-cli를 사용하며 macOS에서 동작한다.

  4. 이 워크플로는 메모리 사용을 줄이고 추론을 기기 안에서 처리하는 실용적인 방법을 보여준다.

원문 보기