Mac에서 llama.cpp로 Gemma 4 양자화하기
Quantizing Gemma 4 on Mac with llama.cpp

TL;DR AI
1분핵심 요약
가이드는 Mac에서 llama.cpp를 설정해 Gemma 4를 로컬로 실행하는 방법을 소개한다.
Hugging Face 가중치를 BF16 GGUF로 변환한 뒤 Q4_K_M으로 양자화하는 과정을 다룬다.
변환에는 llama-quantize를, 테스트 실행에는 llama-cli를 사용하며 macOS에서 동작한다.
이 워크플로는 메모리 사용을 줄이고 추론을 기기 안에서 처리하는 실용적인 방법을 보여준다.