언어 바꾸기English
이전 목록

Claude 스타일 추론으로 증류된 Qwen3.5 모델을 GGUF 및 4비트 양자화로 실행하는 코드 구현

A Coding Implementation to Run Qwen3.5 Reasoning Models Distilled with Claude-Style Thinking Using GGUF and 4-Bit Quantization

TL;DR AI

핵심 요약

2분
  1. Claude-style thinking으로 증류된 Qwen3.5 추론 모델을 GGUF와 4비트 양자화로 실행하는 코드 구현.

  2. 단일 플래그로 27B GGUF 변형과 경량 2B 4비트 버전 간 전환 가능; MODEL_PATH는 '2B_HF'로 설정되어 있고 코드가 '27B_GGUF' 값을 확인해 설치 경로를 결정함.

  3. Colab 파이프라인이 구성되어 있으며 실행 시작 시 GPU 가용성을 검증하고 GPU 이름과 총 VRAM(GB)을 출력; GPU가 없으면 런타임 오류를 발생시키며 런타임 타입을 T4 GPU로 변경하라는 메시지를 표시함.

  4. 종속성 설치는 경로에 따라 llama.cpp 또는 transformers와 bitsandbytes를 설치하도록 구성되어 있으며, CUDA 가용성 및 장치 정보 확인에는 torch를 사용함.

  5. 다중 턴 상호작용을 위한 ChatSession 클래스가 구현되어 있고, <think> 트레이스를 파싱해 추론과 최종 출력물을 분리하는 유틸리티가 포함됨.

원문 보기