테더, AI 메모리 압축 기술을 소비자용 기기에 도입
Tether Brings AI Memory Compression to Consumer Devices

TL;DR AI
1분핵심 요약
Tether가 소비자용 하드웨어에서 추론 중 LLM의 키-값 캐시를 압축하는 오픈소스 기법 TurboQuant를 공개했다.
이 방식은 모델 가중치는 그대로 두고 메모리 사용량을 대략 3~6배, 일부 사례에서는 약 5배까지 줄인다.
노트북과 스마트폰에서도 동작해 로컬 AI를 더 현실적으로 만들고, 더 긴 컨텍스트와 낮은 클라우드 의존을 가능하게 한다.
프롬프트 처리 속도는 느려지지만, 토큰 생성 속도는 거의 풀 프리시전 수준을 유지한다.



