언어 바꾸기English
이전 목록

대형 언어 모델의 Paged Attention

Paged Attention in Large Language Models LLMs

TL;DR AI

핵심 요약

2분
  1. 모델 구성 토큰당 KV 저장에 524,288 바이트를 사용한다 32 레이어, 32 헤드, 헤드 차원 128, fp16 저장.

  2. 나이브 할당기 요청당 2048 토큰 분량의 메모리를 미리 할당한다, mAX_SEQ_LEN이 2048 토큰으로 설정됨.

  3. 요청 사용량 평균적으로 500 토큰 분량의 메모리를 실제로 사용한다, aVG_RESPONSE가 500 토큰으로 설정됨.

  4. 나이브 할당기 예시에서 요청당 약 1024 MB가 예약된다, kV_BYTES_PER_TOKEN과 MAX_SEQ_LEN 기반 계산.

  5. 요청 사용량 요청당 실제로 기록되는 메모리는 약 250 MB이다, aVG_RESPONSE와 KV_BYTES_PER_TOKEN 기반.

원문 보기