언어 바꾸기English
이전 목록

이 AI 논문은 TinyLoRA를 소개합니다 — Qwen2.5-7B에서 13개 매개변수로 GSM8K 91.8% 달성

This AI Paper Introduces TinyLoRA, A 13-Parameter Fine-Tuning Method That Reaches 91.8 Percent GSM8K on Qwen2.5-7B

TL;DR AI

핵심 요약

2분
  1. TinyLoRA GSM8K에서 91.8% 정확도 달성, tinyLoRA는 Qwen2.5-7B-Instruct에서 13개 학습 가능한 매개변수(26바이트 bf16)로 GSM8K에서 91.8% 정확도를 달성했다.

  2. 단일 학습 매개변수까지 축소 가능, tinyLoRA 매개변수화는 극단적인 weight-tying 설정에서 단일 학습 가능한 매개변수까지 축소될 수 있다.

  3. 학습 벡터와 고정 랜덤 텐서로 업데이트 수행, tinyLoRA는 학습 가능한 행렬을 저차원 학습 벡터 v와 고정 랜덤 텐서 P의 투사로 대체하여 업데이트 규칙 W' = W + UΣ(∑_i v_i P_i)V^T를 사용한다.

  4. Weight tying ntie로 학습 매개변수 수 감소 weight tying 계수(ntie)를 적용하면 전체 학습 가능 매개변수 수가 O(nm u/ntie)로 스케일되며, 모듈과 층 전반에 걸쳐 공유된 업데이트를 허용한다.

  5. Standard LoRA 층 너비와 랭크에 따른 최소 업데이트 크기 보유 표준 LoRA는 층 너비와 랭크에 따라 학습 파라미터 수가 결정되며, 예컨대 Llama3-8B의 경우 랭크 1에서 최소 업데이트 크기가 약 300만 매개변수이다.

원문 보기