언어 바꾸기English
이전 목록

알리바바 Qwen 팀, 새로운 알고리즘으로 AI의 사고를 더 깊게 만든다

Alibaba's Qwen team makes AI models think deeper with new algorithm

TL;DR AI

핵심 요약

1분
  1. 알리바바 Qwen 팀이 토큰별 영향도로 보상을 주는 FIPO를 발표했다.

  2. FIPO는 후속 확률 변화량을 계산해 보상을 정하며 별도 가치 모델이 없다.

  3. Qwen2.5-32B-Base에서 CoT 길이가 약 4,000토큰에서 10,000토큰 이상으로 늘었다.

  4. AIME-2024 정확도는 50%에서 56%(최고 58%)로, AIME-2025는 38%에서 43%로 상승했다.

  5. 훈련 불안정을 막기 위해 감쇠와 극단치 필터링이 도입됐다.

원문 보기