Moonshot AI, FlashKDA 오픈소스 공개: 가변 길이 배칭과 H20 벤치마크를 지원하는 Kimi Delta Attention용 CUTLASS 커널
Moonshot AI Open-Sources FlashKDA: CUTLASS Kernels for Kimi Delta Attention with Variable-Length Batching and H20 Benchmarks

TL;DR AI
1분핵심 요약
문샷 AI가 MIT 라이선스로 FlashKDA를 오픈소스로 공개했습니다. 이는 Kimi Delta Attention용 CUTLASS 기반 CUDA 커널입니다.
회사는 NVIDIA H20 GPU에서 flash-linear-attention 대비 프리필 속도가 1.72배에서 2.22배 빨라졌다고 밝혔습니다.
FlashKDA는 가변 길이 배칭도 지원해 실제 서비스 환경에서 배포와 운영을 더 쉽게 만듭니다.
이번 공개로 Moonshot AI의 Kimi Linear 스택은 긴 컨텍스트 LLM 추론 효율을 더 높일 수 있게 됐습니다.
