실드스트랄
Shieldstral
TL;DR AI
1분핵심 요약
연구진은 콘텐츠 검열용 3B 파라미터 정책 적응형 멀티모달 안전 분류 모델인 Shieldstral을 공개했다.
이 모델은 모더레이션을 이진형 질의응답으로 재구성하고, 여러 안전 데이터셋을 하나의 학습 체계로 통합한다.
약 5,410만 개의 선별·생성 샘플로 학습했으며, 텍스트 안전 벤치마크에서 7배 가까이 큰 모델과 비슷하거나 더 나은 성능을 보였다고 보고됐다.
Shieldstral은 멀티모달 안전 분류에서도 새로운 최고 성능을 기록해, 더 작은 안전 모델도 대형 시스템에 필적할 수 있음을 시사한다.
