오픈채팅 이름과 설명 문구로 유해성을 판단하는 모델 개발
Developing a Model to Assess Harmfulness from Open Chat Names and Descriptions

TL;DR AI
1분핵심 요약
LINE AI Services Lab이 오픈챗 이름과 설명만으로 유해 여부, 징계 코드, 징계 사유까지 예측하는 모더레이션 모델을 개발했다.
기존 수동 검수 기록을 정제한 학습 데이터를 사용했고, 디코더 기반 Granite Guardian 3.1 2B에 LoRA를 적용해 학습했다.
이 모델은 대규모로 생성·수정되는 오픈챗을 자동 검수해 사람의 검수 부담을 줄이도록 설계됐다.
또한 더 넓은 범위와 더 정교한 기준으로 유해한 챗의 사용자 노출을 막는 데 도움이 된다.