공정성 프루닝: 차등 활성화를 통해 GLU-MLP 계층의 인구통계학적 편향 찾기
Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
TL;DR AI
1분핵심 요약
연구진은 GLU-MLP 레이어의 일부 뉴런을 0으로 만들면 소형 LLM의 인구통계학적 편향을 줄일 수 있음을 보였다.
'Fairness Pruning'은 대조 프롬프트 쌍으로 민감하게 반응하는 뉴런을 찾아, 추가 학습 없이 편향을 완화한다.
최소 5개 뉴런만 제거해도 편향된 출력이 크게 바뀌었고, 40개 뉴런 테스트에서도 성능의 99.49%를 유지했다.
이 방법은 소비자용 하드웨어에서 실행 가능하며, 코드와 데이터셋도 공개됐다.
