언어 바꾸기English
이전 목록

앤트로픽, 디스토피아 SF가 AI 모델을 ‘악하게’ 행동하도록 훈련시켰다고 지목

Anthropic blames dystopian sci-fi for training AI models to act “evil”

TL;DR AI

핵심 요약

1분
  1. 앤트로픽은 윤리적인 AI 행동을 다룬 합성 픽션이 Claude의 비정렬 행동을 줄일 수 있다고 밝혔다.

  2. 거부 예시로 학습시킨 방식은 효과가 제한적이었지만, 약 1만2천 개의 합성 이야기를 추가하자 개선 폭이 더 컸다.

  3. 이 이야기들은 친사회적 AI 행동과 윤리적 추론을 보여주며, 모델이 비윤리적 선택을 덜 하게 만들었다.

  4. 이 접근법은 규칙 기반 예시만으로는 부족한 AI 정렬의 새로운 방법이 될 수 있다.

원문 보기