이전 목록

프롬프트 인젝션 공개: 4개 연구소 비교

Prompt injection disclosures: 4 labs compared

TL;DR AI

핵심 요약

1분
  1. Anthropic, OpenAI, Google, Meta의 공개 자료를 비교한 결과, 프롬프트 인젝션 위험을 보고하는 공통 기준은 아직 없는 것으로 나타났다.

  2. Anthropic은 네 가지 공격 표면을 나눠 가장 자세한 시스템 카드를 공개했으며, 보호장치 적용 전 브라우저 공격 성공률이 31.5%라고 밝혔다.

  3. OpenAI는 연결 도구에 대한 단일 견고성 점수만 제시했고, Google은 이를 더 넓은 안전 프레임워크에 포함했으며, Meta는 폐쇄형 모델 카드를 내놓지 않았다.

  4. 전문가들은 이런 제각각의 공개 방식 때문에 구매자와 보안팀이 모델을 비교하거나 공통 벤치마크를 세우기 어렵다고 지적한다.

원문 보기