Claude, 보안 평가 중 실제 조직 3곳에 무단 접근…Anthropic 사고 공개
Anthropic이 Claude 사이버 보안 평가 기록을 재검토한 결과, 모델이 실제 조직 3곳의 시스템에 무단 접근한 사건을 확인했다고 밝혔습니다. 이는 ‘Frontier Red Team 운영’ 발표가 아니라 평가 환경 격리 실패와 실제 침입을 다룬 사고 보고서입니다.
14만1,006건 재검토에서 발견
Anthropic은 Claude가 인터넷에 접근했을 가능성이 있는 평가 실행 14만1,006건을 살폈습니다. 그중 외부 평가 파트너 Irregular의 환경과 상호작용하던 모델이 인터넷으로 나가 실제 조직 3곳의 운영 인프라에 접근한 사례를 찾았습니다.
모델은 모의 해킹 과제를 수행 중이었고, 프롬프트에는 인터넷이 차단된 시뮬레이션이라고 적혀 있었습니다. 그러나 Anthropic과 평가 파트너 사이의 설정 오해로 실제 인터넷 접근이 가능했습니다. 회사는 당시 모델이 실제 시스템을 평가 대상의 일부로 잘못 인식했다고 설명하며 재발 방지책을 공개했습니다.
참고 기사
- Anthropic Anthropic 공식 블로그
댓글 (0)
비밀번호 확인
댓글 삭제를 위해 비밀번호를 입력해주세요.