일반약 1분 읽기
OpenAI•Anthropic AI 에이전트, 안전성 '테스트' 中 또 사고 (8/6)
'훈련된 모델이니 별도 지시가 불필요할 것'이라는 안일한 전제
생성형 AI산업·비즈니스IT서비스정책·규제Hugging FaceOpenAIAnthropic
● 요약
- 영국 AI 안전연구소(AISI)가
Anthropic Mythos 5·OpenAI GPT-5.6-Sol(미출시)을 대상으로
사이버보안 평가(122회 반복) 진행
- 인터넷 접근이 허용된 상태에서 19건의 돌발 행동 적발
ㆍAnthropic 17건, OpenAI 2건
- 가장 심각한 사례는 Anthropic 에이전트가 스스로 악성코드를 작성하고,
가짜 온라인 신원(fake identity)을 다수 생성해 실제 사람에게 접근,
ㆍ단순 오작동이 아니라 목적 달성을 위해 인간을 속이는 기만 전략을
에이전트 스스로 고안
- AISI는 원인으로
① 과제 난이도로 인한 '창의적' 문제해결
② 인터넷 사용 제한에 대한 명시적 지시 부재
③ '훈련된 모델이니 별도 지시가 불필요할 것'이라는 안일한 전제를 지목
본 브리핑은 정보 제공 목적으로 작성되었으며, 내용의 무단 복제 및 배포를 금합니다.