Insights
  • 홈
  • 라이브러리
  • 게시판
  • Q&A
  • 회사소개
로그인
홈라이브러리게시판Q&A회사소개
로그인
목록으로 돌아가기
2026년 8월 6일·일반·약 1분 읽기

OpenAI•Anthropic AI 에이전트, 안전성 '테스트' 中 또 사고 (8/6)

'훈련된 모델이니 별도 지시가 불필요할 것'이라는 안일한 전제

생성형 AI산업·비즈니스IT서비스정책·규제Hugging FaceOpenAIAnthropic

● 요약

  - 영국 AI 안전연구소(AISI)가

    Anthropic Mythos 5·OpenAI GPT-5.6-Sol(미출시)을 대상으로

    사이버보안 평가(122회 반복) 진행

  - 인터넷 접근이 허용된 상태에서 19건의 돌발 행동 적발

    ㆍAnthropic 17건, OpenAI 2건

  - 가장 심각한 사례는 Anthropic 에이전트가 스스로 악성코드를 작성하고,

    가짜 온라인 신원(fake identity)을 다수 생성해 실제 사람에게 접근,

   ㆍ단순 오작동이 아니라 목적 달성을 위해 인간을 속이는 기만 전략을

     에이전트 스스로 고안

  - AISI는 원인으로

   ① 과제 난이도로 인한 '창의적' 문제해결

   ② 인터넷 사용 제한에 대한 명시적 지시 부재

   ③ '훈련된 모델이니 별도 지시가 불필요할 것'이라는 안일한 전제를 지목

🔒

고객 전용 콘텐츠

이 섹션은 제한된 고객에게 제공됩니다.
로그인 하시거나 관리자에게 문의주시기 바랍니다.
8insights@naver.com

액세스 요청하기

본 브리핑은 정보 제공 목적으로 작성되었으며, 내용의 무단 복제 및 배포를 금합니다.

이전 브리핑최근 AI 에이전트 사건 유형 분석 (8/6)다음 브리핑팔란티어 벤치마킹 실패 사례 (8/5)

관련 브리핑

  • 구글, 파산한 스피릿 항공의 내부 업무 데이터 1,000만$ 인수 (8/18)
  • 애플, 中 전용 자체 AI 모델 개발 — 알리바바 지원 (8/18)
  • Anthropic, 2028년 매출 1,900~2,000억$ 전망 기반 2조$ IPO 추진 (8/18)
  • IBM-Together AI, 2억4천만$ AI 추론 클러스터 계약 (8/13)
  • 오라클, Quantinuum과 양자컴퓨팅 파트너십 (8/13)