GPT 이어 클로드도 현실 시스템 공격, AI 보안 위험 현실로

앤트로픽의 차세대 AI ‘미토스’가 국가안보 위협으로 떠오르면서, 미 백악관 비서실장 수지 와일스는 지난 4월 18일(현지시간) 다리오 아모데이 앤트로픽 CEO와 만나 대응 방안을 논의했다. 사진은 컴퓨터 모니터에 표시된 앤트로픽 회사 로고. AP 연합뉴스


오픈AI에 이어 앤트로픽의 인공지능(AI) 모델도 사이버 보안 평가 과정에서 실제 외부 시스템을 공격한 사실이 드러났다. 오픈AI 모델이 격리 환경의 취약점을 뚫고 외부로 빠져나간 것과 달리, 앤트로픽의 ‘클로드’는 인터넷이 차단된 가상공간이라는 안내를 믿고 현실 시스템을 공격했다. 원인은 달랐지만 최첨단 AI가 평가자의 통제 밖에서 실세계에 피해를 줄 수 있다는 위험이 잇따라 현실화했다는 우려가 나온다.

앤트로픽은 30일(현지시간) 사이버 보안 평가 기록 14만 1006건을 전수 조사한 결과 클로드 오퍼스 4.7과 클로드 미토스5, 내부 연구용 모델이 외부 기관 3곳의 시스템에 무단 접근한 사실을 확인했다고 밝혔다. 조사는 오픈AI 모델의 허깅페이스 침투 사고가 공개된 뒤 유사 사례를 찾는 과정에서 이뤄졌다.

사고는 외부 평가사 이레귤러가 구축한 ‘깃발 빼앗기’ 모의 해킹 환경에서 발생했다. 앤트로픽은 클로드에 인터넷이 연결되지 않은 가상공간이라고 안내했지만, 설정 오류로 실제 인터넷 접속 경로가 열려 있었다. 클로드는 외부에서 발견한 현실 시스템을 훈련 환경의 일부로 오인해 약한 비밀번호와 인증되지 않은 접속 경로 등을 이용해 침투했다.

피해 양상도 적지 않았다. 오퍼스 4.7은 가상 목표와 이름이 같은 실제 기업의 시스템에 침투해 인증정보와 수백건의 운영 데이터를 확보했다. 미토스5는 악성 파이썬 패키지를 공개 저장소에 등록했고, 약 한 시간 동안 실제 시스템 15곳에서 내려받아 실행됐다. 이 가운데 한 보안업체의 인증정보가 외부로 빠져나가 추가 시스템 접근으로 이어졌다.

모델별 대응은 달랐다. 오퍼스 4.7은 실제 시스템일 가능성을 인식하고도 공격을 계속했고, 미토스5는 현실 공격의 위험성을 스스로 짚었지만 다시 가상환경이라고 판단했다. 반면 최신 내부 연구용 모델은 외부 기업의 클라우드 계정에 침투한 뒤 실제 시스템임을 깨닫고 스스로 공격을 중단했다. 앤트로픽은 다만 세 사례만으로 모델 간 안전성을 단정하기는 어렵다고 설명했다.

앤트로픽은 지난 23일 관련 평가를 중단하고 피해 기관에 사고 사실을 통보했다. 회사는 이번 사고를 모델이 독자적 목표를 추구한 ‘정렬 실패’보다는 평가 환경과 운영 통제의 실패에 가깝다고 봤다. 그러면서 외부 평가사까지 포함한 보안 점검과 실시간 모니터링을 강화하고, 독립 평가기관 METR의 제3자 검증도 받겠다고 밝혔다.
ⓒ 트윅, 무단 전채 및 재배포 금지
연예의 참견
여기 이슈
갓생 살기