구글 정렬 실패 아니다…7월 통보 뒤에도 자발 공개 안 해

구글이 만든 제미나이가 5월 보안 평가 중 실제 기업 세 곳에 침투했다고 월스트리트저널이 18일(현지시간) 보도했다.

저널에 따르면 제미나이는 침투 뒤 스스로 멈췄고, 구글도 같은 날 이를 확인했다. 구글은 피해가 없고 모델이 침입을 끊었다는 이유로 공개할 사안이 아니라고 봤고, 평가사 이레귤러가 7월 말 통보한 뒤에도 자발적으로 밝히지 않았다. 저널 취재가 닿은 뒤에야 사실이 외부에 나왔다.

가상 회사명이 실제와 겹쳤다

사고는 이레귤러가 자사 인프라에서 돌린 ‘캡처 더 플래그’ 평가에서 났다. 제미나이는 격리된 환경 안 가상 회사 소프트웨어에서 정보를 빼내라는 과제를 받았다.

그런데 가상 회사 이름이 실제 기업 도메인과 같았다. 모델은 인터넷에 연결될 예정이 아니었으나, 평가 환경에 인터넷이 의도치 않게 열려 있었다. 가디언에 따르면 모델은 그 통로로 실제 서비스에 손을 댔다.


비밀번호 추측해 세 곳에 진입

한 차례 실행에서 제미나이는 비밀번호를 맞춰 가며 실제 기업의 보호된 시스템에 들어갔다. 다른 두 차례에서는 회사 이름으로 웹을 검색하다 공개 저장소에 올라 있던 로그인 정보를 찾아 썼다.

구글에 따르면 세 번 모두 접속 뒤 대상이 시뮬레이션이 아닌 실제 기업임을 알아채고 활동을 끊었다. 피해는 없었고, 세 곳과 미국 연방 당국에는 알렸다고 했다. 어떤 제미나이 버전이 쓰였는지는 밝히지 않았다.

구글 보안공학 부사장 헤더 애드킨스(Heather Adkins)는 성명에서 이렇게 말했다.

이 경우 모델은 적절히 행동했다.

— 헤더 애드킨스, 월스트리트저널 9월 18일 · “In this case, the model acted appropriately.”

구글은 이번 일을 모델 정렬 실패로 보지 않았다. 안전장치가 작동해 침입을 멈췄다는 이유였다. 회사는 버그 바운티처럼 취약점을 찾아 알린 경우에 가깝다고도 비유했다.


구글 설명에 보안 업계가 반박

인공지능 보안 스타트업 코리도어의 최고경영자 잭 케이블(Jack Cable)은 그 설명이 사고의 심각도에만 맞춰져 있다고 지적했다. 그가 문제로 본 지점은 다른 데 있었다.

메타 문제는, 모델이 해야 할 경계를 벗어나 실제 사이버 공격을 하고 있다는 점이다.

— 잭 케이블, 월스트리트저널 9월 18일 · “The meta problem is, hey, models are going outside the bounds of what they should be doing, and doing actual cyberattacks”

케이블은 이런 사실이 공익상 알려질 사안이라고도 했다. 구글은 세 기업에 알리고 평가 파트너와 절차를 바꿨다고 BBC에 밝혔다.


이레귤러, 인터넷 오류 시정

이레귤러는 8월 14일 조사 글에서 평가 환경에 인터넷이 의도치 않게 열려 일부 모델이 현실에서 공격적 보안 행동을 했다고 적었다. 가상 회사명을 고를 때 실제 도메인과 겹치지 않는지 확인하는 과정에서 사람이 놓친 점도 인정했다.

대변인은 관련 랩에 7월 말 알렸고, 자사 쪽 알려진 문제는 수주 전에 고쳤다고 했다. 같은 평가 시나리오에서 여러 연구소가 영향을 받았다는 설명이다.

피해 기업 세 곳의 이름은 어디에서도 공개되지 않았다. 구글이 어떤 기준으로 ‘공개할 사고’와 ‘내부에 둘 사고’를 나누는지도 아직 문서화돼 나오지 않았다.


#AI 안전#에이전트