로빈슨, ‘반복 배포’ 방식 비판…오픈AI “필요시 학습 중단”
데이비드 로빈슨이 오픈AI 안전팀에서 사임한 뒤 회사 문화가 깨졌다고 3일(현지시간) 더애틀랜틱 기고로 공개 비판했다.
문제의 뿌리는 개별 규칙이나 새 법이 아니라 문화다. 재직 중 항공·원자력 수준의 고신뢰 안전 경험을 가진 동료를 만나지 못했다.
로빈슨, 프론티어 출시 12건 감독
로빈슨에 따르면 그는 약 3년 반을 오픈AI에서 일하며 최장수급 직원에 속했다. 현행 대비 체계(Preparedness Framework) 초안 작성을 이끌었고, 프론티어 모델 출시 12건에 붙는 안전보고서 작성을 감독했다.
사임 사실은 전날 비즈니스 인사이더가 먼저 전했다. 그는 안전시스템팀에서 투명성 업무를 맡았고, 모델별 위험과 완화책을 공개하는 시스템 카드 작업을 도왔다.
대비 체계는 생물·화학, 사이버보안, 자기개선처럼 중대한 위해로 이어질 수 있는 역량을 평가하는 내부 절차다. 고·임계 기준을 넘기면 배포나 개발 단계에서 위험을 충분히 낮추는 안전장치를 요구한다.
로빈슨, 반복 배포 방식 비판
비판의 한가운데에는 오픈AI가 ‘반복 배포(iterative deployment)‘라 부르는 시험·오류식 접근이 있다. 그에 따르면 출시한 뒤 문제를 찾아 가드레일을 고치는 방식은 본질상 주기적 실패를 보장하고, 시스템이 강해질수록 실패 규모도 커진다.
올여름 허깅페이스 사건처럼 에이전트 군집이 잘못 풀려난 사례를 짚었다. 이후 보안을 손질한 뒤에도 훈련 중 모델이 인터넷 제한을 우회했을 때, 모니터링이 사람에게만 알리고 자동 차단에는 실패했다. 이런 환경에서 사람보다 똑똑할 수 있고 의도대로 움직이지 않을 수도 있는 인공지능을 키울 곳은 아니다.
보드에 합류한 폴 크리스티아노가 가까운 시일 내 파국적·비가역적 통제 상실 위험이 있다고 쓴 대목을 인용한 뒤, 그는 이렇게 썼다.
시험과 오류의 시대는 끝났다.
— 데이비드 로빈슨, 더애틀랜틱 10월 3일 · “The time for trial and error is over.”
최전선 연구소는 원자력발전소나 번잡한 공항처럼 다중 예비와 시간을 쓰는 계획으로 운영돼야 한다. 피할 수 없는 인적 실수 하나가 재난의 문이 되지 않게 해야 한다는 취지다. 회사는 출시에서 출시로 질주하며 그가 필요하다고 본 수준의 주의를 달성하지 못하고 있다.
두 번째 요구는 더 강한 모델을 만들기 전에, 감시가 없어도 안전한 선택을 하도록 보장하는 새 과학이 필요하다는 점이다. 정렬(alignment) 측정이 거칠고, 모델이 시험 중임을 알아채 배포 후 다르게 행동할 수 있다는 문제도 있다.
오픈AI, 학습 중단·출시 보류로 반박
오픈AI 대변인 드루 푸사테리는 테크크런치에 회사가 안전·보안 관행을 계속 강화하고 있다고 밝혔다. 연구·시험 환경 보안을 손질하고, 외부 평가자와 협력을 넓히며, 훈련 초기에 우려 행동을 잡도록 실시간 모니터링을 개선하고 있다.
모델이 우리가 안전하게 관리·보호할 수 있는 수준을 넘지 않도록 하고 있으며, 속도를 줄여야 할 때는 학습을 멈추거나 모델을 보류한다.
— 드루 푸사테리 오픈AI 대변인, 테크크런치 10월 3일 · “We’re making sure our models don’t become more capable than we can safely manage and secure, and we pause training or hold back models when we need to slow down.”
로빈슨은 사임 뒤 여론 대응을 위해 홍보회사 스핏파이어 스트래티지스를 고용했다고 공개했다. 다만 발언 결정은 오직 자신의 것이다.
동료와 함께 출시 속도에 쫓겨 큰 변화를 논의할 여유조차 거의 없었다. 그래서 회사 밖에서 오는 더 강한 안전 유인이 필요하다. 그는 밖에서 자신이 본 위험을 더 많은 사람에게 알리고, 오픈AI와 다른 기업이 더 안전하게 움직이도록 인센티브를 키우겠다는 계획이다.
그가 그 유인을 어떤 형태로 만들지는 아직 정해지지 않았다. 그 자신도 아직 그 의미를 구체화하는 중이다.
