에이전트 근무일 인간 3.1배…완전 RSI 안전 경로는 아직 없다

오픈AI가 인간 지도로 며칠치 연구 과제를 수행하는 ‘자동화된 연구용 인턴’을 갖췄다고 6일(현지시간) 공식 보고서에서 발표했다.

회사 자체 측정에 따르면 8월 중순 연구조직의 에이전트 근무일은 인간 근무일 대비 3.1배에 달했다. 인간 기준 4–8시간짜리로 추정된 성공 과제 중 절반 이상은 한 번 이상 인간 개입을 거쳤다.

연구 인턴은 명확한 과제만 맡는다

지난해 가을 공표한 9월 목표에 도달했다. 연구 인턴은 인간이 방향을 정한 뒤 명확히 정의된 연구 과제를 수행하는 시스템이다. 숙련 연구원이 며칠 걸릴 수준의 일도 범위에 넣었고, 외부 판매 제품이 아니라 내부 연구 역량의 기준점이다.

샘 알트먼 최고경영자(CEO)는 2025년 10월 라이브스트림에서 이 일정을 먼저 제시했다. Engadget에 따르면 그는 두 목표를 연구 프로그램의 핵심 축이라고도 했다.

내년 9월까지 인턴급 AI 연구 조수가, 2028년 3월까지는 제대로 된 AI 연구원이 나오는 것이 타당해 보인다.

— 샘 알트먼, Engadget 9월 6일 · “we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher.”

다음 단계는 2028년 3월까지 ‘자동 AI 연구원’을 만드는 일이다. 그 방향으로 강한 진전이 있다는 평가와 함께, 우선순위 설정과 결과 채택, 시스템 확대·중단·배포 결정은 사람이 한다.


에이전트 근무일이 인간을 추월했다

연초만 해도 연구조직의 에이전트 총 가동 시간은 인간 노동량보다 적었다. 6월을 넘기며 관계가 역전됐다. 8월 중순 기준 표준 8시간 근무일로 환산하면 인간 1근무일당 에이전트 3.1근무일이 투입됐다.

중간값 연구자는 API 가격 기준 하루 600달러가 넘는 추론을 에이전트에 썼다. 상위 10%는 하루 7,000달러를 넘겼다. eWeek는 이 수치가 연구 생산성 3.1배를 뜻하지 않는다고 짚었다. 연구자가 직접 켠 에이전트와 하위 에이전트의 동시 가동을 합친 총 가동 시간이라는 설명이다.

맡기는 일의 구성도 바뀌었다. 에이전트 토큰을 Epoch AI의 연구개발 분류로 나눠 집계한 결과다. 연구·인프라 코드 작성이 여전히 가장 크지만, 기술 지원과 실험 모니터링 비중도 늘었다.

네 개 이상 에이전트를 동시에 돌리는 연구자 수가 늘었다. 8월 실험 건수는 2025년 1월 추적 시작 이후 최고치를 기록했다. 같은 기간 가용 연산량도 함께 늘었고, 코딩 에이전트 코덱스 채택 확대와도 맞물렸다.


4–8시간 과제도 개입이 남았다

1월부터 7월까지 난이도별 성공률은 대체로 올랐다. 과제 시간이 길어질수록 개입 빈도는 더 높았다. 고수준 기획이 에이전트 산출에서 차지하는 비중은 여전히 작다.

일부 팀은 실험 장애를 돕는 대면 상담 참석이 줄었다. 한 팀은 세션을 중단하고 다른 시스템 개선에 힘을 돌렸다. 내부 기술 지원 채널의 게시물 수도 줄었다.

적용연구 책임자 보리스 파워는 29일 개발자 행사 기간 오픈AI 안에 AI 연구 인턴이 있고, 컴퓨터 사용 속도·비용 최적화를 그 시스템이 자율 생성했다고 밝혔다.


완전 RSI 안전 경로는 미정이다

정렬된 완전 재귀적 자기개선에 안전하게 이르는 방법을 우리는 아직 모른다.

— 오픈AI, 공식 보고서 9월 6일 · “We do not yet know how to safely get all the way to aligned, full RSI.”

위험을 충분히 막을 수 없다고 판단하면 개발이나 배포를 늦추거나 멈출 수 있다. 책임 있게 진행되면 자동화된 연구가 정렬과 방어에도 도움이 될 수 있다. 다만 빠른 재귀적 자기개선 자체를 반드시 추구해야 한다는 뜻은 아니다.

이번 마일스톤의 측정 기준과 성공 판정은 모두 내부 집계다. 에이전트 측정 자체도 아직 초기 단계다. 외부 기관이 같은 과제로 재현·검증했는지는 공개되지 않았다.


#에이전트#AI 안전