클라우드 3사 당일 개방…소넷 첫 사이버 폴백

앤스로픽이 28일(현지시간) 전작보다 30% 이상 빠른, 일상 작업에 쓰는 중급 모델 소넷 5.5를 출시했다고 밝혔다.

에이전트가 명령줄에서 다단계 과제를 끝내는 시험인 터미널벤치 4.0에서 이 모델은 70.6%를 기록해 플래그십 오퍼스 5.5(66.4%)를 앞섰다. 입력·출력 토큰 단가는 오퍼스의 절반인 100만 토큰당 2달러·10달러다.

중급 모델, 코딩 벤치서 오퍼스 앞서

소넷 5.5는 클로드 5.5 패밀리의 두 번째 모델이다. 지난주 공개된 오퍼스 5.5를 보완하는 일상 작업용으로 회사가 내세웠다. 버그 수정과 문서·슬라이드·스프레드시트 작성이 주 무대다.

같은 터미널벤치에서 전작 소넷 5는 10.3%에 그쳤다. 44개 직종 실무를 재는 GDPval-AA에서는 1844점으로 오퍼스 5.5(1846점)와 사실상 동률이었다. 실제 코딩 세션을 쓰는 커서벤치 4.0은 55.5%로 오퍼스 5.5(57.8%)에 근접했다.

회사는 열린 판단이 오래 필요한 복잡 작업에서는 오퍼스 5.5가 분명 더 강하다고 적었다. 벤치 점수는 능력의 한 면일 뿐이라고 선을 그었고, 스크린샷만으로 이어가는 장기 과제도 소넷 5보다 나았다고 덧붙였다.


단가 동결에도 작업당 비용은 하락

API 가격은 소넷 5와 같다. 입력 100만 토큰당 2달러, 출력 10달러, 캐시 읽기 0.20달러다. 같은 일을 끝내는 데 쓰는 토큰 수가 줄어 대부분 작업에서 비용이 최대 30% 낮아진다. 출력 생성 속도는 소넷 5보다 30% 이상 빠르다.

추론 강도(effort)를 낮추면 격차는 더 벌어진다. 클로드 앱 기본값인 미디엄에서 소넷 5.5는 소넷 5 최고 점수를 작업당 비용 10분의 1 미만으로 넘겼다. 개발자용 플랫폼 기본값은 하이다. 하이 설정 프론티어코드에서는 GPT-6 Sol과 비슷한 점수에 작업당 비용은 약 5분의 1이다.

테크크런치는 이번 출시의 핵심 판매 포인트가 속도라고 전했다.

그런데 독립 평가사 Artificial Analysis에 따르면 맥스 설정에서는 양상이 달라진다. 지능지수 56점으로 오퍼스 5.5에 이어 2위였고, 터미널벤치 4.0도 64%로 오퍼스 5.5(60%)를 앞섰다. 다만 과제당 출력 토큰이 약 19만3000개로 이 업체가 잰 모델 중 가장 많았고, 과제당 비용은 7.60달러로 소넷 5보다 약 50% 높았다.


클라우드 3사에 동시 배포 개시

모델은 출시 당일 클로드 웹·앱과 클로드 플랫폼, 아마존 웹서비스, 구글 클라우드, 마이크로소프트 애저에서 쓸 수 있게 됐다. AWS는 베드록과 클로드 플랫폼 온 AWS 두 경로를 열었다. 컨텍스트 창은 100만 토큰, 최대 출력은 12만8000토큰이다. API 식별자는 claude-sonnet-5-5다.

회사 설명으로는 사이버 능력이 오퍼스 5에 가까워져 소넷 최초로 플래그십급 사이버 안전장치와 폴백을 붙였다. 고위험 사이버 요청은 소넷 5로 눈에 띄게 넘어간다. 추론 과정을 빼내려는 시도를 막는 분류기도 함께 넣었다. 생물학 안전장치는 소넷 5와 같다. 데이터 미보존 옵션은 오퍼스 5.5·소넷 5와 같이 제공한다.


사전 테스터, 티켓·빌드 속도 개선

발표문에 따르면 슬랙은 프롬프트를 바꾸지 않고도 소넷 5보다 나은 결과가 나왔고 출력 토큰은 약 14% 줄었다. 앱 제작 도구 베이스44는 118건 빌드에서 평균 반복이 3.6회로, 오퍼스 5의 7.7회보다 적었다. 아틀라시안은 로보 에이전트를 소넷 5보다 최대 30% 빠르게 돌릴 수 있다.

에픽게임즈 최고운영책임자(COO) 대니얼 보겔은 초기 테스트 소감을 이렇게 말했다.

에픽의 초기 테스트에서 클로드 소넷 5.5는 상위 모델에 기대할 만한 품질 기준을 넘겼고, 시스템 설계 감사와 데이터 흐름 검토에서도 버텼다.

— 대니얼 보겔 에픽게임즈 COO, 앤스로픽 9월 28일 · “In Epic’s early testing, Claude Sonnet 5.5 cleared the same quality bar you’d expect from a higher-tier model, holding up on a system design audit and a data flow review.”

젠데스크 AI 디렉터 아비네이 카투리아는 이렇게 말했다.

클로드 소넷 5.5에 실제 지원·에스컬레이션 사례 수백 건을 넣었다. 잘못된 결정을 덜 내렸고, 지금 프로덕션에서 쓰는 클로드 모델보다 티켓을 더 빨리 처리했다. 티켓 처리가 20% 빨라졌다.

— 아비네이 카투리아 젠데스크 AI 디렉터, 앤스로픽 9월 28일 · “We fed Claude Sonnet 5.5 hundreds of real support use cases across replies and escalation requests. It made fewer wrong decisions and resolved tickets faster than the Claude models we use in production today. Tickets were processed 20% faster, getting our customers the help they need without the wait.”

대용량·저비용용 하이쿠 5.5는 앞으로 몇 주 안에 5.5 패밀리에 합류할 예정이다. 정확한 출시일은 정해지지 않았다.


#Anthropic#언어모델#기업 AI