Vercel 당일 연동…Cognition 집계는 4.6보다 낮아

SpaceXAI가 21일(현지시간) 코딩·지식 작업에 쓰는 모델 Grok 4.7을 공개하고 Cursor·Grok Build·API에 당일 제공했다.

같은 날 코딩 에이전트 업체 Cognition은 FrontierCode 1.1 집계에서 Grok 4.7이 전작보다 낮다고 밝혔다. Artificial Analysis는 지능 지수가 2점 올랐지만 작업당 출력 토큰이 약 8만1000개로 전작의 두 배를 넘겼다고 집계했다.

가격·속도, 4.6과 그대로

회사 발표문에 따르면 Grok 4.7은 더 큰 베이스 모델을 쓰고, 수 시간이 걸리는 과제에 비중을 둔 강화 학습을 더 길게 돌렸다. 자기 검증과 긴 문맥 관리가 나아졌다. 속도는 Grok 4.6과 같다.

입력은 100만 토큰당 2달러, 출력은 100만 토큰당 6달러다. 빠른 변종은 출력 속도가 두 배이고 단가도 두 배다. 문맥 창은 50만 토큰이다.

어려운 작업에 더 오래 매달리고, 스스로의 결과를 더 꼼꼼히 확인한다.

— SpaceXAI, 발표문 9월 21일 · “It works longer on difficult tasks, checks its own work more carefully”

Vercel은 같은 날 AI Gateway·fx·eve에 모델을 올리고, 27일까지 40% 할인을 걸었다. 모델 ID는 spacexai/grok-4.7이다.


회사 벤치, 장시간 작업서 상승

발표문이 실은 CursorBench 4.0 점수는 46.3%다. Grok 4.6은 40.4%, GPT-5.6 Sol은 41.7%, Fable 5.1은 51.8%였다. 회사는 이 벤치에서 가격 대비 성능이 선두권이라고 적었다.

Terminal-Bench 4.0은 38.0%로, 전작 20.3%보다 17.7%포인트 올랐다. DeepSWE v1.1은 고노력 설정에서 71.0%, EEBench는 64.0%였다. AA Briefcase v1.1 Elo는 1657, Harvey Legal Agent Benchmark는 19.6%다.

세이프가드는 새로 짰다. LatchBio 바이오세이프티 벤치는 62.4%였다. 위험·악의적 사이버 과제용 HackerBench v0.3에서는 위험 이중용도 프롬프트의 3.3%만 통과했다.


Cognition, 집계 점수 하락 보고

Cognition은 Grok 4.7을 Devin 데스크톱과 CLI에 올렸다. FrontierCode 1.1에서 자바·고·루비의 어려운 다중 모듈 백엔드 과제에는 강하다. 의존성 소스를 읽고 통합 테스트로 끝까지 확인하는 방식이다.

요청받지 않은 변경까지 넣은 더 큰 디프를 만드는 경향 때문에 집계에서는 Grok 4.6보다 낮다.

— Cognition, Devin 블로그 9월 21일 · “It scores below Grok 4.6 on the aggregate because it tends to over-scope, producing larger diffs with changes not requested by the evaluation task”

Artificial Analysis는 xhigh 설정에서 지능 지수 46점을 기록했다고 밝혔다. 전작 high 대비 2점 상승이다. Grok Build와 묶은 Coding Agent Index는 56점으로 9점 올랐다. 다만 작업당 출력 토큰은 약 8만1000개로, Grok 4.6 high의 약 3만6000개보다 많았다.

회사 발표 수치와 제3자 재현이 어디서 더 어긋나는지는 아직 정해지지 않았다.


#언어모델#에이전트#AI 산업