2.4조 파라미터 MoE 플래그십, 장기간 자율 작업·오픈 웨이트로 중국 모델 경쟁 가속

발표 개요와 핵심 스펙

Alibaba Qwen 팀이 2026년 8월 3일(현지 기준) Qwen3.8-Max를 공식 출시했다. 이 모델은 Qwen 시리즈 최대·최고 성능 플래그십으로 자리매김하며, 처음으로 Max급 모델의 가중치를 공개하겠다는 계획을 밝혔다.

주요 스펙은 다음과 같다.

  • 총 파라미터 2.4조(trillion), Mixture-of-Experts(MoE) 아키텍처로 쿼리당 활성 파라미터 약 950억(95B)
  • 컨텍스트 윈도우 최대 100만 토큰
  • 네이티브 멀티모달(텍스트·이미지·비디오 입력 지원)
  • API 가격: 입력 2/M토큰,출력2/M 토큰, 출력 6/M 토큰, 캐시 입력 $0.25/M 토큰
  • 현재 Alibaba Cloud Model Studio·QwenCloud·QwenWork에서 즉시 이용 가능
  • Qwen3.8-Max와 함께 Qwen3.8-27B 버전의 오픈 웨이트를 다음 주 Hugging Face·ModelScope에 공개 예정 (Max급 최초 오픈 웨이트)

이 발표는 7월 중순 프리뷰 이후 정식 출시로, Alibaba가 최근 일부 플래그십을 클로즈드 전략으로 운영하다가 다시 오픈 웨이트로 선회한 신호로 해석된다.


강조된 능력과 실증 사례

Qwen3.8-Max의 핵심 포지셔닝은 ‘한 번의 질문-답변’을 넘어 장기간(수일–수십 일) 자율 실행엔드투엔드 결과물 산출이다.

자율 코딩과 장기 에이전트 작업

멀티모달과 실무 워크로드

  • 수백 페이지 문서, 전체 TV 시리즈, 100시간 라이브스트림을 검색 가능한 지식 베이스로 변환
  • 스크린샷에서 앱 재구성, 2D 도면을 3D 시각화, 영상 편집·애니메이션 생성 등 시각 피드백 루프를 활용한 작업 가능

이러한 사례는 모델이 단순한 생성기가 아니라 ‘시스템 수준 자율 계획 + 폐쇄 루프 학습’을 지향한다는 점을 부각한다.


벤치마크와 성능 위치

Alibaba가 공개한 내부·Arena 결과와 독립 매체 보도를 종합하면 다음과 같다.

독립 검증은 아직 초기 단계다. Artificial Analysis 등 일부 인덱스는 아직 상위권이 아닌 중상위권으로 평가하는 경우도 있어, 벤치마크 의존도가 높은 발표의 한계가 동시에 지적된다. 그럼에도 비용 대비 성능과 장기 작업 데모가 결합되면서 개발자·기업 양측의 관심이 빠르게 확산됐다.


시장 영향 심층 분석

오픈소스·로컬 커뮤니티 관점

다음 주 예정된 2.4T급과 27B 가중치 공개는 중국 오픈 웨이트 모델의 스케일 경쟁을 한 단계 끌어올린다. Moonshot Kimi K3(2.8T)에 이어 대형 MoE가 연속 등장하면서, 양자화·로컬 실행·하이브리드 배포 논의가 가속화될 가능성이 크다. 특히 27B는 개인·소규모 팀의 접근성을 크게 높일 것으로 예상된다.

기업·프로덕션 관점

2/2/6 가격은 미국 프론티어 모델 대비 명확한 비용 이점을 제공한다. 장기간 자율 작업 능력이 실제 프로덕션에서 안정적으로 재현된다면, DX·AI 조직의 ‘Thick Spoke + Thin Hub’ 구조에서 로컬·프라이빗 선택지를 재검토하게 만드는 촉매가 될 수 있다. 반면 장기 실행 안정성, 환각 관리, 거버넌스 레이어 필요성은 여전히 기업 도입의 핵심 변수다.

글로벌 경쟁 구도

중국 내에서는 Kimi K3와의 파라미터·성능 경쟁이, 글로벌에서는 Claude Fable 5·GPT-5.6 계열과의 비용·오픈성 경쟁이 동시에 진행 중이다. Alibaba가 Max급을 오픈하는 선택은 “성능은 클로즈드, 배포는 오픈”이라는 기존 이분법을 흔드는 움직임이다. 이는 미국 랩들의 가격 정책과 오픈 전략에도 간접 압박을 가할 수 있다.

기술적·평가 패러다임 변화

단순 벤치마크 점수보다 ‘수일 단위 자율 실행 + 실제 산출물’이 새로운 평가 축으로 부상하고 있다. Qwen3.8-Max의 데모는 이 흐름을 강화하며, 향후 agentic harness·장기 메모리·폐쇄 루프 학습 연구가 더욱 중요해질 전망이다.


주의점과 향후 관전 포인트

현재까지 공개된 장기 작업 사례와 일부 벤치마크는 Alibaba 내부 또는 선별된 환경에서 나온 결과다. 독립적이고 광범위한 재현 검증은 아직 제한적이다. 오픈 웨이트 공개 시점·라이선스·실제 추론 효율(활성 파라미터 대비 실제 지연·비용)도 확인이 필요하다.

다음 주 가중치 공개 이후에는

  • 실제 로컬·양자화 성능
  • 장기 에이전트 작업의 재현성
  • 기업 워크로드에서의 ROI
  • 다른 중국·미국 모델과의 헤드투헤드 비교

가 본격적인 논의 대상이 될 것이다. Qwen3.8-Max는 단순한 모델 업그레이드를 넘어, “오픈 웨이트 프론티어 + 장기 자율성”이라는 두 축에서 2026년 하반기 AI 경쟁의 중요한 이정표로 기록될 가능성이 높다.


#언어모델#오픈웨이트#에이전트