오픈 웨이트 AI 모델 확산과 추론 요금 경쟁이 동시에 격화된다
메타·알리바바·Z.ai가 소비자 GPU로 구동 가능한 오픈 웨이트 에이전트 모델을 동시에 공개하고 구글이 추론 요금을 절반으로 내리는 한편 딥시크는 요금을 대폭 올리는 등, 오픈 웨이트 확산과 추론 요금 경쟁이 양방향으로 격화되며 AI 모델 가격·접근성이 시장 판도의 새 변수가 된다.
주차별 근거 타임라인
근거 (supporting)
- 2026-W34
오픈 웨이트 모델 공개와 추론 요금 조정이 같은 주에 다발로 박힌 개시 주간. 메타가 8·10 300억 파라미터 오픈 에이전트 AI 모델 'Muse Glimmer'를 Apache 2.0 라이선스로 공개했고 단일 소비자용 GPU로 구동 가능하며 코딩·파일 처리·멀티스텝 워크플로를 지원한다. 알리바바도 27.78B 파라미터의 Qwen3.8-27B를 Apache 2.0으로 공개하고 멀티모달·262K 컨텍스트·단일 소비자 GPU 구동을 지원했으며, Z.ai는 재훈련 없이 GLM-5.3을 출시해 Terminal-Bench 3.0 코딩 점수를 4.6에서 28.3으로 끌어올렸다. 가격 축에서는 구글이 8·13 Gemini 3.7 Flash를 이전 Flash 모델 대비 절반 가격(입력 100만 토큰당 $0.75)에 출시해 코딩 성능을 향상시킨 반면, 딥시크는 V4-Pro를 공개하면서 V4-Pro·V4-Flash API 요금을 모델·토큰 유형·시간대에 따라 50~1,100% 인상(8·17 적용, 피크·오프피크 이중 요금제)했다. 소비자 GPU 구동 오픈 웨이트 모델 확산과 추론 요금의 양방향 조정이 같은 주에 명시적으로 관측됨.
- 2026-W36
오픈 웨이트 확산과 추론 요금 조정이 W36에도 같은 주에 이어진 주간. Google DeepMind가 코딩 강화 모델 Gemini 3.8 Flash를 출시해 AI 분석 지수 59점(전작 대비 +3)·입력 100만 토큰당 0.75달러로 책정했고, 딥시크는 3050억 파라미터 멀티모달 모델을 오픈소스로 공개했다. 같은 주 공개된 OpenAI GPT-6 Astra는 입력 100만 토큰당 10달러·출력 50달러로 책정됐다. 오픈 웨이트 공개(딥시크 305B)와 추론 요금의 양극화(Gemini 3.8 Flash 저가·GPT-6 고가)가 다시 관측 — supporting은 W34·W36 2개 주차 누적, 보수적 active 유지.
에디터 노트
분석 노트
W34에 처음 등장한 명제다. 그동안 AI 자본 사이클은 데이터센터·HBM·공모 상장 같은 인프라·자본 축(2026-W14-01, 2026-W23-07)이나 안전·거버넌스 축(2026-W30-11, 2026-W31-12)으로 추적돼 왔으나, W34에는 모델 자체의 배포 방식과 가격이 새 변수로 같은 주에 다발로 박혔다. 메타 Muse Glimmer(Apache 2.0)·알리바바 Qwen3.8-27B(Apache 2.0)·Z.ai GLM-5.3의 오픈 웨이트 공개가 소비자 GPU 구동 에이전트 모델의 확산을 가리키고, 구글 Gemini 3.7 Flash의 절반 가격 인하와 딥시크 V4-Pro의 최대 1,100% 요금 인상이 추론 요금 경쟁이 양방향으로 벌어지고 있음을 보여준다. weekly의 AI·기술 카테고리가 이를 'AI 오픈모델 가격전쟁 격화'로 명시하며 다섯 개 이상의 공개·가격 이벤트를 같은 페이지에 정렬한 점이 추출 근거다.
이 명제의 추적 가치는 이 다발이 일회성 출시 클러스터인지, 아니면 오픈 웨이트 확산과 추론 단가 조정이 반복되며 AI 시장 접근성·마진 구조를 재편하는 상수인지다. 후속 검증대는 추가 개발사의 오픈 웨이트 공개 지속 여부, 구글·딥시크 요금 조정 이후 경쟁사의 대응, 소비자 GPU 구동 모델의 실제 채택 규모다. 오픈 웨이트 공개와 요금 인하가 반복되면 명제가 강화되고, 딥시크식 요금 인상이 확산되거나 오픈 공개가 폐쇄로 되돌아가면 반증 축이 열린다. W34 단일 주차 데이터인 만큼 보수적으로 active에서 출발한다.