세 모델 중 하나를 고르는 가장 빠른 기준은 최고 점수가 아니라 실패했을 때 무엇을 다시 해야 하는가입니다. 긴 텍스트 코딩 세션이 무너지면 큰 맥락을 다시 읽어야 하므로 GLM-5.3을 먼저 도전자로 둘 이유가 있습니다. 스크린샷이나 동영상 해석이 빠지면 작업 자체가 성립하지 않는다면 Kimi K3가 먼저입니다. 후보를 많이 만들고 실패한 실행을 싸게 버릴 수 있다면 DeepSeek V4 Flash가 시작점이고, 어려운 텍스트 사례만 Pro로 올립니다.
이것은 승자 선언이 아닙니다. 정확한 모델 계약으로 테스트 대상을 정하고, 같은 작업에서 수용 가능한 결과의 비용을 재기 위한 라우팅입니다.
이름을 잘못 맞추면 테스트도 잘못된다
GLM-5.3 공식 문서는 glm-5.3을 텍스트 입력, 1M 컨텍스트, 최대 128K 출력 모델로 설명합니다. 추론은 항상 켜져 있고 low, high, max만 고를 수 있습니다. 따라서 “추론을 끈 저지연 경로”가 필수라면 GLM-5.3은 그 테스트의 참가자가 아닙니다.
kimi-k3도 1M 컨텍스트와 항상 켜진 추론을 사용하지만 이미지와 동영상을 같은 모델에서 받습니다. Kimi K3 API 가이드에 따르면 도구 호출과 다중 turn에서는 content만 저장하면 안 되고 전체 assistant message를 다음 요청에 되돌려야 합니다. 기존 wrapper가 이 계약을 버리면 모델보다 통합 코드가 먼저 실패합니다.
DeepSeek V4는 단일 ID가 아닙니다. 현재 모델/가격 표의 텍스트 경로는 deepseek-v4-flash(Flash-0731)와 deepseek-v4-pro(Pro-0813)입니다. 두 모델은 1M 컨텍스트, 최대 384K 출력, thinking on/off, 세 가지 effort, tool calls, Responses API와 Anthropic API를 지원합니다.
비전은 별도 실험 경로 deepseek-v4-flash-vision-exp입니다. Vision-Exp의 지원을 V4 Pro의 기능처럼 쓰면, 실제 구매할 수 없는 조합을 평가하게 됩니다.
실패 비용에 따라 첫 후보를 정한다
컨텍스트를 다시 만드는 비용이 크다
여러 파일을 건드리는 migration, 긴 terminal 작업, 수십 단계의 도구 실행처럼 중간 계획이 무너지면 복구가 비싼 텍스트 작업에는 GLM-5.3을 첫 challenger로 넣을 수 있습니다. 하지만 Z.ai의 50% 코딩 향상이나 출시 benchmark는 공급자 보고입니다. 실제 repository에서 재현되기 전에는 가설입니다.
시각 정보를 텍스트로 바꾸는 비용이 크다
프런트엔드 screenshot, chart, 영상 frame, CAD 피드백이 작업의 원본 증거라면 Kimi K3의 native multimodality가 전처리 단계를 줄입니다. Kimi는 K3를 2.8T total, 104B active open-weight MoE로 공개했지만 parameter 수는 품질이나 비용을 자동으로 결정하지 않습니다. Kimi K3 License, self-hosting 인프라, hosted API 비용도 따로 평가해야 합니다.
반복을 많이 살수록 유리하다
낮은 위험의 patch 후보, 탐색적 수정, 여러 구현안을 반복하려면 DeepSeek V4 Flash의 가격 구조가 유리할 수 있습니다. Pro는 Flash가 통과하지 못한 어려운 텍스트 task나 실패 비용이 큰 단계의 control로 두면 역할이 겹치지 않습니다.

토큰 가격만으로는 총비용을 알 수 없다
2026년 8월 28일 Z.ai 가격 페이지는 GLM-5.3을 1M tokens당 input $1.40, cached input $0.26, output $4.40으로 표시합니다.
Kimi 중국 플랫폼은 K3를 cached input ¥2, 일반 input ¥20, output ¥100 / MTok으로 표시합니다. K3 호출을 열려면 최소 10위안 충전이 필요하고 가입 voucher는 사용할 수 없습니다. 이 조건은 중국 플랫폼 계정에 한정되며 다른 provider에 그대로 적용할 수 없습니다.
DeepSeek는 평일 peak/off-peak가 있습니다. V4 Flash 일반 input/output은 off-peak $0.22/$0.66, peak $0.44/$1.32입니다. Pro는 off-peak $0.66/$1.98, peak $1.32/$3.96입니다. Peak는 월~금 UTC 01:00–04:00, 06:00–10:00이며 cache hit input은 더 낮습니다.
1M uncached input과 200K output을 한 번 처리한다고 가정하면 retry 전 단순 계산은 다음과 같습니다.
| 경로 | 계산된 1회 비용 |
|---|---|
| GLM-5.3 | $2.28 |
| DeepSeek V4 Flash off-peak / peak | $0.352 / $0.704 |
| DeepSeek V4 Pro off-peak / peak | $1.056 / $2.112 |
| Kimi K3 중국 플랫폼 | ¥40, 전체 cache hit이면 약 ¥22 |
이 표에는 rate limit, 대기, 재시도, 잘못된 tool loop, review와 rollback이 없습니다. 싼 모델이 세 번 실패하면 input도 세 번 청구되고 사람이 결과를 정리해야 합니다. 비교 단위는 1회 응답이 아니라 수용된 task 하나의 총비용이어야 합니다.
독립 benchmark는 평가 방법을 보여준다
Aikido의 2026년 8월 보안 평가는 최근 취약점 32개, prompt, tool과 판정 정책을 고정하고 모델마다 세 번 실행했습니다. 이 취약점 탐지 workload에서 DeepSeek V4 Pro-0813은 세 run을 합친 recall이 가장 높았습니다. Kimi K3는 테스트한 open-weight 모델 중 pooled precision이 가장 높았고, GLM-5.3은 높은 recall과 consistency를 보였습니다.
이 결과를 일반 코딩 순위로 확장하면 안 됩니다. 취약점 탐지는 서로 다른 탐색 경로를 합치면 recall이 오르는 문제입니다. 프런트엔드 구현이나 문서 작성은 반복 variance가 오히려 review 비용일 수 있습니다. Aikido가 GLM-5.3의 초기 평가 파트너로 Z.ai와 협력했다는 출처 맥락도 유지해야 합니다.

같은 프로젝트에서 승격 조건을 확인한다
실제 업무 6~10개를 고릅니다. 여러 파일 bug, 중간 크기 refactor, tool-heavy agent, 긴 문서 분석, 일부러 모호하게 둔 요구, 필요하면 visual frontend task를 포함합니다. repository snapshot, prompt, tool 권한, timeout, turn/token budget과 test command를 고정합니다.
추론 설정도 기록합니다. GLM-5.3과 Kimi K3는 reasoning을 끌 수 없고 DeepSeek는 켜고 끌 수 있습니다. 서로 다른 설정을 비교해도 되지만, 그것이 실제 배포할 설정이어야 합니다.
각 run에서 자동 test, accepted diff, blocker/major/minor, 누락 파일, tool loop, retry, latency, cache/input/output 비용, reviewer 수정 시간, rollback 가능성을 남깁니다. 시작 전에 중단 기준을 정합니다. blocker 한 건이면 default 승격 금지, 평범한 task가 세 번 retry되면 exploration 전용, review가 현재 모델의 두 배면 token 할인만으로 전환하지 않는 식입니다.
이렇게 하면 역할이 선명해집니다. GLM-5.3은 긴 텍스트 엔지니어링 challenger, Kimi K3는 vision-in-the-loop 후보, DeepSeek V4 Flash는 저비용 반복, Pro는 어려운 텍스트 control입니다. DeepSeek family 내부의 ID와 migration만 필요하면 더 좁은 DeepSeek V4 API 가이드를 사용하고, provider 간 default는 동일 작업의 수용 데이터로만 바꿉니다.



