저는 같은 코딩 작업을 하나의 API를 통해 Kimi K2.7 Code와 Claude Opus 4.8에 보낸 뒤, 돌아온 결과를 측정했습니다. 정확도에서는 둘이 동률이었습니다. 둘 다 SemVer 우선순위 함정과 숨겨진 interval-merge 버그를 정확히 잡아냈습니다. 하지만 Opus는 출력 토큰의 4분의 1만 사용하면서도 3~9배 더 빠르게 응답했고, 반면 Kimi는 리스트 가격 기준으로 작업당 비용이 약 46% 더 저렴했습니다. 그래서 선택은 어느 모델이 “더 똑똑한가”의 문제가 아닙니다. 비용에 민감한 코딩 작업이나 배치 코딩 작업을 한다면 Kimi K2.7이 가격 면에서 승자입니다. 낮은 지연 시간, 1M-token context, 또는 신뢰할 수 있는 최종 검토 모델이 필요하다면 Opus 4.8은 그만한 프리미엄 가치가 있으며, 많은 팀이 결국 두 모델 사이를 라우팅해 사용하게 됩니다.
실전 체험: 저는 같은 코딩 작업을 둘 다에 실행해 보았습니다
내가 테스트한 방법: 모델 ID는 kimi-k2.7-code와 claude-opus-4-8였고, 2026-07-13에 하나의 OpenAI-compatible gateway endpoint를 통해 호출했으며, 각 task마다 default parameters로 single-shot으로 실행했고 prompt caching은 사용하지 않았습니다. Latency는 클라이언트 측에서 측정한 wall-clock 기준이므로, 생성 시간만이 아니라 network와 queue time도 포함됩니다. 채점 전에 sanity check로 각 모델에게 자신을 식별해 달라고 요청했습니다(Kimi는 "made by Moonshot AI"라고 답했고, Opus는 Anthropic이라고 답했습니다); 이것은 routing check일 뿐, 버전의 증거는 아닙니다. 이것은 두 개 task로 이루어진 sample이며, benchmark가 아닙니다. 이는 체감할 수 있는 behavior를 보여줄 뿐이며, multi-turn agentic performance를 측정할 수는 없습니다.
Task 1에서는 각 모델에 SemVer 2.0.0 사양을 따르는 compare_semver() 함수를 구현하도록 했으며, 대부분의 구현이 틀리는 부분인 프리릴리스 우선순위까지 포함했습니다. 예를 들어 1.0.0-alpha.1 < 1.0.0-alpha.beta이고, 숫자 식별자는 영숫자 식별자보다 낮게 순위가 매겨지며, beta.11 > beta.2는 문자열 순서가 아니라 숫자 기준으로 비교됩니다. 저는 사양의 표준 순서를 바탕으로 만든 72개 비교 매트릭스와 대조해 각 답변을 채점했습니다. Task 2에서는 버그가 있는 merge_intervals() 함수를 제시했는데, 실제 결함은 max(...) 대신 last[1] = cur[1]를 사용한 것이었습니다. 이 한 줄 때문에 [1,10],[2,3] 같은 완전히 포함된 구간이 조용히 사라집니다. 저는 그 포함된 구간을 포함한 5개 사례를 기준으로 채점했습니다.

지표 | Kimi K2.7 Code | Claude Opus 4.8 |
|---|---|---|
작업 1 정확도 (72개 우선순위 + 엣지 케이스) | 72/72 | 72/72 |
작업 2 정확도 (포함 구간 포함 5개 사례) | 5/5 | 5/5 |
작업 1 지연 시간 (클라이언트 측) | 49.1s | 5.3s |
작업 2 지연 시간 (클라이언트 측) | 11.5s | 7.6s |
작업 1 토큰 수 (입력 / 출력) | 172 / 1,907 | 774 / 418 |
작업 1 비용 (기본 리스트 가격) | $0.0078 | $0.0143 |
비용은 위의 토큰 수를 기준으로 각 모델의 기본 요금표 가격으로 계산됩니다(Kimi는 입력/출력 100만 토큰당 $0.95/$4, Opus는 $5/$25): Kimi = 172×$0.95/M + 1,907×$4/M ≈ $0.0078; Opus = 774×$5/M + 418×$25/M ≈ $0.0143. 입력 토큰 수가 다르게 나온 이유(172 vs 774)는 작업이 달라서가 아니라, 각 모델의 토크나이저와 게이트웨이의 집계 방식이 동일한 프롬프트를 다르게 계산했기 때문입니다. 두 모델 모두 두 작업에서 완전히 올바른 코드를 생성했습니다. 차이는 그 결과에 도달하는 방식에 있었습니다. Opus는 간결하고 빠르게, Task 1에서 5.3초 만에 418개 토큰을 반환했습니다. Kimi는 49.1초가 걸렸고 1,907개 토큰을 출력했는데, 그중 상당수는 코드와 함께 반환된 단계별 추론 과정이었습니다. 그러나 Kimi의 토큰은 대략 6배 저렴하므로, 장황한 실행도 여전히 더 적은 비용이 들었습니다.
결투가 입증하는 것과 입증하지 못하는 것
이는 범위가 제한되고 명확하게 정의된 코딩 문제에서 Kimi K2.7 Code가 최전선 모델과 동일한 정답에 도달함을 입증합니다. 그러나 두 개의 단발성 작업만으로는 검증할 수 없는, 길고 다단계인 에이전트 세션에서 Kimi가 Opus와 대등하다는 것을 입증하지는 않습니다. Kimi의 가장 강력한 자체 주장은 바로 그 에이전트 영역에 있으며, 아래의 벤치마크가 이를 직접 다룹니다.
벤치마크: 서드파티와 Moonshot 자체 표의 차이점
다음은 출처별로 각 숫자가 표시된 세부 내역입니다. Moonshot의 자체 보고 표에서는 Kimi가 가장 강해 보이며, 독립 평가 결과는 모델이 최근에 나와 아직 더 적습니다. 또한 아직 제3자 K2.7 수치가 없는 경우에는 가장 가까운 공개 수치인 K2.6을 아래에 표시했습니다.
벤치마크 | Kimi K2.7 Code | Claude Opus 4.8 | 출처 |
|---|---|---|---|
MCPMark Verified (tool use) | 81.1 | 76.4 | Moonshot, self-reported |
SWE-bench Verified | 60.4% | same format으로는 미공개 | Moonshot, self-reported |
Intelligence Index | 35 (K2.6 proxy) | 56 | Artificial Analysis, third-party |
Output speed | ~45 tok/s (K2.6 proxy) | 59 tok/s | Artificial Analysis, third-party |
비교의 핵심이 되는 한 수치, MCPMark Verified 81.1 대 76.4는 독립 연구소가 아니라 Moonshot의 자체 표에서 나온 것입니다. 그렇다고 해서 이를 무시해야 한다는 뜻은 아닙니다. MCP 스타일의 도구 사용이 바로 Kimi가 튜닝된 영역이기 때문입니다. 하지만 "Kimi가 Opus를 이긴다"는 헤드라인은 벤더가 벤더에 최적화된 벤치마크에서 내세우는 주장으로 읽어야 합니다. 외부 기관이 측정한 유일한 정면 비교에서 Artificial Analysis는 Opus 4.8이 Intelligence Index(56 대 35)에서 훨씬 앞선다고 평가하지만, 해당 행은 작성 시점에 K2.7이 독립적으로 점수화되지 않았기 때문에 K2.6을 대리 지표로 사용합니다.
컨텍스트 윈도우 격차를 벤치마크가 가린다
Opus 4.8는 1M-token 컨텍스트 윈도우를 제공하는 반면, Kimi K2.7은 256K가 한계입니다. 벤치마크 점수는 이런 점을 좀처럼 드러내지 않지만, 실제 작업에서는 이것이 결정적입니다. 256K 윈도우는 중간 규모의 repo와 긴 agent trace를 충분히 담을 수 있으며, 대부분의 코딩 세션에는 무리가 없습니다. 하지만 대형 monorepo 전체, 긴 문서 묶음, 또는 여러 시간에 걸친 agent transcript를 하나의 prompt에 넣으려 하면 한계에 부딪힙니다. 그런 경우에는 Opus의 4배 더 큰 윈도우가 차트상의 숫자가 아니라 실질적인 차이를 만듭니다.
가격: 5–6배의 격차와 캐시 레버
기본 API 목록 가격 기준으로, Kimi K2.7 Code는 입력 토큰 100만 개당 $0.95, 출력 토큰 100만 개당 $4.00입니다. Claude Opus 4.8은 $5와 $25입니다. 출력 기준으로 5~6배 차이가 나며, 팀들이 Kimi를 검토하는 가장 큰 이유이기도 합니다.
대부분의 가격표가 놓치는 핵심 레버는 캐싱입니다. Kimi는 캐시 적중 시 백만 토큰당 $0.19를 청구하는데, 이는 이미 보낸 입력에 대해 80% 할인된 가격입니다. 매 단계마다 같은 코드베이스를 다시 읽는 agentic loop에서는 캐시된 입력이 비용의 대부분을 차지하므로, 실제 비용은 표면상의 차이보다 훨씬 낮아집니다. Baseten의 Philip Kiely는 보고했습니다 Opus 4.8에서 Kimi 2.7 Code로 전환한 뒤 샘플 워크로드에서 대략 82%의 비용 절감을 보았다고 합니다. 이런 유형의 작업은 캐시와 입력 비중이 큰 작업이라 Kimi의 가격 경쟁력이 더욱 커집니다. 실제 수치는 입력 대비 출력 비율에 따라 달라지겠지만, 방향성은 분명합니다. 생성하는 양에 비해 컨텍스트를 더 많이 재읽을수록 비용 측면에서 Kimi가 더 유리합니다.
Opus는 출력 측면에서 비용을 회수합니다. 제 Task 1에서 Kimi가 생성한 토큰의 4분의 1만 생성했기 때문에, 대용량 파일 작성이나 장황한 리팩터링처럼 생성 비중이 큰 작업에서는 실제 지출 기준 per-token 격차가 좁아지고, Opus의 속도는 엔지니어가 기다리는 데 지불하는 총 소요 시간을 줄여줍니다.
오픈 웨이트의 약속과 577GB라는 현실
Kimi K2.7는 수정된 MIT 라이선스 하에 오픈 웨이트로 제공되므로, 직접 호스팅하고 fine-tune할 수 있습니다. Opus 4.8은 API 전용이며, 귀하의 코드와 reasoning traces는 Anthropic으로 전송됩니다. 서류상으로는 이것이 Kimi에 명확한 프라이버시 및 락인 우위입니다. 실제로는 먼저 하드웨어 비용을 확인하세요.
Kimi K2.7은 1조 개의 파라미터를 가진 Mixture-of-Experts 모델이며(토큰당 활성화 32B, 전문가 384개), 독립 리뷰어들은 가중치, KV cache, 실행 시 오버헤드를 모두 포함하면 전체 INT4 배포에 약 577GB의 VRAM이 필요하다고 평가했습니다. 이는 최소 실사용 구성이 대략 8× H100 80GB 또는 DGX Spark급 박스 수준에 해당합니다. 단일 RTX 4090(24GB)으로는 유용한 설정에서 전체 모델을 실행할 수 없습니다. 충분한 자금력을 갖춘 극소수의 팀을 제외하면, "open weights"는 호스팅 제공업체로 라우팅하거나 임대 GPU에서 fine-tune할 자유를 뜻할 뿐, 자체적으로 구축해 운영할 수 있는 모델을 의미하지는 않습니다. Kimi를 선택하는 이유가 온프레미스 데이터 통제라면, 도입 전에 클러스터 비용을 먼저 산정해야 합니다. 대부분의 팀에게 self-hosting은 여전히 이론에 머뭅니다.
어떤 것을 선택해야 할까요
승자를 정하기보다 모델을 작업 부하에 맞추십시오:
Kimi K2.7 Code를 선택하세요 비용에 민감하고, 대량 처리나 에이전트형 코딩을 할 때, 코드베이스를 반복해서 다시 읽어야 하며, 지연 시간이 중요하지 않고, 256K 컨텍스트면 충분할 경우에 적합합니다. 캐싱 할인은 누적될수록 유리하게 작용합니다.
Claude Opus 4.8를 선택하세요 낮은 지연 시간, 큰 리포지토리나 긴 세션을 위한 1M-token 컨텍스트, 더 간결한 출력, 또는 중요한 변경 사항에서 신뢰할 수 있는 최종 검토 모델이 필요할 때 적합합니다. 이때는 독립적 추론 점수에서의 우위가 가장 중요합니다.
하이브리드 전략: 저렴한 모델이 초안을 작성하고, 최첨단 모델이 마무리
둘 다 사용하는 팀들 사이에서 가장 흔한 패턴은 하나를 고르는 것이 아니라 라우팅하는 것입니다. Kimi K2.7이 대량 생성과 반복 작업을 저렴하게 처리하게 하고, 그 결과물을 최종 검토나 최첨단 판단이 필요한 부분을 위해 Opus 4.8에 넘기세요. Kimi는 OpenAI 형식을 기본적으로 지원하는 반면 Opus는 Anthropic의 자체 API를 사용하므로, 이 둘 사이를 실용적으로 라우팅하는 방법은 둘 다 하나의 OpenAI 호환 엔드포인트 뒤에 두는 게이트웨이입니다. 예를 들어 AIReiter 같은 플랫폼에서는 둘 다 하나의 키 아래에 있어, Kimi에서 Opus로 전환하는 것은 재통합이 아니라 모델 문자열만 바꾸는 일입니다. 위에서 언급한 82% 절감은 Opus를 완전히 빼서가 아니라 바로 이런 종류의 라우팅에서 나온 것입니다.
자주 묻는 질문
Kimi K2.7는 코딩에서 Claude Opus 4.8보다 더 나은가요?
제한이 명확하게 규정된 작업에서는 둘이 비슷하며, 내 테스트에서는 둘 다 완전히 올바른 코드를 반환했다. Kimi의 강점은 agentic tool use(MCPMark 81.1 대 76.4, Moonshot 보고)이고, Opus는 일반 추론, 속도, 긴 컨텍스트 작업에서 앞선다.
Kimi K2.7는 Opus 4.8보다 얼마나 더 저렴한가?
정가 기준으로 약 5~6배 더 저렴합니다(백만당 $0.95/$4 vs $5/$25). 반복적인 워크로드에서 캐시 히트($0.19/M input)가 있으면, 실제 절감률은 80% 이상에 이를 수 있습니다.
Kimi K2.7와 Opus 4.8의 컨텍스트 윈도우는 무엇인가요?
Kimi K2.7은 256K 토큰을 처리하며; Opus 4.8은 1M을 처리하는데, 이는 4배 더 큽니다.
Kimi K2.7를 로컬에서 실행할 수 있나요?
충분히 강력한 하드웨어가 있어야만 가능합니다. 전체 INT4 배포에는 약 577GB의 VRAM이 필요하다고 보고되며(대략 H100 8개 또는 DGX Spark 수준), RTX 4090과 같은 단일 소비자용 GPU로는 전체 모델을 실행할 수 없습니다.
Kimi K2.7는 오픈 소스인가요?
수정된 MIT 라이선스 하에 오픈 웨이트로 제공되므로, 직접 호스팅하고 fine-tune할 수 있습니다. Opus 4.8은 폐쇄형이며 API 전용입니다.
핵심 요약
예산이 병목이라면 기본값으로 Kimi K2.7 Code를 선택하고 나머지는 캐싱에 맡기세요. 지연 시간, 컨텍스트 길이, 또는 잘못되면 안 되는 변경 사항이 문제라면 Opus 4.8에 비용을 지불하세요. 오픈 웨이트 라이선스는 GPU를 직접 보유한 경우에만 활용할 수 있는 보너스로 생각하세요. 그리고 확실하지 않다면 둘 다 연결한 다음 나중에 되돌려야 할 하나의 선택에 워크플로를 걸지 말고 작업별로 라우팅하세요.
