코딩을 위한 최고의 오픈 소스 LLM: 우리 테스트에서 48배의 비용 차이

마지막 업데이트: 2026-07-17 10:10:09

짧은 답변: GLM-5.2는 지금 코딩용 오픈 소스 LLM 중 가장 강력합니다. 확장 사용 시 출력 품질은 Claude Sonnet급에 가깝고, 가장 어려운 문제를 맡길 모델이기도 합니다. 다만 느리고 토큰을 많이 소비하므로, 빠른 API 코딩 에이전트에는 Kimi K2.7 Code를, 가장 낮은 비용에는 DeepSeek V4 Flash를, 그리고 24GB GPU 환경에서는 Qwen3.6-27B를 선택하세요.

같은 두 개의 코딩 작업을 다섯 개의 오픈 소스 대표 모델에 넣고, Claude Opus 4.8을 폐쇄형 소스 기준으로 삼았을 때 나온 결론입니다. 이들 모두 올바른 코드를 생성했습니다. 차이를 만든 것은 그 결과에 도달하기 위해 얼마나 많은 토큰을 소모했는지였고, 그 차이는 비용 기준으로 무려 48배에 달했습니다.

용어에 대한 한 가지 참고: 이들 거의 모두는 기술적으로 open-weight 모델입니다. 가중치는 무료지만, 학습 데이터는 그렇지 않습니다. 우리는 사람들이 검색하는 용어이기 때문에 "open source"라고 말합니다. 이 차이는 아래의 FAQ 답변 하나에서만 중요합니다.

테스트 방법

두 가지 작업, 모든 모델에 동일한 프롬프트를 사용하여, 기본 설정으로 2026년 7월 17일에 전송됨:

  • Task 1: 까다로운 엣지 케이스가 있는 기간 파싱 함수를 작성하세요 (12개 테스트 케이스)
  • Task 2: 버그가 있는 구간 병합 함수를 수정하세요 (6개 테스트 케이스)

우리는 코드를 로컬에서 채점하고 각 실행마다 세 가지 수치를 기록했습니다: 통과율, 출력 토큰 수, 그리고 실제 경과 시간입니다. 비용은 토큰 수에 각 공급업체의 정가를 곱한 값이며, 우리는 이를 같은 날 확인했습니다. 두 개의 작업은 하나의 벤치마크가 아니라 탐색용이며, 하지만 이는 여러분이 수백 번이나 보낼 법한 일상적인 요청의 종류입니다.

결과

모든 모델이 모든 테스트 케이스를 통과했습니다. 따라서 아래 표는 한 가지, 바로 효율성에 관한 것입니다:

모델출력 토큰(두 작업 모두)작업 1 시간비용
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

토큰 열이 이야기의 핵심입니다. GLM-5.2와 MiniMax M3는 "thinking" 모델입니다. 기본적으로 이들은 답변하기 전에 길게 추론합니다. 그 추론은 출력으로 청구됩니다. 같은 올바른 기능에 대해, GLM-5.2는 Kimi K2.7 Code보다 3배 더 많은 토큰을 작성했습니다.

토큰 제한을 두면 상황은 더 나빠집니다. 응답을 2,048 토큰으로 제한했을 때, 두 thinking 모델은 예산 전부를 추론에 써버리고 아예 코드가 없는 결과를 반환했습니다. 돈은 냈지만 아무것도 얻지 못한 셈입니다. GLM-5.2는 완료되기 전에 16,384 토큰 상한이 필요했고, 두 번의 실패한 시도만으로도 약 $0.045의 비용이 들었습니다. 코딩 에이전트 안에서 thinking 모델을 사용한다면, max_tokens를 늘리거나 일반적인 수정에는 thinking을 끄세요.

Cost to complete both test tasks at official API prices

비교를 위해, Claude Opus 4.8은 두 작업을 모두 539 토큰으로 해결했습니다. 오픈 모델은 정확성에서는 따라잡았지만, 간결성에서는 여전히 폐쇄형 기준 모델이 4배 앞서 있습니다.

배포 계층별 최고의 오픈 소스 코딩 모델

모델이 실행될 위치에 따라 선택하세요. 가격은 100만 토큰당이며, 2026-07-17에 확인되었습니다.

가장 강력한 모델, 기다릴 수 있다면: GLM-5.2

복잡한 다단계 코딩 작업에서 GLM-5.2의 출력 품질은 현재 오픈 모델 중 Claude급에 가장 근접합니다 — 에이전틱 벤치마크(SWE-Bench Pro, Terminal-Bench 2.1)에서 선두를 차지하며, 저희가 직접 장기간 사용해본 결과 다른 모델들이 헤매는 문제들을 맡길 때 가장 신뢰하는 모델입니다. 자세한 내용은 GLM-5.2 API 가이드에서 확인하세요.

그 품질의 대가는 인내입니다. 이는 저희 테스트에서 가장 느리고 가장 배고픈 모델이었으며(Task 1에서 99.3초와 5,695 tokens), 느린 서빙은 모델 자체보다는 공급업체 측의 제한된 GPU capacity를 더 반영합니다. $1.40 in / $4.40 out, 1M context, plain MIT. 어려운 문제와 큰 token budget을 맡기고, 빠른 편집은 다른 곳으로 보내세요.

빠른 API 코딩 에이전트에 가장 적합: Kimi K2.7 Code

우리가 테스트한 가장 토큰 효율적인 오픈 모델: 버그 수정에 259 토큰이 들었고, Claude 같은 간결함을 보였습니다. 또한 Kilo의 작업 완료 벤치마크에서 60.7%로 선두를 차지했습니다.

가격: 입력 $0.95 / 출력 $4.00, 캐시 적중 시 $0.19. 실제로 유일한 제한은 컨텍스트입니다. 262K tokens이며, 이 목록의 나머지는 1M을 제공합니다. 가장 가까운 경쟁 제품과 어떻게 비교되는지 보려면 Kimi K2.7 Code vs GLM-5.2를 참조하세요.

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

최고의 가성비: DeepSeek V4 Flash

$0.14 in / $0.28 out, 여기서 단연 가장 저렴한 모델이며, 우리가 던진 모든 것을 여전히 통과했고, 오픈 모델들 중 가장 빠릅니다. 공개된 점수(79.0% SWE-Bench Verified, 91.6% LiveCodeBench)는 상위 모델과 2점 이내입니다. 컨텍스트는 1M tokens이고, 라이선스는 일반 MIT입니다.

여기서 시작하세요. 여러 파일 작업을 할 때 격차가 드러나기 시작할 때만 V4 Pro로 올라가세요.

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

24GB 소비자용 GPU에서 가장 적합: Qwen3.6-27B

SWE-Bench Verified에서 77.2%를 기록하는 밀도 높은 27B로, 한 장의 소비자용 카드에 맞는 모델치고는 플래그십에 준하는 성능을 보여주며, 그래서 "I have 24GB of VRAM."으로 시작하는 r/LocalLLaMA 스레드에서 반복해서 언급되는 답이기도 합니다.

더 빠른 형제 모델인 Qwen3-Coder-Next(총 80B, 토큰당 활성화 3B만, Apache 2.0)는 커뮤니티에서 속도용으로 선호되는 선택입니다: 한 사용자는 전체 262K 컨텍스트에서 단일 RX 9070 XT로 약 20 토큰/s로 실행했습니다. API로 호출하고 싶다면 Alibaba Cloud를 통해 $0.30/$1.50부터 시작합니다.

최고의 단일 GPU 자체 호스팅: Gemma 4 31B

Google의 모델 카드에 따르면, 31B는 Apache 2.0 하에서 256K 컨텍스트로 80GB H100 하나에 적합합니다. 12B 변형은 16GB의 VRAM에서 실행됩니다.

한 가지 사이징 함정: MoE 모델은 작은 "active" 파라미터 수를 내세우지만, 전체 가중치는 여전히 저장해야 합니다. DeepSeek V4 Flash는 토큰당 13B를 활성화하지만 총 284B의 가중치를 가지며, 4-bit에서도 약 142GB입니다. 이는 단일 카드가 아니라 멀티 GPU 프로젝트입니다.

긴 자율 주행을 위한 최고의 가성비 선택: MiniMax M3

1M 컨텍스트를 $0.30/$1.20에 제공하며, 여러 시간에 걸친 에이전트 세션을 위해 설계되었습니다 — MiniMax는 12시간 무인 연구 실행을 시연했습니다. 결과 표에서 보셨던 thinking-model의 상세한 설명 수준을 공유하므로, 이에 맞게 토큰 예산을 잡으세요. 긴 실행에서 비용보다 품질이 더 중요하다면, 위의 GLM-5.2가 업그레이드 버전입니다.

리더보드가 알려주지 않는 것

벤치마크 수치는 이제 비슷해졌습니다: Stanford's AI Index에 따르면 1위와 10위 모델의 격차는 1년 만에 11.9%에서 5.4%로 줄었습니다. 점수표가 여전히 숨기고 있는 세 가지:

작업당 비용은 토큰당 비용보다 중요합니다. GLM-5.2의 출력 가격 4.40달러는 Kimi의 4.00달러와 비슷해 보입니다. 하지만 실제 토큰 수를 반영하면 같은 작업의 비용은 3.5배 더 듭니다. Kilo의 실시간 통계는 극단적인 사례를 보여줍니다: DeepSeek V4 Pro는 0.87달러의 표시 가격에도 불구하고 완료된 벤치마크 시도당 평균 15.91달러입니다.

같은 모델, 다른 하니스, 다른 결과. 잘 구성된 에이전트 루프(구조화된 도구, 재시도, 적절한 토큰 한도) 안의 모델은 원시 chat 호출에서의 동일한 모델과 전혀 다르게 동작합니다. 우리의 GLM zero-code 실패는 능력의 한계가 아니라 구성 간 상호작용 문제였습니다.

각 벤치마크는 서로 다른 작업을 측정합니다. LiveCodeBench는 알고리즘 생성이며, DeepSeek V4 Pro는 93.5%로 이를 이겼고 폐쇄형 모델들의 공개된 점수보다 높습니다. SWE-Bench Verified는 저장소 수준의 버그 수정이며, Claude Mythos 5는 여전히 95.5%로 선두를 유지하고 있고 오픈 모델들은 약 80% 수준입니다. 순위를 신뢰하기 전에 벤치마크를 실제 작업에 맞추세요.

Claude 구독을 교체하기

오픈 소스를 선택하게 되는 흔한 계기: 업무 중간에 Claude의 구독 한도에 도달하는 것. 계산상으로도 맞아떨어집니다. 우리의 두 작업 probe는 DeepSeek V4 Flash에서 $0.00066가 들었고, 이런 호출을 하루에 몇백 번 해도 여전히 1달러 미만입니다.

전환도 예전보다 덜 번거롭습니다. DeepSeek는 Anthropic 호환 엔드포인트(api.deepseek.com/anthropic)를 제공하므로, Claude Code는 환경 변수 변경만으로 이를 사용할 수 있습니다; 동일한 설정은 GLM-5.2에도 적용됩니다. 그리고 어려운 문제는 Claude에 맡기고 일상적인 작업은 오픈 모델로 라우팅하고 싶다면, AIReiter 같은 플랫폼은 동일한 Anthropic 호환 인터페이스를 통해 Claude를 정가의 20%로 제공합니다.

Kimi K3: 주목해야 할 모델

Moonshot은 2026년 7월 16일 Kimi K3를 출시했으며, 프론트엔드 작업에서 이미 가장 강력한 폐쇄형 모델을 넘어섰습니다: Frontend Code 리더보드에서 1,679로 1위이며 Claude Fable 5의 1,631을 앞섰고, 초기 직접 사용 후기도 같은 방향을 가리킵니다.

여기에 순위가 매겨지지 않은 이유는 하나입니다: weights는 7월 27일에 공개됩니다. 그 전까지는 $3/$15의 closed API입니다. 공개되면 K3는 지금까지 출시된 가장 큰 open-weight model이 되며, 위의 frontend 수치는 이 모델이 이 목록의 최상위권을 놓고 경쟁할 것임을 시사합니다. 우리는 K3 open-weights release를 별도로 추적하고 있습니다.

선택하는 방법

1. 어디에서 실행될 것인가? 16GB VRAM 미만: API를 사용하세요(Gemma 4 12B는 로컬에서 실행 가능하지만, 실제 품질 저하를 예상하세요). 24GB: Qwen3.6-27B. H100 1개: Gemma 4 31B. API: 충분하지 않다는 것이 입증될 때까지 DeepSeek V4 Flash. 2. 어떤 종류의 작업인가? 빠른 편집에는 간결한 모델이 유리합니다: Kimi K2.7 Code 또는 DeepSeek. 어려운 문제와 긴 에이전트 실행에는 충분한 토큰 예산과 함께 GLM-5.2(또는 예산이 제한적이면 MiniMax M3)가 유리합니다. 3. 라이선스 제약? MIT(GLM, DeepSeek)와 Apache 2.0(Qwen, Gemma)에는 별도 제약이 없습니다. Kimi의 수정된 MIT에는 매우 큰 상업적 규모에서만 적용되는 저작자 표시 규칙이 추가되어 있습니다.

자주 묻는 질문

2026년 코딩에 가장 적합한 오픈 소스 LLM은 무엇인가요?

GLM-5.2는 가장 높은 한계치를 가지고 있습니다 — 어려운 문제에서 Claude Sonnet급 출력에 근접하지만, 속도를 희생합니다. Kimi K2.7 Code는 API 에이전트용 토큰 효율성에서, Qwen3.6-27B는 로컬 하드웨어에서, DeepSeek V4 Flash는 비용 면에서 우위를 보입니다.

이 모델들을 로컬에서 무료로 실행할 수 있나요?

가중치는 무료지만, 하드웨어는 그렇지 않습니다. 27B 모델에는 24GB GPU가 필요하고, Gemma 4 31B는 80GB를 원하며, 1조 파라미터 플래그십은 API 또는 클러스터 전용입니다.

오픈 소스와 오픈 웨이트의 차이점은 무엇인가요?

Open-weight는 가중치는 공개하지만 훈련 데이터와 코드는 비공개인 것을 의미하며, 여기 있는 거의 모든 모델이 이에 해당합니다. 완전한 오픈 소스 모델(OpenCoder, StarCoder2, IBM Granite Code)은 모든 것을 공개하지만 성능 면에서는 뒤처집니다.

코딩에 있어 Claude만큼 뛰어난 오픈 소스 LLM이 있나요?

알고리즘 벤치마크에서는 그렇습니다: DeepSeek V4 Pro의 93.5% LiveCodeBench는 공개된 폐쇄형 모델 점수를 능가합니다. 저장소 수준 수정에서는 여전히 Claude가 앞섭니다(95.5% 대 약 80% SWE-Bench Verified). 우리의 테스트에서 오픈 모델들은 정확성 면에서는 Claude와 같았지만, 4–13배 더 많은 토큰을 사용했습니다.

C++ 또는 틈새 언어에 가장 적합한 오픈 소스 LLM은 무엇인가요?

Kimi의 K2 시리즈는 가장 강한 니치 언어 평판을 가지고 있습니다( Moonshot은 특히 Zig를 언급합니다). C++의 경우, 커뮤니티의 공감대는 DeepSeek V4 Pro와 Qwen3 Coder Next를 가리킵니다. 무엇을 선택하든, 반드시 자신의 코드베이스에서 테스트하세요. 니치 언어 품질은 Python 벤치마크가 시사하는 것보다 훨씬 더 크게 달라집니다.