DeepSeek의 V4 Pro는 이제 공식 API에서 백만 input tokens당 $0.435, 백만 output당 $0.87입니다. Azure AI Foundry의 동일한 모델은 여전히 $1.74와 $3.48로 표시되며, 이는 정확히 인하 이전 가격입니다. 2026년 7월 14일에 확인된 이 4배 차이는 현재 DeepSeek 엔터프라이즈 AI 비용 역학에 대한 가장 중요한 단일 사실입니다. 즉, 귀사가 지불하는 금액은 모델보다도 그것에 도달하기 위해 어떤 문으로 들어가느냐에 더 크게 좌우됩니다.
이 글은 직접 API와 Azure에 날짜가 표시된 수치를 제시하고, 하나의 리셀러 경로를 테스트하며, 두 V4 모델을 통해 동일한 워크로드를 실행한 뒤, 하나의 마감일과 함께 의사결정 프레임워크로 마무리합니다. 그 마감일은 기존 deepseek-chat 및 deepseek-reasoner 별칭이 2026년 7월 24일에 종료된다는 점입니다.
오늘의 DeepSeek V4 가격: 중요한 수치
여기 DeepSeek의 API 문서에서 확인한 공식 가격표가 있습니다. 확인일: 2026년 7월 14일:
| 모델 | 입력(캐시 적중) | 입력(캐시 미스) | 출력 | 컨텍스트 | 동시성 제한 |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
그 표의 세 가지 세부 사항은 표면적인 요율보다 더 중요합니다:
- 캐시 적중 가격이 에이전트 워크로드의 실제 가격입니다. V4 Pro의 캐시 적중 비용은 백만 토큰당 $0.003625로, 캐시 미스보다 120배 저렴합니다. 매 호출마다 동일한 시스템 프롬프트와 도구 정의를 다시 보내는 에이전트 시스템은 거의 전적으로 캐시 영역에서 동작하며, DeepSeek는 별도 설정 없이 자동으로 캐싱을 적용합니다.
- 프로모션용 별표는 없습니다. 출시 프로모션으로 시작된 75% 인하가 이제는 정가가 되었습니다. 가격 페이지에는 만료일이 표시되어 있지 않습니다. InfoWorld의 보도는 이 영구화를 V4 Pro의 엔지니어링에 기인한 것으로 설명했습니다. 긴 컨텍스트에서 이전 세대 대비 토큰당 연산량이 대략 4분의 1 수준이어서, 이번 인하는 보조금이 아니라 구조적 변화라는 것입니다.
- 별칭 마감일은 실제입니다. 모델 이름
deepseek-chat및deepseek-reasoner는 2026년 7월 24일 15:59 UTC에 deprecated 됩니다. 아직도 해당 이름을 호출하는 프로덕션 코드는deepseek-v4-flash또는deepseek-v4-pro로 한 줄만 수정하면 마이그레이션할 수 있습니다. 새 기본값은 thinking mode로 실행되므로, mode를 명시적으로 설정하지 않으면 출력 토큰 수(및 청구액)가 달라집니다.
두 모델 모두 100만 토큰 컨텍스트 윈도와 최대 384K 출력 토큰을 제공하며, API는 이제 OpenAI 형식과 함께 api.deepseek.com/anthropic에서 Anthropic 호환 형식을 제공하므로, 팀이 Claude용으로 구축된 도구에 DeepSeek를 교체해 넣으려는 경우 중요합니다.
75% 삭감이 모든 채널에 적용되지는 않았습니다
Azure AI Foundry는 동일한 DeepSeek-V4 Pro를 백만 토큰당 입력 $1.74, 출력 $3.48에 판매합니다(Global deployment, Central US, verified July 14, 2026). 이는 인하 전 가격으로, 변경되지 않았습니다. Azure에서 V4 Flash는 $0.19/$0.51로 운영되며: 직접 API의 캐시 미스 요금 대비 입력은 36% 프리미엄, 출력은 82% 프리미엄입니다.
우리가 확인한 Azure 가격 페이지(Global deployment, Central US, 2026년 7월 14일 기준)에서는 어떤 DeepSeek 모델에도 cached-input 항목이 나타나지 않습니다. marketplace 가격은 vendor 가격보다 늦게 반영될 수 있으므로 Microsoft account team에 확인하시기 바랍니다. direct API에서는 prefix 재사용이 많은 agent workload가 백만 input tokens당 몇 센트의 일부만 지불하지만, Azure에서는 그러한 tokens 각각이 full rate로 청구됩니다. cache-heavy workloads의 경우 실제 격차는 4x가 아니며, input 측면에서는 100x를 넘을 수 있습니다.
Azure에 공정하게 말하자면, 당신이 구매하는 것은 같은 것이 아닙니다. Foundry hosting은 Microsoft의 데이터 처리 약관 아래 Microsoft의 클라우드 내부로 트래픽을 유지하고, Azure SLA를 적용하며, 중국 기업이 운영하는 서버로 데이터가 빠져나가지 않게 합니다. 이는 많은 컴플라이언스 팀에게 바로 그 점이 핵심입니다. Microsoft는 DeepSeek을 Copilot의 multi-model routing에 연결하면서 바로 이런 방식으로 포지셔닝하고 있습니다. 하지만 이제 이 거버넌스 프리미엄은 수치화할 수 있습니다. 아래 기준 워크로드의 경우, 워크로드당 월 $31과 $209의 차이이며, 조달 팀은 이를 보이지 않는 기본값으로 흡수할 것이 아니라 별도 항목으로 가격을 매겨야 합니다.
집계자와 API 재판매업체는 그 중간에 위치합니다. OpenRouter 같은 플랫폼은 공식 요금에 가까운 가격으로 요청을 전달하며, 커뮤니티 보고에 따르면 DeepSeek의 글로벌 캐시도 이를 통해 계속 적용됩니다. 다만 문제는 가시성입니다. 아래에서 더 자세히 다루겠지만, 저희가 직접 테스트해 보았습니다.
실제 엔터프라이즈 워크로드의 비용
종이상의 요금은 이를 작업량과 곱할 때만 비로소 의사결정이 됩니다. 중간 규모의 엔터프라이즈 어시스턴트를 예로 들어보겠습니다: 한 달에 100M input tokens(캐시 적중률 50%, 시스템 프롬프트를 계속 다시 보내는 agent 트래픽에 대해 보수적인 비율)과 10M output tokens입니다. 다음은 2026년 7월 14일에 확인된 요금을 사용해, 동일한 작업량을 여섯 개 채널에 걸쳐 책정한 것입니다:
| 채널 | 월간 비용 |
|---|---|
| DeepSeek V4 Flash, direct API | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, direct API | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
표 뒤에 있는 수학은 재사용 가능합니다: 월 비용 = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. 캐시 비중이 이를 좌우합니다. 동일한 100M-input 워크로드를 V4 Pro에 직접 사용할 경우 캐시 적중률 0%에서는 월 $52.20, 50%에서는 $30.63, 90%에서는 $13.38입니다. 반면 Azure에서는 캐시 할인율이 공개되어 있지 않기 때문에 이 세 경우 모두 $208.80으로 유지됩니다.
그 표에 대한 두 가지 해석이 있습니다. 첫째, 가장 저렴한 DeepSeek 채널과 가장 비싼 최첨단 채널은 동일한 트래픽에서 58배 차이가 납니다. 둘째, 더 눈에 띄지 않는 점은 Azure의 DeepSeek V4 Pro가 OpenAI의 GPT-5.6-Luna보다 더 비싸다는 것입니다. 조달 요약서에 “비용 절감을 위해 DeepSeek로 표준화했다”고 적혀 있지만 배포가 Azure Global이라면, 절감 효과는 중간급 OpenAI 모델이 제공할 수 있는 수준보다 작을 수 있습니다.
예산을 무너뜨리는 배수는 에이전트 증폭입니다. 단일 턴 챗봇은 사용자 질문당 대략 한 번의 호출만 청구되지만, 프로덕션 에이전트는 계획, 검색, 도구 호출, 검증을 연쇄적으로 수행하며, 입력 대비 청구 비율은 1:700에 이를 수 있습니다. VentureBeat의 2026년 7월 에이전트 경제성 분석은 이를 "100x problem"이라고 부릅니다. 이 비율에서 우리의 1억 토큰 기준 작업량은 한 개의 비교적 바쁜 에이전트 기능이 만들어내는 양이지, 한 회사 전체 트래픽이 아닙니다. 토큰당 저렴한 가격이 비용 통제를 건너뛰어도 된다는 허가증은 아닙니다. 그것은 에이전트 제품을 만드는 동안 제품이 생존할 수 있게 해주는 요소입니다.
우리는 V4 Flash와 V4 Pro에서 동일한 작업을 실행했습니다
가격 페이지는 엔지니어들이 물을 질문, 즉 단일 요청의 비용과 소요 시간을 답해주지 않습니다. 2026년 7월 14일, 우리는 동일한 코딩 과제 - "ISO 8601 기간 문자열을 총 초로 파싱하는 Python 함수를 작성하고, 3개의 테스트 케이스를 포함하라" - 를 기본 설정(think mode on, 최대 4,000 출력 토큰)에서 OpenAI 호환 리셀러 엔드포인트를 통해 두 V4 모델 모두에 보냈습니다. 리셀러를 익명으로 두는 이유는 초점이 특정 벤더가 아니라 이 카테고리의 동작에 있기 때문입니다. 원시 응답에는 DeepSeek의 reasoning_content 필드가 포함되어 있었고, 이를 통해 백엔드 모델을 확인했습니다:
| V4 Flash | V4 Pro | |
|---|---|---|
| 실제 경과 시간 | 15.5s | 35.1s |
| 완료 토큰 수(추론 포함) | 1,690 | 1,902 |
| 실효 출력 속도 | ~109 tok/s | ~54 tok/s |
| 공식 요율 기준 비용 | ~$0.0005 | ~$0.0017 |
주의사항을 명확히 말씀드리면: 이는 단일 샘플이며, 지연 시간에는 릴레이 오버헤드가 포함되어 있으므로, wall-clock 수치는 직접 API의 벤치마크라기보다 상한선으로 간주해야 합니다. 두 응답 모두 DeepSeek의 시그니처 reasoning_content 필드를 반환했습니다. 두 모델 모두 기본적으로 thinking mode로 실행되며, 그 reasoning token은 output으로 과금됩니다. Flash는 답변하기 전에 parsing function에 대해 추론하는 데 2,703자를 사용했습니다. 워크로드에 chain-of-thought가 필요하지 않다면, thinking을 끄는 것이 가장 저렴한 최적화 중 하나입니다. Pro의 추가 품질이 3배 가격을 정당화하는 시점에 대해 더 깊이 있는 1:1 비교를 위해, 두 모델을 모두 DeepSeek V4 Flash vs V4 Pro에서 전체 비교로 검토했습니다.
테스트는 우리가 다른 곳에서 문서화된 것을 보지 못한 한 가지 결과를 드러냈습니다: 릴레이 채널의 사용량 보고서에는 캐시 세부 내역이 없었습니다. 우리는 같은 824토큰 접두사를 연속으로 두 번 보냈습니다 - 리셀러가 DeepSeek의 접두사 캐싱을 유지한다면 교과서적인 캐시 히트입니다 - 그리고 API 응답에는 prompt_tokens, completion_tokens, total_tokens만 보고되었고, prompt_cache_hit_tokens 분할은 없었습니다. 직접 API에서는 그 필드가 120배 캐시 할인 혜택이 청구서에 반영되는지 감사하는 방법입니다. 중개자를 통해서는 확인할 수는 없지만 할인을 받을 수도 있고, 아예 받지 못할 수도 있습니다. 어떤 리셀러를 통해서든 DeepSeek를 구매한다면, 캐시 히트 가격이 그대로 전달되는지, 그리고 청구서에 어떻게 표시되는지 구체적으로 물어보세요.
직접 API, Azure, 또는 집계자: 어떻게 선택할까
채널 결정은 다음의 짧은 표로 정리됩니다:
| Direct API | Azure AI Foundry | Aggregator/reseller | |
|---|---|---|---|
| V4 Pro price (in/out per M) | $0.435 / $0.87 | $1.74 / $3.48 | Varies; typically near official |
| Cache-hit discount | Yes, automatic, auditable | Not listed | Sometimes; often not auditable |
| Data residency | DeepSeek's servers | Microsoft cloud, your tenant | Reseller's infrastructure |
| Contract/compliance | Chinese entity | Existing Azure agreement | Reseller's terms |
| Concurrency | 500 (Pro) / 2,500 (Flash) | PTU provisioning available | Pooled, varies |
| Multi-model consolidation | DeepSeek only | Foundry catalog | Broad catalog, one invoice |
실제로는: direct API가 순수한 경제성 면에서 승자입니다. 어떤 채널도 캐시 적중 요금인 100만 토큰당 $0.003625를 따라올 수 없으며, 이 할인 혜택을 감사할 수 있는 유일한 채널이기도 합니다. Azure는 법무팀이 DeepSeek의 자체 인프라로의 트래픽을 승인하지 않을 때 승자입니다. 거버넌스를 위해 실효 요금의 대략 7배를 지불하게 되지만, 이를 의식적으로 선택한다면 그 거래는 충분히 합리적일 수 있습니다. Aggregators는 DeepSeek이 라우터 뒤에 있는 여러 모델 중 하나이고 통합 청구가 얇은 마진을 감수할 만큼 가치가 있을 때 승자입니다. 물량을 약정하기 전에 cache pass-through를 확인하십시오.
어떤 채널을 선택하든, DeepSeek 요금을 안정적으로 유지하는 라우팅 규칙은 화려하지 않습니다: 기본 분류, 추출, 요약은 Flash로 설정하고; 멀티파일 코드 생성과 긴 컨텍스트 추론에는 Pro를 예약하며; 결정론적 작업에서는 thinking mode를 끄고(그 reasoning tokens는 output으로 청구됩니다); 워크플로별 agent loop depth를 제한하세요. 잘 튜닝된 router가 Flash와 Pro 사이의 3배 차이보다 더 중요합니다.
DeepSeek이 이렇게 낮은 가격을 책정할 수 있는 이유 — 그리고 그것이 지속 가능한지
가격은 손해를 감수한 미끼 상품이 아닙니다. V4의 아키텍처는 mixture-of-experts 설계로, 총 1.6조 개의 파라미터를 갖지만 각 forward pass마다 활성화되는 것은 약 490억 개에 불과합니다. 즉, 중형 모델 수준의 연산으로 추론하면서도 frontier-class 능력을 얻는 셈입니다(DeepSeek의 공개 결과에 따르면 SWE-bench Verified에서 80.6%). 특히 V4 Pro 개정판은 장문 컨텍스트 비용을 직접 겨냥했기 때문에, 회사가 75% 프로모션을 그대로 두지 않고 상시 가격으로 전환한 것입니다.
추세는 구매자에게 유리합니다. 업계의 대부분의 추정에 따르면 프런티어 inference 단위 비용은 연간 대략 3배씩 하락해 왔으며, DeepSeek가 1년 만에 단행한 인하와 100만 토큰으로 늘어난 context length는 그 곡선조차 앞지릅니다. OpenAI는 같은 기간에 정반대 방향으로 움직여, GPT-5.6-Sol로 대표 티어를 $5/$30로 상향 재편했습니다.
반대 논리는 제번스입니다: 더 저렴한 추론은 더 많은 추론을 안정적으로 만들어냅니다. New Street Research의 관찰 - V3 시대 이후 자주 인용되어 온 - 경쟁 심화가 총지출을 줄이는 경우는 드물다는 점은 AI 구축 전반에 걸쳐 그대로 입증되었습니다. 에이전트 채택은 사용자당 호출 수를 토큰당 가격 하락 속도보다 더 빠르게 늘리며, 그래서 예산을 그대로 유지하는 기업들은 가장 저렴한 모델을 고른 곳이 아니라 라우팅, 캐싱, 그리고 프롬프트 규율을 일급 엔지니어링으로 다루는 곳입니다. 표면 가격만이 아니라 이러한 비용 역학을 이해하는 것이, DeepSeek 배포를 저렴하게 유지하는 것과 조용히 눈덩이처럼 불어나는 것을 가르는 기준입니다.
자주 묻는 질문
DeepSeek V4는 왜 이렇게 저렴한가요?
Mixture-of-experts 아키텍처: 총 1.6T 파라미터, 토큰당 활성화되는 것은 약 49B. 토큰당 연산 비용은 훨씬 더 작은 모델과 비슷하며, V4 Pro의 긴 컨텍스트 엔지니어링은 토큰당 연산을 이전 모델의 약 4분의 1로 줄였습니다. 가격은 일시적인 프로모션이 아니라 구조적인 것입니다.
DeepSeek V4 Pro 가격은 얼마나 인하되었나요?
75%: 백만 토큰(입력/출력)당 $1.74/$3.48에서 $0.435/$0.87로. 이는 한정 프로모션으로 시작해 영구 목록 가격이 되었습니다.
Azure에도 75% 가격 인하가 적용되나요?
아니요. 2026년 7월 14일 기준으로 Azure AI Foundry는 DeepSeek-V4 Pro Global을 $1.74/$3.48, 즉 가격 인하 전 요금으로 표시하며, 캐시 입력 가격은 공개되어 있지 않습니다. 캐시 사용량이 많은 워크로드의 경우 직접 API와의 실질적인 격차가 4배를 넘을 수 있습니다. 마켓플레이스 가격은 공급업체의 가격 인하를 따라가지 못할 수 있으므로 Microsoft에서 최신 요금을 확인하세요.
DeepSeek는 기업용으로 무료인가요?
API는 토큰당 과금되지만, 모델 가중치는 MIT 라이선스이므로 상업적 사용을 위한 자체 호스팅도 합법적입니다. V4 규모에서는 상당한 GPU 인프라가 필요하며, 대부분의 팀에게는 API의 토큰당 가격이 자체 호스팅 TCO를 큰 차이로 낮춥니다.
DeepSeek의 비용은 ChatGPT와 어떻게 비교되나요?
API 가격 측면에서 DeepSeek V4 Pro ($0.435/$0.87)는 입력에서 GPT-5.6-Sol ($5/$30)보다 약 11배, 출력에서는 34배 더 저렴합니다. ChatGPT 구독($20–$200/month per seat)은 다른 제품입니다. 프로그램 방식 워크로드에서는 API 간 비교가 의미 있는 비교입니다.
7월 24일 전에 해야 할 일
긴급도 순서대로 세 가지 조치:
1. 지금 모델 별칭을 마이그레이션하세요. deepseek-chat와 deepseek-reasoner는 2026년 7월 24일 15:59 UTC 이후 더 이상 해석되지 않습니다. deepseek-v4-flash 또는 deepseek-v4-pro를 명시적으로 고정하고, thinking mode를 의도적으로 설정하세요. 기본값이 변경되었으며, reasoning tokens는 출력으로 청구됩니다. 2. 채널 가격을 재조정하세요. 거버넌스상의 이유로 Azure를 사용 중이라면, 4배 리스트 가격과 캐시 할인 없음에도 여전히 의도적인 선택인지 확인하세요. 리셀러를 사용 중이라면, cache pass-through를 서면으로 확보하세요. 3. 캐시 적중률을 감사하세요. direct API에서는 사용 데이터의 prompt_cache_hit_tokens를 확인하세요. 에이전트 트래픽의 cache hits가 50% 미만이라면, 정적 콘텐츠가 앞에 오도록 프롬프트를 재구성하세요: 120배의 hit/miss 차이를 고려하면, 프롬프트 순서는 예산 결정입니다.
모델이 저렴해졌습니다. 그 저렴함을 누가 차지하느냐(벤더, 클라우드, 리셀러, 아니면 당신)가 올해 기업의 돈이 벌리고 잃히는 지점입니다.
관련 읽을거리: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · OpenRouter 가격 가이드
