AIREITER

DeepSeek API 가격 인상: 인상 전후 요금 비교 (2026년 8월)

마지막 업데이트: 2026-08-16 19:03:07

DeepSeek API 요금 인상이 2026년 8월 16일부터 적용됐습니다. deepseek-v4-flash와 deepseek-v4-pro 모두 기존의 고정 토큰 단가 대신 피크·비피크 시간대별 과금으로 바뀌었습니다. 비피크 기준 캐시 미적중 입력과 출력은 기존보다 1.5~2.4배, 피크에는 그 두 배가 됐습니다. 캐시 적중 입력은 비피크에 2.5~6.1배, 피크에는 최대 12.1배 올랐습니다. 결국 실제 부담을 가르는 건 프롬프트 캐시 적중률입니다.

2026년 8월 16일, 무엇이 바뀌었나

변경 시점은 8월 16일 일요일 16:00 UTC, 베이징 시간으로는 8월 17일 자정입니다. r/DeepSeek의 공지 스레드와 650회 호출 감사 결과가 같은 시점을 가리킵니다. 공식 Models & Pricing 페이지에도 새 요금표가 올라와 있어, 단순 예고가 아니라 실제 적용된 변경입니다.

DeepSeek는 이제 피크와 비피크 시간대를 나눠 과금하며, 피크 요금은 비피크 요금의 정확히 2배입니다. 피크 시간은 UTC 기준 01:00–04:00와 06:00–10:00으로, 하루 7시간입니다. 나머지 17시간은 비피크입니다. 모델 버전(DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), API 호환성, 공개 사양은 같은 페이지에서 그대로 유지되고 있습니다. 모델이 바뀐 게 아니라 과금 방식만 바뀐 셈입니다.

새 DeepSeek API 요금표

아래 요금은 모두 2026년 8월 16일 기준 공식 가격 페이지의 100만 토큰당 미국 달러 단가입니다.

V4 Flash비피크피크
입력, 캐시 적중$0.007$0.014
입력, 캐시 미적중$0.22$0.44
출력$0.66$1.32
V4 Pro비피크피크
입력, 캐시 적중$0.022$0.044
입력, 캐시 미적중$0.66$1.32
출력$1.98$3.96
2026년 8월 16일 기준 새 피크·비피크 요금이 표시된 DeepSeek 공식 API 가격 페이지

그 외 과금 방식은 바뀌지 않았습니다. 요청이 실행되는 시점의 요금이 적용되며, DeepSeek는 향후 가격을 다시 변경할 수 있다고 명시하고 있습니다.

DeepSeek API 요금은 실제로 얼마나 올랐나

기존 고정 요금은 2026년 7월 31일까지의 서드파티 추적 자료로 확인했습니다. Flash는 입력(캐시 미적중) $0.14, 캐시 적중 $0.0028, 출력 $0.28이었고, Pro는 각각 $0.435 / $0.003625 / $0.87이었습니다(TLDL, BenchLM). 두 요금표를 나란히 비교하면 다음과 같습니다.

100만 토큰당기존 고정 요금새 비피크새 피크기존 대비 비피크기존 대비 피크
Flash 입력, 캐시 적중$0.0028$0.007$0.0142.5배5.0배
Flash 입력, 캐시 미적중$0.14$0.22$0.441.57배3.14배
Flash 출력$0.28$0.66$1.322.36배4.71배
Pro 입력, 캐시 적중$0.003625$0.022$0.0446.07배12.14배
Pro 입력, 캐시 미적중$0.435$0.66$1.321.52배3.03배
Pro 출력$0.87$1.98$3.962.28배4.55배
DeepSeek V4 API 가격 비교: 기존 고정 요금, 새 비피크 요금, 새 피크 요금의 100만 토큰당 미국 달러 단가

레딧에서 퍼진 ‘1,114% 인상’이라는 수치는 사실이지만 적용 범위가 좁습니다. V4 Pro의 캐시 적중 입력이 피크 시간에 $0.003625에서 $0.044로 오른 경우를 가리키기 때문입니다. 캐시를 전혀 사용하지 않는 워크로드가 비피크에 받는 인상폭은 1.5~2.3배에 가깝습니다. 실제 비용이 어느 쪽에 가까운지는 이 두 극단 사이에서 워크로드가 어디에 위치하느냐에 달렸습니다.

캐시를 많이 쓰는 워크로드가 더 크게 오르는 이유

캐시 적중 단가는 2.5~12배 오른 반면, 캐시 미적중 입력과 출력은 1.5~4.7배 인상에 그쳤습니다. 그만큼 저렴한 캐시 적중 경로에 입력 토큰을 많이 의존하던 서비스일수록 인상률이 커집니다. r/DeepSeek의 한 사용자는 실제 API 호출 650건(세션 16개, 프롬프트 토큰 155.9M, 캐시 적중률 98.09%)을 두 요금표로 다시 계산했고, DeepSeek 콘솔 청구액과 2% 이내로 일치하는 결과를 얻었습니다.

“지금 캐싱이 잘 작동할수록 인상폭은 더 커진다” - u/Swimming-Soup-1173, r/DeepSeek API 호출 650건 감사

이 에이전트 워크로드는 비피크 기준 비용이 2.7배로 재산정됐습니다. 같은 워크로드에서 캐시 적중이 전혀 없었다면 1.5배였습니다. 또 다른 사용자는 긴 컨텍스트 워크로드의 비용이 비피크에 $33에서 $100, 피크에 $200으로 오를 것으로 계산했습니다. 3~6배 인상입니다. 배치 작업, RAG 파이프라인, 고정 시스템 프롬프트를 사용하는 에이전트가 특히 큰 영향을 받습니다. 반면 일회성 요약 요청은 비피크 기준 1.5~2.3배라는 낮은 구간에 더 가깝습니다.

내 시간대에서 피크는 언제인가

공식 페이지는 UTC 기준 시간만 안내합니다. 8월 기준으로 서머타임을 반영해 현지 시간으로 바꾸면 다음과 같습니다.

지역현지 피크 시간오전 9시~오후 5시
베이징 (UTC+8)09:00–12:00, 14:00–18:0012:00–14:00 점심시간을 제외하면 피크
중부 유럽 (UTC+2)03:00–06:00, 08:00–12:00오전이 피크
런던 (UTC+1)02:00–05:00, 07:00–11:00오전이 피크
미 동부 (UTC-4)21:00–00:00, 02:00–06:00전부 비피크
미 서부 (UTC-7)18:00–21:00, 23:00–03:00전부 비피크

피크 시간은 베이징 기준 중국 업무시간에서 점심시간을 뺀 구간입니다. 베이징 시간 12:00–14:00는 비피크입니다. 미국 팀은 업무시간 전체를 비피크 요금으로 사용할 수 있지만, 유럽 팀은 오전 배치 작업(CEST 08:00–12:00가 피크)에 요금이 두 배로 붙습니다. 해당 작업은 오후나 야간으로 옮기는 편이 낫습니다.

그래도 프롬프트 캐싱을 써야 할까

그렇습니다. 할인폭이 줄었을 뿐, 사라진 것은 아닙니다. 기존에는 캐시 적중 입력이 Flash의 캐시 미적중 입력보다 약 50배, Pro에서는 120배 저렴했습니다. 지금은 두 모델 모두 약 30배 저렴합니다. 비피크 기준 Flash는 $0.007 대 $0.22로 31배, Pro는 $0.022 대 $0.66으로 30배 차이입니다. 2.7배 인상을 직접 계산한 감사 작성자도 다음과 같이 결론 내렸습니다.

“캐싱은 여전히 확실히 쓸 가치가 있다” - 같은 r/DeepSeek 감사 결과

해당 워크로드에서는 같은 컨텍스트를 캐시 없이 매번 보낼 때보다 캐싱으로 비용이 약 15배 줄었습니다. 다만 캐싱은 최선형 방식이라 적중률이 보장되지 않고, 사용하지 않은 캐시 항목은 일반적으로 수 시간에서 수일 뒤 삭제됩니다(BenchLM). 예산을 잡기 전에 실제 사용량을 측정해야 합니다. prompt_cache_hit_tokens와 prompt_cache_miss_tokens 사용량 객체 필드를 기록하면 BenchLM의 권장 방식대로 실제 적중률을 계산할 수 있습니다.

가격이 오른 뒤에도 DeepSeek는 여전히 저렴한가

비피크에는 그렇습니다. 다만 피크에는 Flash 기준 GPT-5.6과의 격차가 사실상 사라집니다. 다음은 일반 요금 기준 100만 토큰당 출력 가격입니다.

모델입력출력비고
DeepSeek V4 Flash (비피크)$0.22$0.66컨텍스트 1M
DeepSeek V4 Flash (피크)$0.44$1.32Luna 출력 가격보다 높음
GPT-5.6 Luna$0.20$1.207월 30일 가격 80% 인하
DeepSeek V4 Pro (비피크)$0.66$1.98여전히 Terra보다 약 6배 저렴
DeepSeek V4 Pro (피크)$1.32$3.96Terra보다 약 3배 저렴
GPT-5.6 Terra$2$12
Claude Sonnet 5$2$108월 31일까지 출시 요금, 이후 $3/$15

비피크 기준 V4 Flash 출력은 $0.66로 GPT-5.6 Luna보다 45%, Terra보다 18배 저렴합니다. 대규모 작업에서 DeepSeek가 출력 비용 최저라는 점은 여전히 유효합니다. 하지만 피크에는 Luna가 입력 $0.20, 출력 $1.20으로 Flash보다 두 항목 모두 저렴합니다. 물론 Luna의 캐시 읽기 요금은 AI Price Index 변경 기록 기준 $0.02/M으로, 어느 시간대든 Flash의 캐시 적중 요금보다 비쌉니다. Flash는 공식 사양표에 컨텍스트 1M 토큰과 동시성 2,500도 명시돼 있습니다. 공지 스레드의 한 댓글을 빌리면, “DS4는 좋지만, 쌀 때만 그렇다”는 평가입니다.

이번 주에 할 일

  1. 당장 걱정하기 전에 실제 청구액부터 다시 계산하세요. 지난달 사용량 로그를 꺼내 다음 식으로 계산하면 됩니다. 캐시 적중 입력 × 적중률 × 적중 단가 + 캐시 미적중 입력 × 미적중률 × 미적중 단가 + 출력 × 출력 단가입니다. 각 요청이 실행된 시간대에 맞춰 피크 또는 비피크 요금을 적용해야 합니다. 감사 결과가 보여주는 범위는 캐시 적중 0%일 때 1.5배, 적중률 98%일 때 2.7배입니다.
  2. 배치 작업은 피크를 피하세요. 크론 작업, 평가, 문서 처리처럼 사용자가 기다리지 않아도 되는 작업은 하루 17시간의 비피크 시간대에 돌릴 수 있습니다. 미국 팀은 업무시간 자체가 이미 비피크라 조정 효과가 거의 필요 없고, 유럽 팀은 오전 배치를 오후로 옮기는 것이 좋습니다.
  3. 지금 나오는 캐시 적중을 계속 유지하세요. 현재 캐시 적중을 만들어내는 프롬프트 구조가 있다면 그대로 유지하는 편이 낫습니다. 캐시 적중 입력은 여전히 캐시 미적중 입력보다 약 30배 저렴합니다.
  4. 일상적인 요청은 Flash로 낮춰 테스트해 보세요. Pro는 전 구간에서 Flash보다 3배 비싸고, 캐시 적중 입력 기준으로는 3.1배입니다. 0731 포스트 트레이닝 업데이트 이후 Flash를 다시 테스트하지 않았다면 일상적인 트래픽 일부를 Flash로 보내보세요. 모델 선택에 따른 차이는 V4 Flash와 V4 Pro 비교 글에서 다뤘습니다.
  5. 떠나더라도 마이그레이션은 간단할 수 있습니다. OpenAI 호환 클라이언트라면 base URL과 모델 ID만 바꾸면 될 수 있습니다. 서드파티 호스트와 릴레이 플랫폼은 자체 요금표를 적용합니다. DataLLM Lab은 이번 인상 전에도 V4 Pro를 100만 토큰당 약 $1.74/$3.48로 제시한 호스트들을 정리했습니다. 표시 가격이 아니라 실제 적용 단가를 비교해야 합니다.

사용자 유형별 결론은 다음과 같습니다.

사용 패턴판단
미국 시간대, 캐시를 많이 쓰는 에이전트 트래픽유지 - 비피크 요금과 약 30배 저렴한 캐시 경로 덕분에 캐시 중심 입력 비용이 가장 낮음
유럽 시간대, 오전 배치 작업유지하되 일정 변경 - 피크 노출은 피할 수 있고 스스로 만든 비용임
피크 시간에만 실행되는 Pro 기반 품질 민감 코딩재검토 - Pro 피크 출력은 $3.96으로 여전히 Terra의 $12보다 낮지만, 격차는 8월 16일 전의 14배가 아니라 이제 3배
캐시가 없는 일회성 워크로드유지 - 표에 나온 인상폭 중 가장 작은 비피크 1.5~2.3배 구간

FAQ

새 DeepSeek 요금은 정확히 언제부터 적용됐나

2026년 8월 16일 16:00 UTC, 베이징 시간으로 8월 17일 자정부터입니다. r/DeepSeek의 공지 스레드와 650회 호출 감사 결과가 같은 시점을 확인했으며, 공식 가격 페이지에도 당일 새 요금표가 게시됐습니다.

DeepSeek 청구액은 얼마나 오르나

캐시를 전혀 쓰지 않는 워크로드는 비피크 기준 약 1.5배, 적중률 98%로 측정된 워크로드는 2.7배로 재산정됐습니다. 피크에는 이 수치가 두 배가 되며, Pro 캐시 적중 입력은 최대 12배까지 오릅니다. 모든 요금의 인상 배수는 위 비교표에서 확인할 수 있습니다.

미국 시간대에서 피크는 언제인가

미 동부는 21:00–00:00와 02:00–06:00, 미 서부는 18:00–21:00와 23:00–03:00입니다. 미국의 일반적인 업무시간은 전부 비피크 구간에 들어갑니다.

deepseek-chat과 deepseek-reasoner는 아직 사용할 수 있나

아니요. BenchLM의 모델 ID 기록에 따르면 레거시 별칭은 2026년 7월 24일 지원 종료 시한에 도달했습니다. 새 통합에는 deepseek-v4-flash 또는 deepseek-v4-pro를 사용해야 합니다.

DeepSeek는 여전히 GPT-5.6과 Claude보다 저렴한가

비피크에는 그렇습니다. Flash 출력은 GPT-5.6 Luna보다 45%, Terra보다 18배 저렴합니다. 다만 피크에는 Luna의 100만 토큰당 출력 요금 $1.20이 Flash의 $1.32보다 낮습니다. 따라서 실제 트래픽이 어느 시간대에 실행되는지에 따라 답이 달라집니다.