AIREITER

GPT-5.6 Luna vs DeepSeek V4 Pro: 두 API를 직접 비교 테스트했다

마지막 업데이트: 2026-08-10 10:52:53

동일한 프롬프트 세 개를 API로 돌린 결과, GPT-5.6 Luna와 DeepSeek V4 Pro는 모두 3개 과제를 정확히 풀었다. 이번 선택에서 모델의 순수 성능은 결정타가 아닐 가능성이 크다. 실제 차이는 가격 구조와 응답 지연에서 갈린다. 특히 DeepSeek 공식 가격 페이지에는 상당한 가격 인상이 예정돼 있다는 경고도 올라와 있다. 아래는 2026년 8월 10일에 측정한 결과와 워크로드별 선택 기준이다.

동일 프롬프트 3종으로 API 응답 속도와 정확도 확인

2026년 8월 10일, 같은 API 파이프라인에서 GPT-5.6 Luna와 DeepSeek V4 Pro를 각각 기본 설정으로 테스트했다. 과제는 일부러 짧게 지시한 Python 버그 수정("reply with the corrected function only"), 정답이 하나인 3개 도크 트럭 스케줄링 문제(10:10), nullable 필드가 포함된 엄격한 JSON 추출이었다. 두 모델 모두 세 과제를 정확히 처리했다.

작업GPT-5.6 LunaDeepSeek V4 Pro
Python merge_intervals 버그 수정정답 (max() 수정), 10.7초정답 (max() 수정), 16.1초
도크 스케줄링 추론정답 (10:10), 8.0초정답 (10:10), 27.2초
엄격한 JSON 추출유효, 스키마 완전 일치, 3.0초유효, 스키마 완전 일치, 7.6초
동일 프롬프트 세 개에서의 GPT-5.6 Luna와 DeepSeek V4 Pro 지연 시간 비교

다만 이 결과를 벤치마크로 볼 수는 없다. 세 가지 과제만 확인한 스팟 테스트다. V4 Pro는 기본값으로 thinking 모드가 켜져 있어, 여기서 나타난 2~3배의 지연 시간 차이 대부분을 설명한다. 요청별로 끌 수 있지만, 어려운 추론 성능은 일부 포기해야 한다. 지시 이행 면에서도 차이가 있었다. Luna는 요청대로 함수만 반환했지만, V4 Pro는 Markdown 코드 펜스로 감쌌다. 채팅 화면에서는 문제없지만 파이프라인에서는 파싱 단계가 하나 더 필요하다. 안정성을 보기 위해 스케줄링 문제를 한 번 더 실행했고, 두 모델 모두 다시 10:10이라고 답했다.

공식 가격으로 비교한 비용과 DeepSeek의 가격 인상 경고

2026년 8월 10일 양사 공식 페이지를 기준으로 확인한 가격은 다음과 같다. GPT-5.6 Luna는 입력 100만 토큰당 $0.20, 캐시 입력 $0.02, 출력 $1.20이다(OpenAI 모델 페이지). DeepSeek V4 Pro는 캐시 미스 입력 100만 토큰당 $0.435, 캐시 히트 입력 $0.003625, 출력 $0.87이다(DeepSeek 가격 페이지).

GPT-5.6 Luna와 DeepSeek V4 Pro의 공식 API 100만 토큰당 가격 비교

따라서 어느 한쪽을 일괄적으로 더 저렴하다고 말하기는 어렵다. 캐시되지 않은 입력은 Luna가 54% 저렴하고, 출력은 V4 Pro가 27% 저렴하다. 캐시 히트 입력은 V4 Pro가 Luna보다 5.5배 저렴하다. 결국 토큰 구성에 따라 결론이 달라진다.

  • 인터랙티브 채팅 (호출당 입력 1K + 출력 500): Luna $0.0008, V4 Pro $0.00087로 사실상 차이가 없다.
  • 리포지터리 리뷰 (신규 입력 50K + 출력 3K): Luna $0.0136, V4 Pro $0.0244. Luna가 44% 저렴하다.
  • 에이전트 루프 (반복당 캐시 입력 200K + 신규 입력 20K + 출력 10K): Luna $0.020, V4 Pro $0.018이다. 이 경우 V4 Pro가 앞서며, 캐시된 반복이 추가될수록 격차는 더 커진다.
가격과 컨텍스트 윈도우가 표시된 GPT-5.6 Luna 공식 모델 페이지

이 비용 계산에는 유효기간을 바꾸는 변수도 있다. DeepSeek 가격 페이지의 각주 2에는 다음과 같이 적혀 있다. "We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected." 날짜나 인상 폭은 제시되지 않았다. 하지만 V4 Pro 선택의 근거가 가격이라면, 공식적으로 가격 인상 경고가 붙어 있는 셈이다. Luna의 가격은 반대 방향으로 움직였다. OpenAI의 8월 GPT-5.6 가격 인하와 함께 출시됐다.

가격 인상 각주가 포함된 DeepSeek V4 Pro 공식 가격표

캐시를 많이 쓰는 에이전트라면 V4 Pro가 유리하다

캐시 입력 100만 토큰당 DeepSeek V4 Pro의 가격은 $0.003625, Luna는 $0.02다. 5.5배 차이는 긴 고정 프리픽스를 반복해서 읽는 에이전트 워크로드에서 비용을 좌우한다. 실제 에이전트 운영 개발자들도 이 점을 주목하고 있다.

DeepSeek v4 Pro & MiMo v2.5 Pro ... are insanely cheap for agent-driven work due to their super low cached-input prices ($0.0036/mtok). For Luna, the cached-input price ... the pricing page puts it at $0.02/mtok, & that's 5x more expensive. — Hacker News 댓글 작성자, GPT-5.6 출시 스레드에서

Luna의 캐시 쓰기 할증도 고려해야 한다. 캐시 쓰기는 캐시되지 않은 입력 가격의 1.25배로 청구된다(OpenAI 모델 페이지). 또한 입력이 272K 토큰을 넘는 요청은 전체 요청에 대해 입력 2배, 출력 1.5배 요금이 적용된다. 에이전트 컨텍스트가 자주 272K 토큰을 넘는다면, V4 Pro의 캐시 이점이 가장 커지는 구간에서 Luna의 실질 비용은 대략 두 배가 된다.

비용 모델링 전에는 반드시 공식 문서를 확인할 것

이번 비교를 조사하면서 V4 Pro의 입력 가격을 100만 토큰당 $0.435부터 $1.74까지 제시한 외부 자료와, Luna의 컨텍스트 윈도우를 400K부터 1.05M까지로 적은 자료를 확인했다. 확인에는 1분도 걸리지 않는다. 가격은 위에 연결한 두 공식 페이지에서만 확인하고, 모델 버전 문자열도 검토하자. 현재 API는 DeepSeek-V4-Pro를 제공하며 Flash는 -0731에 고정돼 있다. 또 인용된 "입력 가격"이 캐시 히트 기준인지 캐시 미스 기준인지 확인해야 한다. V4 Pro는 두 가격이 120배 차이 난다.

워크로드 적합성을 가르는 핵심 사양

가격 외에 선택을 좌우하는 차이는 네 가지다. 최대 출력량, 입력 모달리티, 오픈 웨이트 여부, API 기능 지원이다. 두 모델 모두 약 100만 토큰의 컨텍스트 윈도우를 제공한다(Luna: 1,050,000 토큰, V4 Pro: 1M). 컨텍스트 길이만으로는 우열을 가리기 어렵다.

사양 (2026년 8월 10일 확인)GPT-5.6 LunaDeepSeek V4 Pro
컨텍스트 윈도우1,050,0001M
최대 출력 토큰128K384K
입력 모달리티텍스트 + 이미지텍스트 전용
추론 제어Effort 레벨 (low→max)Thinking 켜기(기본) / 끄기
오픈 웨이트아니오예 (자체 호스팅 가능)
Responses API예아직 미지원 (공식 발표: 2026년 8월 초)
동시성 제한사용량 티어 기준500
지식 컷오프2026년 2월 16일가격 페이지에 명시되지 않음

V4 Pro의 최대 출력은 384K 토큰으로 Luna의 128K보다 3배 크다. 한 번에 코드베이스를 생성하거나, 긴 번역을 처리하거나, 대량의 구조화 데이터를 추출할 때 청킹으로 인한 실패 가능성을 줄일 수 있다. 반대로 Luna의 이미지 입력은 다른 종류의 작업에서 중요하다. DeepSeek 사용자들도 이 한계를 직접 언급한다.

My only real complaint is that they can't do images, which limits their ability to autonomously debug some kinds of issues. — Hacker News 댓글 작성자, 취미 프로젝트에 DeepSeek을 사용하며

오픈 웨이트는 V4 Pro 쪽의 강점이다. 다운로드와 자체 호스팅이 가능하므로, 데이터 상주 요건이 있다면 이 비교에서는 V4 Pro가 유일한 선택지다. 다만 이 정도 규모의 모델을 서빙하려면 가벼운 주말 프로젝트 수준이 아니라 상당한 멀티 GPU 하드웨어를 준비해야 한다.

벤치마크는 모델보다 Effort 모드에 더 크게 흔들린다

GPT-5.6 Luna와 DeepSeek V4 Pro의 공개 점수는 양쪽에 어떤 Effort 모드를 적용했는지에 따라 승자가 바뀔 수 있다. Luna를 low effort, V4 Pro를 max effort로 실행한 한 트래커에서는 33.3 대 44.3으로 V4 Pro가 이긴다. 반면 두 모델을 모두 max로 실행한 Artificial Analysis에서는 52 대 45로 Luna가 앞선다. 둘 중 하나가 틀린 것이 아니라, 서로 다른 구성을 측정한 결과다.

지연 시간 수치에도 같은 함정이 있다. Artificial Analysis는 max effort에서 Luna의 첫 답변 토큰까지 걸리는 시간을 132초로 보고한다. max effort에서는 Luna가 답변 전 약 2분 동안 추론한다는 뜻이다. 반면 기본 설정으로 진행한 이번 테스트에서는 Luna가 3~10.7초 안에 응답했다. 두 수치 모두 실제 값이지만, 프로덕션 구성과 닮은 것은 하나뿐이다. 출력이 시작된 이후 처리량은 Luna가 뚜렷하게 앞선다. 초당 202토큰 대 78토큰이다(Artificial Analysis).

Effort 모드는 단일 모델의 점수도 크게 바꾼다. V4 Pro는 max thinking에서 GPQA Diamond 90.1%를 기록하지만, thinking을 끄면 72.9%다. 같은 max-effort 벤치마크에서는 Luna가 SWE-Bench Pro에서 62.7% 대 55.4%로 앞서며, BrowseComp에서는 83.3 대 83.4로 사실상 동률이다. 점수표를 신뢰하기 전에 세 가지를 확인해야 한다. 어떤 Effort 모드를 실행했는지, 지연 시간에 thinking 시간이 포함됐는지, 그리고 벤치마크 버전이 같은지다. 한 트래커의 Terminal-Bench 84.7 대 67.9 격차는 v2.1과 v2.0을 비교한 결과다.

그래서 어떤 모델을 골라야 할까?

사용자 대면 제품이라면 GPT-5.6 Luna를 권한다. 기본 설정 테스트에서 세 과제 모두 2~3배 빨랐고, 캐시되지 않은 입력 가격은 V4 Pro의 절반 수준이며, 이미지도 받을 수 있다. 캐시 비중이 높은 에이전트 루프, 128K 토큰을 넘는 출력, 자체 하드웨어에서 반드시 실행해야 하는 작업에는 DeepSeek V4 Pro가 맞다. 단, 장기 계약을 검토한다면 공식 가격 인상 경고를 비용 계획에 반영해야 한다. GPT-5.6 Luna와 DeepSeek V4 Pro는 엔드포인트만 바꾸면 되므로, 도입 전 실제 워크로드에서 위 세 프롬프트를 직접 재실행해 보는 것도 어렵지 않다.

워크로드추천결정 요인
챗봇, 사용자 대면 앱Luna테스트 기준 3.0~10.7초 대 7.6~27.2초 지연 시간, 202 대 78 tok/s
대량의 신규 입력 처리Luna캐시되지 않은 입력 100만 토큰당 $0.20 대 $0.435
고정 컨텍스트 기반 에이전트 루프V4 Pro캐시 입력 100만 토큰당 $0.003625 대 $0.02
한 번에 긴 출력 생성V4 Pro최대 출력 384K 대 128K
비전 작업 (스크린샷, 이미지형 PDF)LunaV4 Pro는 텍스트 전용
자체 호스팅 / 데이터 상주V4 Pro오픈 웨이트, Luna는 API 전용
2027년까지의 예산 확실성LunaDeepSeek의 공식 가격 인상 공지

FAQ

GPT-5.6 Luna와 DeepSeek V4 Pro 중 어느 쪽이 더 저렴한가?

항상 한쪽이 더 저렴한 것은 아니다. 캐시되지 않은 입력은 Luna가 54% 저렴하다(100만 토큰당 $0.20 대 $0.435). 반면 캐시 입력은 V4 Pro가 5.5배 저렴하고($0.003625 대 $0.02), 출력도 27% 저렴하다($0.87 대 $1.20). 캐시를 많이 쓰는 에이전트는 V4 Pro가, 신규 입력 비중이 높은 워크로드는 Luna가 더 저렴하다.

두 모델 모두 100만 토큰 컨텍스트 윈도우를 지원하나?

그렇다. Luna는 1,050,000 토큰, V4 Pro는 1M 토큰을 제공한다. 단, Luna는 입력이 272K 토큰을 초과하면 전체 요청에 입력 2배, 출력 1.5배 요금이 적용된다.

DeepSeek V4 Pro는 오픈 소스이며 자체 호스팅할 수 있나?

그렇다. V4 Pro는 오픈 웨이트로 제공돼 자체 호스팅할 수 있다. API 전용인 Luna와의 차이점이다. 다만 단일 워크스테이션이 아니라 멀티 GPU 서빙 하드웨어를 계획해야 한다.

GPT-5.6 Luna는 이미지 입력을 지원하나?

지원한다. Luna는 텍스트와 이미지를 모두 입력으로 받는다. DeepSeek V4 Pro는 텍스트 전용이며, 사용자들은 비전 지원 부재를 자율 디버깅 워크플로의 주요 제약으로 꼽는다.

각 모델의 최대 출력 토큰은 얼마인가?

DeepSeek V4 Pro는 응답당 최대 384K 토큰을 출력할 수 있고, GPT-5.6 Luna의 한도는 128K다. 긴 문서나 대규모 코드 파일을 한 번에 생성해야 한다면 V4 Pro의 출력 한도는 3배 더 높다.

함께 읽기