Hy3 vs DeepSeek V4 Flash: 가격, 컨텍스트, 실제 피드백

마지막 업데이트: 2026-07-14 13:22:02

당신의 작업 부하가 대략 150K tokens의 context 이하에서 유지되는 coding agent라면, Hy3가 더 스마트한 model이며 input token당 비용도 거의 같습니다. 세션이 길게 이어지거나, repo가 크거나, production에서 높은 concurrency가 필요하다면, DeepSeek V4 Flash가 Hy3가 따라갈 수 없는 세 가지 수치에서 우위를 점합니다: 1M-token context window, 문서화된 $0.0028 cache-hit 가격, 그리고 2,500-request concurrency ceiling입니다. 이것이 hy3 vs deepseek v4 flash 결정의 간단한 요약입니다. 그 근거는 다음과 같습니다: 2026년 7월 14일에 DeepSeek의 공식 docs와 OpenRouter의 실시간 listings를 기준으로 pricing을 확인했고, third-party benchmark data와 Hacker News 및 Reddit의 developers가 두 모델을 매일 사용한 뒤 보고한 내용도 반영했습니다.

두 가지 모델, 서로 다른 두 가지 베팅

Tencent 는 2026년 7월 6일 최종 Hy3를 출시했으며, 4월 23일부터 제공되던 미리보기 버전을 업그레이드했습니다. 해당 발표에 따르면, 이 모델은 총 295B 파라미터와 21B 활성 파라미터를 가진 Mixture-of-Experts 모델로, Tencent가 하이브리드 fast-and-slow thinking이라고 부르는 방식에 기반해 구축되었습니다. 즉, 모델은 요청마다 얼마나 많은 추론을 사용할지 결정합니다. 컨텍스트는 최대 256K tokens까지 지원합니다. 가중치는 Apache 2.0 아래에서 공개되어 있으며, API는 Tencent Cloud TokenHub에서 실행됩니다.

DeepSeek V4 Flash는 2026년 4월에 V4 패밀리의 고속 등급으로 출시되었습니다. 또한 open-weights MoE(총 284B, 활성 13B, Artificial Analysis 기준)이지만 MIT 라이선스가 적용되며, 다른 목표에 맞게 조정되었습니다: 1M 토큰의 컨텍스트를 저렴하게 제공하는 것입니다. thinking 모드와 non-thinking 모드를 모두 지원하며(thinking이 기본값), 최대 출력은 384K 토큰입니다.

매개변수 수는 비슷해 보입니다. 하지만 설계 목표는 다릅니다. Hy3는 예산을 토큰당 추론 품질에 사용하고, Flash는 컨텍스트 길이, 캐시 효율성, 처리량에 사용합니다. 아래의 대부분의 실질적인 차이는 이 분기에서 비롯됩니다.

사양 (검증됨 2026-07-14)Hy3DeepSeek V4 Flash
매개변수총 295B / 활성 21B총 284B / 활성 13B
컨텍스트 윈도우256K1M (최대 출력 384K)
추론하이브리드 빠른/느린 사고사고 + 비사고 모드
라이선스Apache 2.0MIT
출시2026년 7월 6일 (프리뷰 4월 23일)2026년 4월
공식 APITencent Cloud TokenHubapi.deepseek.com (OpenAI + Anthropic formats)

벤치마크가 실제로 보여주는 것

Artificial Analysis Intelligence Index v4.1에서 Hy3는 추론 모드의 고노력 조건에서 DeepSeek V4 Flash에 대해 37점에 41점을 기록했습니다. 그 인덱스에서 4점 차이는 실제로 꽤 큰 격차로, 대략 Flash와 그 아래 한 단계 모델들 사이의 거리와 비슷하지만, 급의 차이라고 보기는 어렵습니다. 두 모델 모두 "매우 유능하지만 최전선은 아닌" 구간에 속합니다.

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

그 점수를 너무 과하게 반영하기 전에 두 가지 유의사항이 있습니다.

먼저, agentic coding 벤치마크는 두 모델 모두에 대해 훨씬 더 가혹한 이야기를 전합니다. Hacker News 출시 스레드의 한 댓글 작성자가 Hy3의 DeepSWE 결과를 찾아냈는데: 28%로, 최대 노력 시 GPT-5.4의 52%에 한참 못 미칩니다. 두 중국 모델 모두 frontier agentic coding에 근접하지 못하며, 최고 리더보드의 최상위와 경쟁하는 것이 아니라 서로와 경쟁하고 있습니다.

둘째, 두 회사 중 어느 쪽이든 벤더가 공개한 벤치마크 표는 통상적인 수준의 회의감으로 받아들여야 합니다. Hy3의 출시 수치는 HN 스레드에서 곧바로 "benchmaxxed"라는 비난을 불러왔고, DeepSeek의 자체 표 역시 자신들이 실행하기로 선택한 평가만 포함합니다. 위의 제3자 수치가 제가 기준으로 삼을 만한 것이며, 그것들이 말해주는 바는 이렇습니다: Hy3가 다소 더 똑똑하고, 격차는 가격과 맥락에 따라 선택을 뒤집을 수 있을 만큼 작습니다.

가격: 표시 가격은 주의를 분산시키는 요소입니다

2026년 7월 14일에 확인했으며, 별도로 유지할 가치가 있는 두 개의 가격표입니다. DeepSeek는 API 문서에 정확한 1차 출처 per-token 가격을 게시합니다. Tencent는 최종 Hy3에 대해 이에 상응하는 영어 요율표를 게시하지 않습니다 — 보도자료에서는 TokenHub에서 Hy3 preview 입력이 대략 백만 토큰당 $0.18이라고 밝힙니다 — 따라서 아래 Hy3 열은 1차 출처 가격이 아니라 마켓플레이스 가격인 OpenRouter의 게시된 요율을 사용합니다.

1M 토큰당Hy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
입력$0.14$0.14 (cache miss)
입력, 캐시됨$0.035$0.0028 (cache hit)
출력$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

입력 가격은 동일합니다. 결정은 나머지 두 행에 있습니다.

캐시 적중 배수

DeepSeek의 cache-hit 가격은 cache-miss 가격보다 50배 저렴하고, OpenRouter에서의 Hy3의 cached rate보다 12.5배 저렴합니다. (두 cache rate가 엄밀히 동등한 것은 아닙니다. DeepSeek의 것은 first-party API 가격이고, Hy3의 것은 OpenRouter의 하위 provider들이 cache reads에 대해 부과하는 요금이기 때문입니다. 하지만 이것이 바로 오늘 실제로 지불하게 될 rate입니다.) 에이전트를 실행한다면, 이것은 이 페이지의 다른 어떤 수치보다도 더 중요합니다. agent loop는 매 턴마다 system prompt, tool definitions, file contents, conversation history처럼 점점 늘어나는 동일한 context를 다시 전송합니다. 40-turn session에서는 input tokens의 대부분이 반복분입니다. 90% cache-hit rate에서는 Flash의 effective input price가 million tokens당 $0.14에서 약 $0.017로 떨어집니다. Hy3는 약 $0.045까지 떨어집니다. 여전히 저렴하지만 거의 3배 더 비싸며, session이 길어질수록 그 격차는 더 커집니다.

출력 토큰은 Hy3가 비싸지는 지점입니다

둘 다 추론 모델이므로, 둘 다 사고 토큰을 출력으로 과금합니다. Hy3의 출력 요금인 $0.58은 Flash의 $0.28보다 두 배 이상 높아서, 각 확장 추론 체인은 Hy3 사용자에게 대략 두 배의 비용이 듭니다. 또한 Flash에는 Hy3에 없는 안전장치가 하나 있습니다. 기계적인 작업(서식 지정, 추출, 간단한 편집)에서는 비사고 모드로 전환해, 필요하지 않은 추론 비용 지불을 멈출 수 있습니다. deepseek-v4-flash-vs-deepseek-v4-pro 분석에서는 이 모드 전환이 실제로 어떻게 작동하는지 다룹니다.

무료 티어

Hy3의 진짜 장점 하나: OpenRouter는 tencent/hy3:free 변형을 무료로 제공하며, 속도 제한은 있지만 실제로 사용할 수 있습니다. 모델을 본격적으로 쓰기 전에 평가해보려는 경우, 무료 API 요금제가 없는 Flash보다 낫습니다. Hy3 preview도 여전히 $0.063/$0.21로 표시되어 있으며 — 최종 출시 가격보다 낮습니다 — 4월 체크포인트를 감수할 수 있다면 말입니다.

컨텍스트 윈도우 세금

Hy3의 256K 컨텍스트는 실제 코드베이스에 에이전트를 돌려 보기 전까지는 충분해 보입니다. 같은 하니스에서 두 모델을 모두 실행한 r/hermesagent의 Reddit 사용자는 Hy3를 “컨텍스트 크기만 다르고, 그래서 자주 압축이 필요하다는 점을 제외하면 거의 동일하다”고 불렀습니다. 압축은 단순한 불편함 그 이상입니다. 각 압축 주기마다 요약을 위해 출력 토큰을 소모하고, 세부 사항을 버리며, 프롬프트 캐시를 무효화합니다. 즉, 캐시를 다시 만들기 위해 캐시 미스 비용을 치르게 된다는 뜻입니다.

자체 호스팅을 하면 그 격차는 구조적으로 커집니다. V4 아키텍처의 sparse-attention 설계(DeepSeek는 이 메커니즘을 lightning indexer라고 부릅니다)는 Hy3의 기존 attention보다 KV cache를 훨씬 더 가볍게 만듭니다. 이들은 벤치마크가 아니라 개별 사용자 보고이지만, HN 스레드의 수치는 매우 뚜렷합니다. DGX Sparks 두 대에서 둘 다 실행한 한 댓글 작성자는 DeepSeek V4 Flash와 함께 3M 토큰의 KV cache를 수용할 수 있다고 보고한 반면, Hy3를 FP4로 양자화했을 때는 대략 130K 토큰에 그쳤습니다. 또 다른 사람은 llama.cpp가 indexer를 완전히 지원하게 되면 Flash의 전체 1M context에 RAM이 약 6GB만 필요할 것이라고 추정했습니다. Flash는 공격적인 quantization을 견뎌낸 이력도 있습니다. 같은 스레드의 여러 사용자가 2-bit에서도 일관성을 유지한다고 보고했는데, 이는 아직 Hy3에서는 입증되지 않은 결과입니다.

사용 사례가 200K tokens 이하에 머무른다면, 이 전체 섹션은 비용이 전혀 들지 않으며 Hy3의 추가 지능 점수 4점은 무료입니다. 만약 그렇지 않다면, 컨텍스트 세금은 누적됩니다: 더 많은 압축, 더 많은 캐시 무효화, 세션당 더 많은 메모리.

출시 이후 현장 보고서

제가 발견한 가장 유용한 신호는 어떤 벤치마크 표에도 있지 않습니다. 개발자들이 두 모델을 모두 코딩 에이전트 안에서 실행할 때 설명하는 성격의 차이입니다.

같은 Hacker News 스레드의 한 사용자는 Anthropic 구독을 취소한 뒤 DeepSeek V4 Flash와 Pro를 일상용으로 쓰다가 Hy3도 시도해 봤는데, Flash를 이렇게 묘사했다: 속도는 훌륭하지만, “종종 완전히 잘못된 정신 모델을 만들어 내고는 엉뚱한 방향으로 달려가며,” 정기적인 수정과 히스토리 압축이 필요하다는 것이다. 그들의 경험에 따르면 Hy3는 “그렇게 빠르지는 않지만, 지금까지는 훨씬 더 안정적으로 제대로 된 경로를 유지하는 것 같다”고 했고, 컨텍스트가 길어질수록 성능 저하도 더 적다고 했다. 같은 스레드의 다른 이들은 크기에 비해 Hy3의 세계 지식과 글쓰기 품질이 Flash보다 낫다고 칭찬했다.

Reddit의 상황은 원시 코딩 출력에 대해서는 반대 방향으로 기울어져 있습니다. r/LLMDevs의 동일 작업 비교에서는 "DeepSeek V4 Flash > Hy3 > GLM"으로 순위를 매기면서도 Hy3를 "실용적인 코딩 워크플로우에 유망하다"고 평가했습니다. r/opencode에서는 반복적으로 나오는 의견이 Flash가 일상적인 에이전트 작업에는 "충분하다"는 것입니다.

고려해야 할 운영 실적도 있습니다. Hy3의 출시 수요는 Tencent의 제공 용량을 초과했습니다. HN 스레드의 사용자들은 심한 rate limiting을 보고했으며, OpenRouter의 공개 사용 순위를 추적하는 한 사용자는 해당 모델이 한 달 만에 1위에서 8~9위로 떨어졌다고 지적하면서, 그 하락을 이러한 제한에 직접적으로 돌렸습니다. 반면 DeepSeek는 공식 API에서 Flash의 동시 요청 상한을 2,500 requests로 문서화하고 있으며, 이는 V4 Pro에 허용하는 수치의 5배입니다. 프로덕션 트래픽의 경우, 이들 벤더 중 하나는 용량 보장을 공개했고 다른 하나는 혼잡 이력을 가지고 있습니다.

선택하는 방법

  • 에이전트 코딩, ~150K 토큰 이하 세션: Hy3. 더 높은 추론 품질을 제공하고, 작업에 더 잘 집중하며, 입력 비용도 Flash의 표기 가격과 같습니다. (150K를 쓰는 이유는 전체 256K가 아니라 에이전트 컨텍스트가 빠르게 늘어나기 때문이며, 압축이 시작되기 전에 여유를 남겨두고 싶기 때문입니다.)
  • 긴 세션, 대형 저장소, 대용량 문서에 대한 RAG: 일반적으로 Flash가 더 적합합니다. 1M 윈도우와 50배 캐시 할인은 완전히 다른 비용 범주이며, Hy3의 압축 오버헤드는 지능상의 우위를 갉아먹습니다.
  • 대규모 프로덕션 API: Flash. 문서상 2,500 동시성, 안정적인 서빙 이력, 그리고 저렴한 대량 호출을 위한 non-thinking mode.
  • 글쓰기, 리서치, 세계 지식 작업: Hy3. 커뮤니티 보고와 AA 지식 평가 모두 이 규모에서는 이를 선호합니다.
  • 로컬 배포: 대부분의 하드웨어에서는 Flash. KV cache 효율성과 양자화 복원력에 대한 현장 증거가 훨씬 더 많습니다. 출시 스레드에서 인용된 Tencent의 Hy3 서빙 가이드라인 자체도 H20급 GPU 8개입니다.
  • 도입 전에 평가하기: Hy3의 무료 OpenRouter 티어는 시도해 보는 데 비용이 들지 않습니다. 누구의 벤치마크 표도, 이 표를 포함해, 믿기 전에 여러분 자신의 작업을 직접 실행해 보세요.

어디에서 실행할까

DeepSeek V4 Flash: 공식 API는 OpenAI 형식(api.deepseek.com)과 Anthropic 형식(api.deepseek.com/anthropic) 엔드포인트를 모두 제공하므로, base-URL만 변경하면 Claude 호환 도구에 바로 적용할 수 있습니다. 같은 가격 안내 페이지의 마이그레이션 마감일에 주목하세요: 기존 deepseek-chatdeepseek-reasoner 모델 이름은 2026년 7월 24일에 지원 중단되며, 각각 Flash의 non-thinking 모드와 thinking 모드에 대응됩니다. OpenRouter에서는 $0.09/$0.18로 제공되어 공식 요금보다 약간 저렴하지만, 공식 API의 cache-hit 가격은 적용되지 않습니다.

Hy3: Tencent Cloud TokenHub는 첫 번째 당사자 경로입니다. OpenRouter는 최종 릴리스, 더 저렴한 프리뷰 체크포인트, 그리고 무료 티어를 제공합니다. SiliconFlow는 출시 프로모션을 제공해 왔습니다. GPU가 있다면 Apache 2.0 하에서 자체 호스팅이 가능합니다. Hy3 API 설정 가이드에서는 키를 얻고 첫 번째 호출을 만드는 과정을 안내합니다.

자주 묻는 질문

Hy3를 무료로 사용할 수 있나요?

부분적으로 그렇습니다. OpenRouter는 비용이 0인 rate-limited tencent/hy3:free 티어를 제공하며, Tencent의 소비자용 제품(Yuanbao, ima)은 Hy3를 무료로 사용합니다. TokenHub 또는 OpenRouter의 유료 티어를 통한 프로덕션 API 액세스는 토큰당 과금됩니다.

Hy3는 Tencent Hunyuan와 동일한가요?

네 — Hy3는 Tencent의 Hunyuan 모델 라인의 세 번째 세대이며, Tencent는 현재 이를 "Tencent Hy"로 브랜드화하고 있습니다. 프리뷰는 2026년 4월 23일에 출시되었고, 최종 릴리스는 2026년 7월 6일에 이루어졌습니다.

코딩에 더 좋은 것은 무엇인가요, Hy3 아니면 DeepSeek V4 Flash?

작업 형태별로 나뉜 커뮤니티 결과입니다. 같은 작업에서의 Reddit 비교에서는 Flash의 원시 출력이 Hy3보다 더 높은 순위를 차지했지만, 장시간 세션의 에이전트 사용자들은 Hy3가 더 안정적으로 흐름을 유지한다고 보고합니다. 짧고 범위가 명확한 작업은 Flash의 속도를 선호하며, 방향 이탈이 치명적인 여러 시간에 걸친 에이전트 세션에서는 컨텍스트가 256K 윈도우 안에 여유롭게 들어가는 한 Hy3가 더 적합합니다.

DeepSeek V4 Flash를 로컬에서 실행할 수 있나요?

예, 그리고 Hy3보다 더 실용적입니다. 가중치는 MIT 라이선스이며, 아키텍처의 KV 캐시는 이례적으로 가볍고, 사용자들은 약 96GB의 RAM을 가진 머신에서도 2비트 양자화로 사용 가능한 품질을 보고합니다.

왜 hy3와 deepseek v4 flash의 가격 비교가 이렇게 혼란스러운가요?

최소 네 개의 가격표가 있기 때문입니다: Tencent TokenHub, OpenRouter의 Hy3 final 및 preview 목록, 그리고 별도의 캐시 적중률을 가진 DeepSeek의 공식 API입니다. 자신의 트래픽 패턴에 맞춰 유효 가격을 비교해 보세요: 캐시된 입력은 에이전트 워크로드에서 큰 비중을 차지하며, 바로 그 부분에서 DeepSeek의 $0.0028 요금은 따라잡기 어렵습니다.

핵심 요약

Hy3는 이용 가능한 제3자 근거를 보면 더 강력한 모델입니다. 반면 DeepSeek V4 Flash는 더 강력한 서비스입니다. 프로덕션 API 워크로드에서는 Flash가 제 기본 선택입니다. 캐시 경제성, 컨텍스트 윈도우, 그리고 공개된 동시성은 4점의 벤치마크 우위를 상쇄할 수 없을 만큼 서로 복합적으로 작용합니다. 프롬프트당 추론 품질이 규모보다 더 중요할 때는 Hy3를 선택하세요. 그리고 먼저 무료 티어를 사용해 보세요. 자신의 작업과 비교해 확인하는 데 비용이 들지 않기 때문입니다.

관련 읽을거리