AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash API — DeepSeek 정가 이하, 피크 시간대 추가 요금 없음

DeepSeek 정가보다 저렴하고 피크 시간대 할증이 없는 DeepSeek V4.1 Flash API. 1M 컨텍스트, 네이티브 이미지 입력, 최고 수준의 에이전틱 코딩 점수. 직접 사용해 보거나 API를 호출해 보세요.

입력공식 $0.15 100만 토큰당AIReiter $0.1127 100만 토큰당출력공식 $0.60 100만 토큰당AIReiter $0.4507 100만 토큰당캐시 읽기공식 $0.003 100만 토큰당AIReiter $0.0022 100만 토큰당
API로 실행

입력

출력

Example
Generated in
9.3 seconds
입력 Token
184
출력 Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

모델 세부정보

플레이그라운드, API 요청, 내부 워크플로에서 동일한 모델 키를 사용하세요.

모델 ID
deepseek-v4-1-flash
공급자
Deepseek
프로토콜
OpenAI Chat Completions · Anthropic Messages
컨텍스트 창
1,000,000 토큰
최대 출력
384,000 토큰
입력 Token
11.27 credits / 100만 토큰
출력 Token
45.07 credits / 100만 토큰
캐시 읽기
0.225 credits / 100만 토큰
캐시 쓰기
-

DeepSeek V4.1 Flash의 주요 변경 사항

V4.1 Flash는 V4 Flash의 단순 재조정 버전이 아닌 새로운 모델 제품군입니다. DeepSeek는 아키텍처를 재설계하고 45조 개의 멀티모달 토큰을 바탕으로 처음부터 새로 학습시켰으며, 이제 Flash 티어가 대부분의 에이전트 벤치마크에서 V4 Pro를 능가합니다.

인과적 인코더-디코더 MoE

20계층 인코더와 20계층 디코더로 분할된 552B Mixture of Experts 아키텍처입니다. 프롬프트를 읽는 동안 8B, 답변을 생성하는 동안 16B 파라미터만 활성화되므로 이처럼 거대한 모델도 Flash 가격대를 유지할 수 있습니다.

V4 Pro를 능가하는 에이전틱 코딩 성능

DeepSeek 발표에 따르면 Terminal-Bench 2.1에서 V4 Flash의 82.7, V4 Pro의 87.9 대비 90.6을 기록했고, DeepSWE에서는 54.4 및 62.7 대비 74.2, Codeforces에서는 3471을 달성했습니다. Terminal-Bench 3.0에서는 7.6에서 30.0으로 크게 도약했습니다.

별도 추가가 아닌 기본 내장된 Vision 기능

새로운 DeepSeek-ViT 인코더는 첫 사전 학습 단계부터 텍스트 모델과 공동으로 학습되었습니다. V4 Flash는 텍스트 전용이었고 비전 변형은 실험적 모델에 불과했습니다. 이제 스크린샷, 차트, 사진을 프롬프트와 동일한 요청으로 보낼 수 있습니다.

1M 컨텍스트를 위한 1/4 크기의 KV 캐시

압축 희소 어텐션(Compressed sparse attention)과 FP4 KV 스토리지를 통해 글로벌 캐시를 토큰당 약 890바이트로 줄였으며, 이는 V4 Flash의 약 1/4 수준입니다. 이를 통해 1M 토큰 윈도우를 Flash 비용으로 운영할 수 있으며 독립적인 테스트에서 초당 214토큰의 속도를 기록했습니다.

DeepSeek V4.1 Flash vs V4 Flash

DeepSeek에서는 마이그레이션이 이미 자동으로 완료되었습니다. 공식 ID는 이제 deepseek-flash이며 deepseek-v4-flash로 요청하더라도 V4.1로 서비스됩니다. AIReiter에서는 두 모델이 별도로 유지되므로 원하는 버전을 고정하여 사용할 수 있습니다.

더 적은 활성 파라미터, 더 높은 점수

V4 Flash는 모든 토큰에서 13B 파라미터를 활성화합니다. V4.1 Flash는 프리필(prefill) 시 8B, 디코드(decode) 시 16B를 활성화하면서도 DeepSeek가 발표한 모든 에이전트 벤치마크에서 기존 모델을 능가합니다. 프리필 수치가 작아졌다고 해서 성능 저하로 보지 마세요.

항상 활성화되는 사고(Thinking) 모드

V4 Flash는 분리된 사고 모드를 제공했습니다. V4.1 Flash는 연속적인 추론 노력(reasoning effort) 방식을 사용하며 기본값은 high로 설정되어 있습니다. 이 라우트에서는 사고를 비활성화한 요청도 여전히 추론을 반환하므로 이에 맞춰 max_tokens를 설정하세요.

기본 모델에 포함된 이미지 입력

이전에 V4 Flash와 함께 별도의 비전 엔드포인트로 스크린샷을 라우팅했다면, V4.1 Flash는 단 한 번의 호출로 둘 다 처리합니다. 표준 content 배열에 이미지를 base64 데이터 URI로 전송하세요. 이 라우트는 원격 이미지 URL을 가져오지 않습니다.

출력 정가는 2배 인상, 캐시 비용은 유지

공식 출력 가격이 100만 토큰당 $0.28에서 $0.60으로 변경되었습니다. 캐시 히트 입력은 약 $0.003을 유지합니다. 긴 고정 접두사와 짧은 답변으로 구성된 워크로드는 이전과 거의 동일한 비용이 들지만, 긴 답변 생성은 비용이 더 발생합니다.

V4 Flash를 유지해야 하는 경우

고정된 평가 제품군이 있거나, 클라이언트가 툴 루프에서 reasoning_content를 처리할 수 없거나, 엄격한 토큰당 출력 예산으로 인해 이전할 준비가 되지 않은 경우입니다. 그렇지 않다면 V4.1 Flash로 새로운 작업을 시작하세요.

DeepSeek V4.1 Flash API 요금

DeepSeek의 오프피크 기준 공식 요금은 100만 토큰당 입력 $0.15, 출력 $0.60, 캐시 히트 입력 $0.003이며, 평일 01:00~04:00 및 06:00~10:00 UTC에는 세 항목 모두 2배로 책정됩니다. AIReiter는 24시간 단일 고정 요율을 적용하여 오프피크 기준가보다 약 25%, 피크 기준가보다 약 62% 저렴하게 제공합니다.
01

하루 종일 동일한 단일 요금

세 가지 토큰 항목은 각각 DeepSeek 비수기(off-peak) 요금의 약 3/4 수준으로 청구됩니다. 이 라우트에는 피크 시간대가 없으므로 베이징 업무 시간에 실행되는 작업도 야간에 실행되는 작업과 동일한 요금이 청구됩니다. 실시간 요금은 플레이그라운드 상단에서 확인할 수 있습니다.

02

실제 비용 절감 효과

공식 피크 요금 대비 AIReiter 가격은 약 38% 수준입니다. 비수기 요금 대비로는 약 75% 수준입니다. 트래픽이 주로 유럽이나 미국의 낮 시간대(DeepSeek의 피크 시간대)에 집중되어 있다면, 체감되는 절감 효과는 표기된 수치보다 훨씬 큽니다.

03

추론 토큰은 출력으로 과금

이 라우트에서는 사고(Thinking) 기능을 끌 수 없으며, V4.1 Flash는 높은 추론 강도(high effort)에서 상세한 답변을 생성합니다. 독립적인 테스트에 따르면 동일한 작업 세트에서 비교 모델 대비 약 2배의 출력 토큰을 기록했습니다. max_tokens를 추론과 최종 답변을 모두 고려하여 설정하세요.

04

가장 저렴한 캐시 히트 요금

캐시 히트(cache-hit) 입력 토큰 비용은 캐시 미스(cache-miss) 토큰의 약 2% 수준입니다. 턴마다 동일한 시스템 프롬프트와 도구 스키마(tool schema)를 다시 전송하는 에이전트 루프의 경우, 캐시 읽기가 비용의 대부분을 차지하므로 V4.1 Flash를 사용할 때 가장 경제적입니다.

DeepSeek V4.1 Flash의 적합한 활용 사례와 부적합한 사례

DeepSeek는 이제 품질, 비용, 속도 모든 측면에서 Flash를 V4 Pro보다 상위 모델로 포지셔닝하고 있습니다. 다른 모델을 고려할 만한 유일한 이유는 지식 회상 성능과 클라이언트 호환성뿐이며, 순수 모델 역량 차이 때문이 아닙니다.
01

코딩 및 터미널 에이전트에 활용

다중 파일 편집, 테스트-수정 루프, CI 로그 분석, 컴퓨터 사용(computer-use) 작업에서 V4 Flash 및 V4 Pro 대비 성능 향상 폭이 가장 큽니다. 긴 도구 실행 추적 로그도 청킹(chunking) 없이 1M 컨텍스트 윈도우에 모두 수용됩니다.

02

스크린샷 및 차트 처리에 활용

UI 캡처 OCR, 차트 판독, 렌더링된 페이지 확인 작업을 코드 관련 질문과 동일한 단일 요청으로 직접 처리할 수 있습니다. 추가 모델이나 추가 비용이 발생하지 않습니다.

03

호환성 목적일 때만 V4 Pro 사용

DeepSeek가 V4.1 Flash 출시 후에도 V4 Pro 서비스를 유지하는 이유는 벤치마크 점수가 더 높아서가 아니라 고객 요청 때문입니다. 계약 조건이나 고정된 평가 체계에서 요구하는 경우가 아니라면 V4 Pro를 계속 사용할 이유는 없습니다.

04

백과사전식 지식 검색용으로는 지양

기본 모델은 SimpleQA-Verified 벤치마크에서 V4 Pro보다 약 13점 뒤처집니다. 검색(Retrieval) 없는 순수 사실 확인 작업의 경우, 자체 문서로 컨텍스트를 제공하거나 정보 회상(recall)에 특화된 모델을 선택하세요.

05

가격 측면에서 GLM-5.3 Flash와 비교

GLM-5.3 Flash는 AIReiter에서 제공하는 또 다른 멀티모달 플래시 모델로, 출력 비용이 더 저렴합니다. 에이전트 루프나 리포지토리 작업에는 V4.1 Flash를, 대량의 추출 및 분류 작업에는 GLM-5.3 Flash를 선택하는 것이 좋습니다.

DeepSeek V4.1 Flash API 호출 방법

이 페이지의 플레이그라운드와 API는 동일한 모델 ID를 공유합니다. 연동 시 가장 주의해야 할 사항은 도구 루프 내에서 추론(reasoning) 데이터를 처리하는 방식입니다.

01

플레이그라운드에서 실제 에이전트 작업 테스트

오류가 발생한 로그를 diff 및 질문과 함께 붙여넣어 보세요. 추론(reasoning) 과정을 포함하는 출력 토큰을 확인하고, 시스템에 연동하기 전에 응답 품질을 직접 검증할 수 있습니다. 이미지 입력은 API를 통해 지원됩니다.

02

POST /api/v1/chat/completions

모델명 "deepseek-v4-1-flash", AIReiter API 키, 표준 Chat Completions 요청 본문을 사용하세요. 스트리밍도 지원됩니다. Anthropic Messages 형식을 사용하는 스택의 경우 /api/v1/messages 엔드포인트에서도 동일한 ID를 사용할 수 있습니다.

03

도구 사용 시 reasoning_content 왕복(round-trip) 처리

요청에 tools 배열이 포함된 경우, 이전의 모든 어시스턴트 턴은 도구 호출을 수행하지 않은 턴을 포함하여 reasoning_content를 그대로 포함해야 합니다. 이를 누락하면 HTTP 400 오류가 반환됩니다. 이는 V4에서 여러 에이전트 프레임워크 오류를 유발했던 규칙이며 지금도 동일하게 적용됩니다.

04

content 배열에 이미지 첨부 (API)

base64 data URI를 포함한 image_url 파트를 사용하세요. PNG, JPEG, GIF, WebP 형식이 지원됩니다. 이 엔드포인트에서는 원격 이미지 URL을 직접 가져오지 않으므로 바이트 데이터를 인라인으로 전달해야 합니다. 이미지가 질문의 핵심 주제가 아닌 배경 컨텍스트인 경우 텍스트 파트를 먼저 배치하세요.

DeepSeek V4.1 Flash API 관련 질문

모델 id, 가격 책정, V4 Flash 마이그레이션, 이미지 입력, 오류를 반환하는 추론 규칙.

/ 01

DeepSeek V4.1 Flash API의 모델 ID는 무엇인가요?

AIReiter에서는 deepseek-v4-1-flash를 사용합니다. 내부 키는 chat-deepseek-v4-1-flash입니다. DeepSeek 공식 엔드포인트의 공식 ID는 deepseek-flash이며, 기존 deepseek-v4-flash ID 역시 현재 V4.1 Flash로 서비스되고 있습니다.

/ 02

DeepSeek V4.1 Flash의 요금 체계는 어떻게 되나요?

DeepSeek의 오프피크 기준 공식 요금은 100만 토큰당 입력 $0.15, 출력 $0.60, 캐시 히트 입력 $0.003이며, 평일 피크 시간대에는 모두 2배가 적용됩니다. AIReiter는 시간대 구분 없이 단일 고정 요율을 적용하여 오프피크 기준가보다 약 25%, 피크 기준가보다 약 62% 저렴하게 제공합니다. 현재 라우트별 요금은 플레이그라운드 상단에서 확인할 수 있습니다.

/ 03

V4.1 Flash가 V4 Pro보다 더 우수한가요?

DeepSeek이 발표한 에이전트 및 코딩 벤치마크에서는 그렇습니다. Terminal-Bench 2.1은 87.9점 대비 90.6점이며, DeepSWE는 62.7점 대비 74.2점입니다. V4 Pro는 GPQA Diamond 및 지식 회상 영역에서 여전히 앞서고 있습니다. DeepSeek 자체에서도 현재 신규 사용자를 Flash로 라우팅하고 있습니다.

/ 04

V4 Flash와 무엇이 다른가요?

13B 대신 8B~16B의 활성 매개변수를 갖춘 새로운 인코더-디코더 아키텍처, 네이티브 이미지 입력, 상시 활성화된 추론, 1M 컨텍스트 윈도우를 위한 1/4 크기의 KV 캐시, 모든 에이전트 벤치마크에서의 대폭적인 성능 향상이 적용되었습니다. 공식 출력 정가도 $0.28에서 $0.60로 인상되었습니다.

/ 05

생각하기(thinking) 기능을 끌 수 있나요?

이 라우트에서는 불가능합니다. thinking 비활성화를 요청하더라도 reasoning_content가 계속 반환되며, reasoning_effort는 전달되지 않습니다. 대신 max_tokens와 정밀한 프롬프트를 사용하여 비용을 제어하세요.

/ 06

이미지 입력을 지원하나요?

네, API를 통해 지원됩니다. 비전 기능은 V4.1 Flash에 네이티브로 포함되어 있으며 이 라우트에서 검증되었습니다. PNG, JPEG, GIF 또는 WebP를 image_url 파트의 base64 data URI로 전송하세요. 원격 URL은 가져오지 않습니다. 현재 이 페이지의 플레이그라운드는 텍스트 전용입니다.

/ 07

도구 호출(tool-calling) 루프에서 HTTP 400 에러가 발생하는 이유는 무엇인가요?

이전 어시스턴트 메시지에서 reasoning_content를 누락했기 때문입니다. tools 배열이 존재하는 경우, DeepSeek은 도구 호출이 없는 턴을 포함하여 모든 이전 어시스턴트 턴의 reasoning 필드를 요구합니다. 이를 저장한 후 변경 없이 그대로 다시 전송하세요.

/ 08

어떤 컨텍스트 및 출력 제한이 적용되나요?

DeepSeek 문서 기준 1M 토큰 컨텍스트 윈도우 및 최대 384K 출력이 적용됩니다. 플레이그라운드의 기본 출력 토큰은 8192개이며, 긴 에이전트 실행 시 이를 늘릴 수 있습니다. 추론 토큰도 이 제한에 포함된다는 점에 유의하세요.

/ 09

어떤 엔드포인트를 호출해야 하나요?

이 모델의 기본 규약은 POST https://aireiter.com/api/v1/chat/completions 입니다. Anthropic 스타일 클라이언트의 경우 동일한 id로 POST https://aireiter.com/api/v1/messages 도 지원됩니다.

/ 10

연동하기 전에 미리 사용해 볼 수 있나요?

네. 이 페이지의 플레이그라운드는 API와 동일한 모델 id 및 라우트를 실행하므로, 여기서 확인하는 토큰 수와 동작이 API 반환값과 동일합니다.