모델 / Kimi K3

Kimi K3 API

Moonshot AI-텍스트 생성-$3.00 / 1M input Token-사용 가능
1.05M 컨텍스트프롬프트 캐시Streaming SSEOpenAI 호환
모델 보기
100%라이브

공급자

Moonshot AI

모델

Kimi K3

컨텍스트 창

1,048,576 Token

프로토콜

Chat Completions

컨텍스트가 병목이면 Kimi K3를 선택하세요

Kimi K3는 코드 저장소, 법무/정책 문서, 연구 노트, 로그, 이전 도구 호출, Agent 메모리처럼 많은 근거를 prompt 안에 유지해야 하는 워크플로를 위한 장문 컨텍스트 텍스트 모델입니다. AIReiter는 OpenAI 호환 Chat 엔드포인트로 제공합니다.

가장 적합한 용도

장문 컨텍스트 추론 경로

retrieval이나 chunking을 먼저 만들지 않고 하나의 큰 요청으로 작업 세트를 담고 싶을 때 사용하세요.

복잡한 컨텍스트를 한 요청에 담기

대규모 코드베이스, 근거가 많은 문서 묶음, 긴 Agent 작업을 과도하게 나누지 않고 처리합니다.

연동을 가볍게 유지

AIReiter는 Kimi K3를 OpenAI Chat Completions로 제공하므로 기존 앱은 보통 baseURL과 model만 바꾸면 됩니다.

긴 prompt를 캐시 친화적으로 만들기

안정적인 system prompt, 프로젝트 배경, 문서 prefix가 반복되면 usage 필드에서 캐시 읽기를 확인하세요.

예산 참고

현재 Token 조합으로 호출 가능 횟수를 추정합니다.

Credits 충전

$10

약 13회 샘플 요청

빠른 테스트

$50

약 65회 샘플 요청

일상 개발

$100

약 130회 샘플 요청

프로덕션 평가

가격

Kimi K3 Token 가격

가격은 1M Token 기준입니다. AIReiter는 현재 Kimi K3를 공개 모델 요금으로 표시하며, 이 페이지는 빠른 접근, 명확한 엔드포인트, 사용량 가시성을 제공합니다.

Token 유형요금참고
입력$3.00 / 1M안정 prefix가 캐시에서 제공되지 않을 때의 prompt Token.
캐시 읽기$0.30 / 1Musage 필드에 보고되는 캐시된 prompt Token.
출력$15.00 / 1M생성된 응답 Token. 추론이 많은 답변도 포함됩니다.

프로덕션 레이어

프로덕션 모델 스택에서 Kimi K3의 위치

컨텍스트 연속성이 결과를 바꾸는 경우 가장 유용합니다. 단순히 답하는 것이 아니라 프로젝트 상태, 근거, 도구 출력을 유지해 다음 단계를 안정적으로 만듭니다.

대규모 코드베이스 개발

위험한 변경 전에 아키텍처 노트, 서비스 계약, 기존 테스트, diff, 이슈를 함께 검토합니다.

긴 문서 분석

계약, 정책, 연구 노트, 증거 자료를 같은 작업 컨텍스트에서 읽어 조기 요약으로 인한 손실을 피합니다.

다단계 도구 Agent

도구 호출 ID, 중간 관찰, 파라미터, 결정을 유지해 후속 단계의 일관성을 지킵니다.

프로토타입에서 프로덕션까지 검토

프로토타입, 마이그레이션, Agent 워크플로가 프로덕션 엣지 케이스를 견딜 충분한 컨텍스트를 갖췄는지 확인합니다.

프로덕션 체크리스트

Kimi K3 배포 전 확인할 네 가지

장문 컨텍스트 모델은 짧은 prompt 모델과 다르게 실패합니다. model ID, 컨텍스트 경로, 대화 상태, usage 기록을 확인하세요.

01

프로덕션 model ID 사용

API 요청에는 kimi-k3를 보내세요. page-chat key chat-kimi-k3는 AIReiter 채팅 UI 전용입니다.

Model ID
02

256K를 같은 진입점으로 보지 않기

여기서 Kimi K3는 1,048,576 Token을 지원합니다. 클라이언트, 프록시, timeout 설정이 큰 요청을 처리할 수 있는지 확인하세요.

컨텍스트
03

assistant와 도구 상태 보존

긴 Agent 실행에는 이전 assistant messages, tool outputs, 파라미터가 필요합니다. 제거하면 가짜 연속성이 생깁니다.

도구 상태
04

캐시와 usage 필드 기록

캐시 읽기, 출력 Token, 추론이 많은 답변은 요청 수로 추측하지 말고 usage 필드에서 측정하세요.

Usage
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "이 저장소를 분석하고 구현상 가장 위험한 가정 3가지를 찾아주세요." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "이 저장소를 분석하고 구현상 가장 위험한 가정 3가지를 찾아주세요." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<안정적인 저장소 또는 문서 컨텍스트>" },
    { "role": "user", "content": "그 컨텍스트를 기준으로 오늘의 diff를 검토하세요." }
  ],
  "stream": true
}

// usage에서 캐시 읽기 확인:
// usage.prompt_tokens_details.cached_tokens > 0

사용 사례

Kimi K3가 잘하는 일

이런 상황에서는 1M Token 컨텍스트 창이 작은 지연이나 스타일 차이보다 워크플로를 더 크게 바꿉니다.

장문 컨텍스트 추론

프로젝트 brief, 아키텍처 노트, 로그, 최근 diff를 한 요청에서 읽습니다.

코딩 도우미

코드베이스 리뷰, 위험 발견, 마이그레이션 계획, 구현 비평에 사용합니다.

리서치 종합

retrieval을 먼저 만들지 않고 여러 긴 문서를 요약하고 조합합니다.

Agent 계획

도구 추적, 작업 기록, 의사결정을 대화 창에 유지합니다.

비용 품질 검토

Token 단가만으로 비교하지 마세요

프로덕션에서는 재시도, 사람 수정, 도구 성공률, 캐시 히트, 신뢰 가능한 답변까지 걸린 시간을 포함한 사용 가능한 결과 비용으로 평가해야 합니다.

첫 시도 성공률
사람 수정률
재시도 횟수
출력 Token
캐시 히트율
도구 호출 성공률
사용 가능한 답변까지 시간
에스컬레이션 비율

Kimi K3가 재시도를 줄이고 더 많은 컨텍스트를 유지한다면 Token 수가 많아도 최종 작업 비용은 낮아질 수 있습니다. 짧고 상태 없는 작업은 더 가벼운 모델이 적합합니다.

비교

Kimi K3와 AIReiter 텍스트 모델 비교

항목Kimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
항목kimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
AIReiter 프로토콜Chat CompletionsChat / Responses 패밀리 페이지Chat 모델 경로Claude Messages 경로
적합한 용도1M 컨텍스트 코드베이스, 긴 문서, Agent 상태OpenAI 호환 플래그십 추론대형 컨텍스트, 멀티모달, 문서 중심 작업코드 리뷰와 문서 판단
선택 시점컨텍스트 연속성이 병목일 때GPT-5.6 품질 또는 routing이 필요할 때Gemini의 문서 또는 멀티모달 동작이 중요할 때Claude 스타일 코드 품질이 중요할 때

테스트 준비 완료

Key를 만들고 Credits를 충전한 뒤 Kimi K3 요청 보내기

가장 빠른 방법은 API Key를 만들고 Chat Completions 엔드포인트를 유지한 채 작은 streaming 요청부터 시작하는 것입니다.

FAQ

Kimi K3 API 질문

Kimi K3는 1M Token당 얼마인가요?

공개 페이지에서는 보통 Kimi K3를 캐시 미스 입력 $3.00 / 1M Token, 캐시 읽기 입력 $0.30 / 1M Token, 출력 $15.00 / 1M Token으로 표시합니다.

Kimi K3의 컨텍스트 창은 얼마나 큰가요?

Kimi K3는 1,048,576 Token 컨텍스트 창으로 표시되며, 코드베이스, 긴 문서, Agent 로그 평가에 적합합니다.

컨텍스트 캐시가 정말 비용을 줄이나요?

네. 캐시 입력은 보통 $0.30 / 1M Token이고, 캐시되지 않은 입력은 $3.00 / 1M Token입니다.

API 호출에는 어떤 model ID를 써야 하나요?

model 필드에 "kimi-k3"를 사용하고 https://aireiter.com/api/v1/chat/completions 로 보내세요. 내부 page-chat key를 공개 API model ID로 사용하지 마세요.

OpenAI 스타일 SDK로 Kimi K3를 호출할 수 있나요?

네. baseURL을 https://aireiter.com/api/v1 로 설정하고 Chat Completions 형식을 유지한 뒤 model "kimi-k3"를 보내면 됩니다.

프로덕션에서 무엇을 봐야 하나요?

캐시 읽기 Token, 출력 Token, 긴 요청 지연, 재시도율, 추론 답변이 실제로 사용 가능한 결과를 내는지 확인하세요.