복잡한 컨텍스트를 한 요청에 담기
대규모 코드베이스, 근거가 많은 문서 묶음, 긴 Agent 작업을 과도하게 나누지 않고 처리합니다.
모델 / Kimi K3
24시간 상태
아직 트래픽 없음
공급자
Moonshot AI
모델
Kimi K3
컨텍스트 창
1,048,576 Token
프로토콜
Chat Completions
Kimi K3는 코드 저장소, 법무/정책 문서, 연구 노트, 로그, 이전 도구 호출, Agent 메모리처럼 많은 근거를 prompt 안에 유지해야 하는 워크플로를 위한 장문 컨텍스트 텍스트 모델입니다. AIReiter는 OpenAI 호환 Chat 엔드포인트로 제공합니다.
가장 적합한 용도
장문 컨텍스트 추론 경로
retrieval이나 chunking을 먼저 만들지 않고 하나의 큰 요청으로 작업 세트를 담고 싶을 때 사용하세요.
대규모 코드베이스, 근거가 많은 문서 묶음, 긴 Agent 작업을 과도하게 나누지 않고 처리합니다.
AIReiter는 Kimi K3를 OpenAI Chat Completions로 제공하므로 기존 앱은 보통 baseURL과 model만 바꾸면 됩니다.
안정적인 system prompt, 프로젝트 배경, 문서 prefix가 반복되면 usage 필드에서 캐시 읽기를 확인하세요.
현재 Token 조합으로 호출 가능 횟수를 추정합니다.
$10
약 13회 샘플 요청
빠른 테스트
$50
약 65회 샘플 요청
일상 개발
$100
약 130회 샘플 요청
프로덕션 평가
가격
가격은 1M Token 기준입니다. AIReiter는 현재 Kimi K3를 공개 모델 요금으로 표시하며, 이 페이지는 빠른 접근, 명확한 엔드포인트, 사용량 가시성을 제공합니다.
| Token 유형 | 요금 | 참고 |
|---|---|---|
| 입력 | $3.00 / 1M | 안정 prefix가 캐시에서 제공되지 않을 때의 prompt Token. |
| 캐시 읽기 | $0.30 / 1M | usage 필드에 보고되는 캐시된 prompt Token. |
| 출력 | $15.00 / 1M | 생성된 응답 Token. 추론이 많은 답변도 포함됩니다. |
프로덕션 레이어
컨텍스트 연속성이 결과를 바꾸는 경우 가장 유용합니다. 단순히 답하는 것이 아니라 프로젝트 상태, 근거, 도구 출력을 유지해 다음 단계를 안정적으로 만듭니다.
위험한 변경 전에 아키텍처 노트, 서비스 계약, 기존 테스트, diff, 이슈를 함께 검토합니다.
계약, 정책, 연구 노트, 증거 자료를 같은 작업 컨텍스트에서 읽어 조기 요약으로 인한 손실을 피합니다.
도구 호출 ID, 중간 관찰, 파라미터, 결정을 유지해 후속 단계의 일관성을 지킵니다.
프로토타입, 마이그레이션, Agent 워크플로가 프로덕션 엣지 케이스를 견딜 충분한 컨텍스트를 갖췄는지 확인합니다.
프로덕션 체크리스트
장문 컨텍스트 모델은 짧은 prompt 모델과 다르게 실패합니다. model ID, 컨텍스트 경로, 대화 상태, usage 기록을 확인하세요.
API 요청에는 kimi-k3를 보내세요. page-chat key chat-kimi-k3는 AIReiter 채팅 UI 전용입니다.
여기서 Kimi K3는 1,048,576 Token을 지원합니다. 클라이언트, 프록시, timeout 설정이 큰 요청을 처리할 수 있는지 확인하세요.
긴 Agent 실행에는 이전 assistant messages, tool outputs, 파라미터가 필요합니다. 제거하면 가짜 연속성이 생깁니다.
캐시 읽기, 출력 Token, 추론이 많은 답변은 요청 수로 추측하지 말고 usage 필드에서 측정하세요.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "이 저장소를 분석하고 구현상 가장 위험한 가정 3가지를 찾아주세요." }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "이 저장소를 분석하고 구현상 가장 위험한 가정 3가지를 찾아주세요." }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<안정적인 저장소 또는 문서 컨텍스트>" },
{ "role": "user", "content": "그 컨텍스트를 기준으로 오늘의 diff를 검토하세요." }
],
"stream": true
}
// usage에서 캐시 읽기 확인:
// usage.prompt_tokens_details.cached_tokens > 0사용 사례
이런 상황에서는 1M Token 컨텍스트 창이 작은 지연이나 스타일 차이보다 워크플로를 더 크게 바꿉니다.
프로젝트 brief, 아키텍처 노트, 로그, 최근 diff를 한 요청에서 읽습니다.
코드베이스 리뷰, 위험 발견, 마이그레이션 계획, 구현 비평에 사용합니다.
retrieval을 먼저 만들지 않고 여러 긴 문서를 요약하고 조합합니다.
도구 추적, 작업 기록, 의사결정을 대화 창에 유지합니다.
비용 품질 검토
프로덕션에서는 재시도, 사람 수정, 도구 성공률, 캐시 히트, 신뢰 가능한 답변까지 걸린 시간을 포함한 사용 가능한 결과 비용으로 평가해야 합니다.
Kimi K3가 재시도를 줄이고 더 많은 컨텍스트를 유지한다면 Token 수가 많아도 최종 작업 비용은 낮아질 수 있습니다. 짧고 상태 없는 작업은 더 가벼운 모델이 적합합니다.
비교
| 항목 | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| 항목 | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| AIReiter 프로토콜 | Chat Completions | Chat / Responses 패밀리 페이지 | Chat 모델 경로 | Claude Messages 경로 |
| 적합한 용도 | 1M 컨텍스트 코드베이스, 긴 문서, Agent 상태 | OpenAI 호환 플래그십 추론 | 대형 컨텍스트, 멀티모달, 문서 중심 작업 | 코드 리뷰와 문서 판단 |
| 선택 시점 | 컨텍스트 연속성이 병목일 때 | GPT-5.6 품질 또는 routing이 필요할 때 | Gemini의 문서 또는 멀티모달 동작이 중요할 때 | Claude 스타일 코드 품질이 중요할 때 |
테스트 준비 완료
가장 빠른 방법은 API Key를 만들고 Chat Completions 엔드포인트를 유지한 채 작은 streaming 요청부터 시작하는 것입니다.
FAQ
공개 페이지에서는 보통 Kimi K3를 캐시 미스 입력 $3.00 / 1M Token, 캐시 읽기 입력 $0.30 / 1M Token, 출력 $15.00 / 1M Token으로 표시합니다.
Kimi K3는 1,048,576 Token 컨텍스트 창으로 표시되며, 코드베이스, 긴 문서, Agent 로그 평가에 적합합니다.
네. 캐시 입력은 보통 $0.30 / 1M Token이고, 캐시되지 않은 입력은 $3.00 / 1M Token입니다.
model 필드에 "kimi-k3"를 사용하고 https://aireiter.com/api/v1/chat/completions 로 보내세요. 내부 page-chat key를 공개 API model ID로 사용하지 마세요.
네. baseURL을 https://aireiter.com/api/v1 로 설정하고 Chat Completions 형식을 유지한 뒤 model "kimi-k3"를 보내면 됩니다.
캐시 읽기 Token, 출력 Token, 긴 요청 지연, 재시도율, 추론 답변이 실제로 사용 가능한 결과를 내는지 확인하세요.