AIREITER

Prime Inference 가격 및 API 가이드 (2026)

마지막 업데이트: 2026-10-03 07:27:43

Prime Inference는 출시 예정 서비스가 아니다. OpenAI 호환 API를 제공하며, 일회성 호출보다 지속적으로 트래픽이 들어오는 에이전트 워크로드를 염두에 둔 서비스다. 다만 가격을 확인하는 과정은 조금 번거롭다. Prime Intellect의 출시 글에는 서빙 아키텍처가 자세히 공개돼 있지만, 모델별 전체 요금표는 일반적인 공식 가격 페이지보다 실시간 가격 디렉터리에서 더 쉽게 찾을 수 있다.

Prime Intellect의 Prime Inference 출시 페이지

Prime Inference는 정식 출시됐지만 가격 정보는 흩어져 있다

Prime Intellect는 2026년 10월 2일 Prime Inference를 정식 출시했다. 수요 변동에 대응하는 서버리스 엔드포인트와 지속적 워크로드를 위한 예약 용량을 함께 제공한다. 퍼블릭 API는 실제 모델 플릿과 분리돼 있어, 용량 이동이나 장애가 발생해도 클라이언트 엔드포인트는 바꾸지 않아도 된다.

이는 웨이트리스트가 아닌 실제 프로덕션 출시다. Prime Intellect에 따르면 첫 공개 배포 모델인 GLM-5.3은 9월 22일 OpenRouter에서 서비스되기 시작했다. 직접 연동하는 고객은 OpenAI 호환 SDK의 엔드포인트를 https://api.pinference.ai/api/v1로 설정하면 된다.

가격 측면의 주의점은 명확하다. 공식 출시 페이지는 통합 청구와 팀 단위 사용량 추적을 약속하지만, 완전한 요금표는 공개하지 않는다. 따라서 실제 비용을 확정하기 전에는 인증된 대시보드나 models 엔드포인트에서 현재 모델별 단가를 확인해야 한다. 공개 디렉터리는 참고용 스냅샷일 뿐, 계약상 견적은 아니다.

현재 Prime Inference 모델별 가격

Prime Inference는 모델별 사용량 기준으로 과금한다. 입력 토큰과 출력 토큰은 별도로 청구되며, 출력 단가는 입력보다 몇 배 높을 수 있다. 따라서 코드 에이전트나 긴 응답을 생성하는 추론 워크로드에서는 입력 가격만 보고 저렴하다고 판단하기 어렵다.

아래 가격은 endpoints.run의 Prime Intellect 카탈로그에서 2026년 10월 3일 기록한 스냅샷이다. 당시 64개 엔드포인트가 표시됐다. 구매 전에는 반드시 Prime Intellect에서 각 요금을 다시 확인해야 한다.

모델 ID입력 / 100만 토큰출력 / 100만 토큰표시된 컨텍스트적합한 용도
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060K분류 및 단순 추출
qwen/qwen3.7-flash$0.03$0.131M저비용 장문 컨텍스트 범용 작업
z-ai/glm-5.3-flash$0.15$0.501M더 빠른 에이전트 및 도구 워크플로
qwen/qwen3-coder-next$0.30$1.50262K코딩 및 도구 사용
deepseek/deepseek-v4.1-flash$0.30$1.201M장문 컨텍스트 추론 및 비전
z-ai/glm-5.3$1.40$4.401M대표 GLM 에이전트 워크로드
deepseek/deepseek-v4-pro$1.91$3.831M고급 추론
moonshotai/kimi-k3$3.45$17.251M프리미엄 장문 컨텍스트 작업

또 다른 디렉터리인 Compute Prices는 같은 날짜에 111개 모델을 표시했으며, Llama 3.2 1B의 최저 입력 단가는 100만 토큰당 정확히 $0.027이었다. 카탈로그 수가 다른 만큼, 어느 한 디렉터리도 고정된 인벤토리로 받아들이기보다 실시간 API를 조회하는 편이 낫다. 목록마다 네임스페이스나 게이트웨이 모델 구성이 다를 수 있고, 업데이트 시점도 달라질 수 있다.

현실적인 비용 계산 예시 3가지

토큰 비용은 다음 식으로 계산할 수 있다.

(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)

월간 워크로드모델 및 토큰 사용량예상 토큰 비용
경량 고객지원 봇Qwen3.7 Flash; 입력 50M + 출력 10M$2.80
코딩 에이전트Qwen3 Coder Next; 입력 100M + 출력 40M$90.00
출력 비중이 높은 플래그십 에이전트GLM-5.3; 입력 200M + 출력 100M$720.00

위 계산에는 표시된 토큰 요금만 포함된다. 예약 용량 계약, 샌드박스 실행, 학습, 평가, GPU 대여 비용은 들어가지 않는다. Prime Intellect는 이를 별도 서비스로 판매하므로, 에이전트의 전체 비용은 추론 토큰 비용보다 커질 수 있다.

장문 컨텍스트를 지원한다고 해서 모든 요청이 100만 토큰을 소비하는 것은 아니다. 과금은 실제 처리한 토큰 수를 기준으로 한다. 다만 140K 토큰의 대화 이력을 반복 전송하는 에이전트라면, 프리픽스 캐싱이나 애플리케이션 수준의 컨텍스트 관리로 중복 처리를 줄이지 않는 한 입력 비용이 빠르게 누적될 수 있다.

API 연동은 엔드포인트만 바꾸면 된다

Prime Inference는 OpenAI 호환 엔드포인트를 제공한다. 기존 OpenAI SDK 연동에서는 일반적으로 base URL, API 키, 모델 식별자만 바꾸면 된다. Prime Intellect의 출시 글에 명시된 base URL은 https://api.pinference.ai/api/v1다.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

동일한 요청을 cURL로 보내면 다음과 같다.

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

Prime Intellect는 CLI 경로도 안내한다. prime 도구를 설치하고 prime login으로 인증한 뒤 prime inference chat을 실행하면 된다. 배포 전에는 현재 모델 목록을 가져와 정확한 모델 ID를 복사해 사용하는 것이 좋다. 디렉터리마다 모델 접두사가 다를 수 있다.

에이전트 워크로드에서 출시 아키텍처가 의미하는 것

Prime Inference의 차별점은 프롬프트가 길고, 세션이 반복적으로 돌아오며, 도구 호출의 정확성이 중요한 환경에서 특히 드러난다. Prime Intellect는 일반적인 내부 에이전트 턴이 140K 토큰 프롬프트에 약 6K 토큰을 추가한다고 설명한다. 이런 환경에서는 순수 디코드 속도만큼 캐시 유지와 라우팅이 중요해진다.

공식 출시 보고서는 GB200 NVL72 하드웨어에서 GLM-5.3을 배포하며 측정한 구체적 수치를 제시한다.

  • Prime Intellect의 테스트에서 프리필과 디코드 워커를 분리하자 p90 토큰 간 지연 시간이 거의 40% 줄었다.
  • 사용자당 종단 간 초당 100토큰을 목표로 했을 때, 테스트한 1:4 프리필/디코드 토폴로지는 프리필 그룹당 66개 세션을 사용자당 초당 101토큰으로 처리했다.
  • GPU당 프리필 예산을 8K에서 4K 토큰으로 낮추자 중앙값 큐 대기 시간은 550ms에서 110ms로 줄었고, 첫 토큰까지 걸리는 중앙값 시간도 약 20% 감소했다.
  • NVFP4 압축은 같은 메모리 예산에서 디코더당 캐시 용량을 109만 토큰에서 163만 토큰으로, 약 50% 늘렸다.
  • 별도의 TP8 비교에서는 블록 메이저 캐시 레이아웃이 전송 디스크립터 수를 약 10배 줄였고, 평균 전송 시간은 146ms에서 78ms로 낮췄다.

이 수치는 특정 워크로드와 구성에서 나온 결과일 뿐, 보편적인 지연 시간 보장은 아니다. 실질적인 의미는 Prime Intellect가 재방문 세션의 캐시 재사용, 입장 지연, 프리필과 디코드 간 간섭, 캐시 전송 오버헤드처럼 어떤 병목을 최적화했는지 공개했다는 데 있다.

도구 사용은 별도로 검증할 필요가 있다. Prime Intellect는 선언되지 않은 도구가 조용히 버려지거나 인수 타입이 잘못되는 사례를 발견한 뒤, GLM 서빙 경로에 제약 디코딩과 스키마 테스트를 추가했다. 회사는 도구 호출 오류율이 거의 0에 가깝다고 보고하지만, 프로덕션 트래픽을 전환하기 전에는 자체 중첩 스키마, null 허용 인수, 스트리밍 호출, 비정상 요청을 반드시 재현해 테스트해야 한다.

서버리스와 예약 용량, 트래픽 형태로 선택하기

대부분의 팀은 불확실한 수요를 토큰 비용으로 전환할 수 있는 서버리스부터 시작하는 편이 합리적이다. 지속적인 동시성, 예측 가능한 지연 시간, 맞춤형 배포가 유휴 용량을 피하는 것보다 중요해질 때 예약 용량을 검토할 만하다.

워크로드권장 시작 옵션이유
프로토타입 또는 간헐적 챗봇서버리스유휴 GPU를 예약할 필요가 없음
트래픽이 몰리는 평가 작업우선 서버리스배치 및 비동기 저가 추론은 현재 출시 기능이 아니라 로드맵에만 올라와 있음
안정적으로 높은 동시성을 요구하는 에이전트 서비스예약 견적명목상 토큰 단가보다 용량 계획이 더 중요할 수 있음
파인튜닝 또는 LoRA 모델먼저 제공 여부 확인파인튜닝 모델의 원클릭 전용 배포는 출시 글에서 로드맵 작업으로 설명됨
엄격한 계약상 SLA 또는 리전 요구사항영업팀 검토공개 출시 자료에는 범용 계약, 리전 매트릭스, 표준 예약 가격이 명시되지 않음

‘예약’이 자동으로 더 저렴하다고 가정해서는 안 된다. 유휴 시간과 피크 대비 여유 용량까지 포함해, 대표적인 동시성 수준에서 측정한 서버리스 비용과 제시받은 용량 비용을 비교해야 한다.

Prime Intellect가 아직 명확히 공개하지 않은 정보

Prime Inference는 인프라 관련 공개 수준이 이례적으로 상세하지만, 구매 판단에 필요한 몇 가지 정보는 공개적으로 색인된 자료에서 여전히 불분명하다.

  • 모델별 전체 공식 요금표;
  • 모든 모델의 캐시된 입력 및 추론 토큰 과금 규칙;
  • 공개된 요청 및 동시성 제한;
  • 리전별 처리 위치 맵;
  • 추론 요청에 적용되는 표준 데이터 보존 조건;
  • 범용의 공식 SLA 및 보상 규정;
  • 예약 용량의 최소 계약 조건과 가격;
  • 카탈로그 항목 중 Prime이 직접 호스팅하는 모델과 라우팅 게이트웨이 모델의 구분.

공개되지 않았다고 지원하지 않는다는 뜻은 아니다. OpenAI 호환성만으로 추정하지 말고, 대시보드, 문서, 모델 엔드포인트, 계약서 또는 영업팀 답변을 통해 해당 항목을 확인해야 한다는 의미다.

Prime Inference FAQ

Prime Inference는 정식으로 사용할 수 있나?

그렇다. Prime Intellect는 2026년 10월 2일 공개 출시를 발표했으며, API base URL, CLI 명령, 서버리스와 예약 용량으로 나뉜 제품 구성을 함께 공개했다.

Prime Inference에 무료 티어가 있나?

공개 출시 글에는 무료 Prime Inference 크레딧이 명시돼 있지 않다. Prime Intellect는 학습 스택의 다른 영역에서 무료 또는 0원 옵션을 제공하지만, 이를 추론 무료 티어로 간주해서는 안 된다.

Prime Inference는 OpenAI SDK와 호환되나?

그렇다. OpenAI 호환 base URL을 https://api.pinference.ai/api/v1로 설정하고 Prime API 키와 현재 사용 가능한 모델 ID를 입력하면 된다.

Prime Inference는 도구 호출을 지원하나?

GLM-5.3 서빙 경로는 도구 호출을 지원하며, Prime Intellect는 인수 스키마를 위한 문법 강제와 회귀 테스트를 설명하고 있다. 다만 모델마다 지원 기능이 다르므로 모델별 확인은 필요하다.

사용 가능한 모델은 몇 개인가?

공개 디렉터리에는 2026년 10월 3일 기준으로 각각 64개와 111개 항목이 표시됐다. 수치가 다르므로, 계정에서 실제로 사용할 수 있는 모델 인벤토리는 실시간 Prime 모델 엔드포인트나 대시보드가 신뢰할 만한 기준이다.

Prime Inference는 GPU를 빌리는 것보다 저렴한가?

트래픽 변동이 크다면 서버리스가 대체로 더 합리적이다. 반면 사용률이 높고 안정적이라면 대여 또는 예약 GPU가 경제적일 수 있다. 답은 토큰 단가만이 아니라 실제 토큰 사용량, 동시성, 지연 시간 목표, 유휴 용량에 따라 달라진다.

5분 안에 도입 여부 판단하기

오픈 모델 접근, 장문 컨텍스트 에이전트 서빙, Prime Intellect의 학습 스택에서 프로덕션으로 이어지는 경로가 필요한 팀이라면 Prime Inference를 테스트해 볼 만하다. 다만 공개 요금표만 보고 바로 구매를 결정할 단계는 아니다.

  1. 실시간 모델 목록을 조회하고 정확한 입력, 출력, 캐시, 추론 요금을 기록한다.
  2. 대표적인 긴 대화를 재현해 첫 토큰 지연 시간, 생성 속도, 총 청구 토큰을 측정한다.
  3. 애플리케이션에서 실제 사용하는 도구 스키마를 스트리밍과 비스트리밍 모드 모두에서 실행한다.
  4. 민감한 워크로드라면 보존 기간, 리전, 요청 제한, SLA, 예약 용량 조건을 문의한다.
  5. 일반 트래픽과 피크 트래픽을 관찰한 뒤에만 측정된 서버리스 비용을 예약 견적과 비교한다.

결론은 분명하다. Prime Inference는 신뢰할 만한 서빙 엔지니어링과 진입 장벽이 낮은 API를 제공한다. 반면 가격과 계약 조건은 출시 페이지에서 한 번 더 확인하는 절차가 필요하다.