2026년 7월 기준, 가장 저렴한 LLM API는 입력 토큰 100만 개당 0.1센트에도 못 미친다. 이번 달 공급사 가격 페이지에서 확인한 Groq의 Llama 3.1 8B Instant는 입력 100만 토큰당 $0.05, 출력 100만 토큰당 $0.08이다.
다만 이 숫자만 보고 비용을 판단하면 안 된다. DeepSeek는 프롬프트 캐싱으로 실질 입력 비용을 50~120분의 1까지 낮출 수 있고, Gemini·Mistral·Groq의 배치 API는 다시 50%를 절감해 준다. 정가만 비교하면 워크로드에 맞지 않는 공급사를 고르거나 불필요하게 더 지불하기 쉽다. 아래 가격은 모두 2026년 7월 30일 각 공급사 가격 페이지에서 확인했으며, 어떤 용도에 무엇이 가장 유리한지도 함께 정리했다.
2026년 7월 기준 가장 저렴한 LLM API 가격
최저가 구간은 프런티어 연구소의 플래그십 엔드포인트가 아니라, 소형·고효율 모델을 추론 전문 업체가 제공하는 시장이다. 가격은 주요 직접 공급사의 일반 온디맨드 종량제 기준이며, 무료 티어 열에는 무료 옵션이 있는 경우를 표시했다. 자체 호스팅과 기간 한정 프로모션은 제외했다.
| 모델(공급사) | 입력 / 100만 | 출력 / 100만 | 캐시 히트 입력 | 무료 티어 | 가장 저렴한 용도 |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | $0.05 | $0.08 | $0.025 | 예 | 일반 요금 최저가 |
| GPT-OSS 20B (Groq) | $0.075 | $0.30 | $0.0375 | 예 | 저렴한 가격, 1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | $0.10 | $0.40 | — | 예 | 배치 기준 최저가(입력 $0.05) |
| Ministral 3B (Mistral) | $0.10 | $0.10 | — | Leanstral(제한적) | 균일한 초저가 요금 |
| DeepSeek V4 Flash (DeepSeek) | $0.14 | $0.28 | $0.0028 | 아니요 | 추론 작업 최저가 |
| Mistral Small 4 (Mistral) | $0.15 | $0.60 | −90% | 아니요 | 균형 잡힌 범용 사용 |
| Gemini 3.5 Flash-Lite (Google) | $0.30 | $2.50 | — | 예 | 대규모 멀티모달 처리 |
최저가는 Groq Llama 3.1 8B의 $0.05/$0.08이며, 이 표에서 출력 가격이 이보다 낮거나 같은 모델은 없다. Gemini 2.5 Flash-Lite가 입력 $0.05에 도달하는 것은 별도 배치 티어에서만 가능하고, 일반 요금은 $0.10이다. 저가 모델 중 추론 중심 선택지는 DeepSeek V4 Flash다.
GPT나 Claude보다 저렴한 이유
낮은 가격은 세 가지에서 나온다. Llama 3.1 8B, Ministral 3B, Flash-Lite 계열처럼 작거나 효율에 맞춰 조정된 모델, Groq·DeepSeek 같은 저비용 인프라 기반 추론 전문 업체, 그리고 배치 처리 및 캐시 토큰 할인이다. 이 목록의 대부분은 오픈 웨이트 모델(Llama, DeepSeek, Mistral)이다. 반면 Gemini Flash-Lite는 Google의 자체 비공개 모델 계열로, 대량 사용자를 확보하기 위해 낮은 가격을 책정했다. 오픈 웨이트를 직접 호스팅하면 매우 크고 안정적인 트래픽에서는 더 저렴할 수 있다. 하지만 하드웨어와 운영 비용을 감당해야 하므로, 대부분의 팀에는 호스팅 API가 기준점이 된다.
진짜 최저가는 무료 티어
‘가장 저렴한’이 무료를 뜻한다면 선택지는 여러 개다. Groq와 Google의 Gemini Flash-Lite 계열은 속도 제한 범위에서 무료로 쓸 수 있고, Mistral은 Leanstral을 제한된 기간 동안 무료 제공한다. GitHub Models도 토큰과 함께 무료 액세스를 제공한다. Google의 무료 티어는 요청을 제품 학습에 활용하지만, 유료 티어는 그렇지 않다. 다만 모두 속도 제한이 빡빡하고 SLA도 없다. 무료 옵션은 무료 AI API 가이드에서 별도로 정리했다. 프로토타이핑을 넘어선다면 위 유료 요금제를 기준으로 보는 편이 맞다.
토큰 단가만 보면 놓치는 것: 캐싱과 배치의 실제 절감 효과
입력 토큰 정가순으로 표를 정렬하면 오히려 중요한 정보가 가려진다. 실질 비용을 자릿수 단위로 바꾸는 요소가 세 가지 있는데, 많은 가격표는 이를 생략하거나 눈에 띄지 않게 처리한다.
"LLM API 저가의 거대한 착시." — 모델의 표면 가격은 저렴했지만 캐시 읽기 비용이 청구서 대부분을 차지한 사례를 다룬 r/LocalLLaMA 스레드
공급사는 캐시된 입력, 새 입력, 출력을 각각 다른 가격으로 청구한다. 따라서 저렴해 보이는 입력 단가가 실제 청구서에서 가장 작은 비중일 때도 많다. 비교할 핵심 변수는 세 가지다.
- 프롬프트 캐싱. 이전에 보낸 프리픽스를 공급사가 재사용할 수 있으면 캐시된 구간은 일반 입력 가격의 일부만 청구된다. DeepSeek는 V4 Flash의 캐시 입력에 100만 토큰당 $0.0028을 청구한다. 새 입력 $0.14와 비교하면 50배 할인이다. V4 Pro는 $0.0036 대 $0.435로 120배 할인이다. Groq는 캐시 입력을 절반으로 낮추고, Mistral은 90% 할인한다. 긴 시스템 프롬프트나 문서 프리픽스를 여러 요청에서 공유하는데 캐싱을 인식하는 공급사를 쓰지 않는다면, 요청마다 전액을 내게 된다.
- 배치 API. Google, Mistral, Groq는 모두 실시간이 아닌 작업을 24시간~7일 내 처리하는 조건으로 약 50% 할인을 제공한다. Gemini 2.5 Flash-Lite의 배치 티어는 입력 가격을 $0.05까지 낮춘다. 1초 미만 응답이 필요하지 않은 야간 요약, 대량 분류, 데이터셋 라벨링은 배치로 보내야 한다.
- 출력 비중이 높은 워크로드. 코드 생성, 장문 작성, 에이전트 루프는 읽는 토큰보다 생성하는 토큰이 훨씬 많다. 이런 작업에서는 입력 비용이 비슷해도 Llama 3.1 8B의 출력 $0.08이 Gemini 2.5 Flash-Lite의 $0.40보다 유리하다. 생성이 병목이라면 입력 가격이 아니라 출력 가격순으로 비교해야 한다.
공급사를 정가로 고르기 전 확인할 항목은 간단하다. 프롬프트가 캐싱에 잘 맞는지, 작업이 실시간인지, 입력보다 출력을 많이 쓰는지다. 이 세 가지 답이 표의 순위를 헤드라인 가격보다 더 자주 뒤바꾼다.
용도별로 가장 저렴한 선택
아래 추천은 최소형 모델 이상의 성능 기준이 필요하다는 전제에서 골랐다. 순수 가격만 따지면 모든 행에 Llama 3.1 8B를 넣게 된다. 캐싱과 배치가 적용되는 경우의 실제 비용, 그리고 필요한 성능 하한을 함께 반영했다.
| 용도 | 최저가 추천 | 이유 |
|---|---|---|
| 일반 채팅 / 분류 | Mistral Small 4 | 3B/8B급을 넘어서는 중형 범용 모델, $0.15/$0.60 |
| 코딩 및 에이전트 루프 | Groq GPT-OSS 20B 또는 Llama 3.1 8B | 출력 $0.08 미만, 840–1000 tok/s로 루프 속도 유지 |
| 추론 / 어려운 프롬프트 | DeepSeek V4 Flash | $0.14/$0.28, 추론 최적화 모델, 공격적인 캐싱 |
| 긴 컨텍스트 문서 | Gemini 3.5 Flash-Lite | 넓은 컨텍스트 윈도우, 테스트용 무료 티어 |
| 실시간 / 지연 시간 민감 작업 | Groq(모든 모델) | 저렴하면서 처리량도 선도, 840–1000 tok/s |
| 대량 / 야간 작업 | Gemini 2.5 Flash-Lite(배치) | 배치 입력 $0.05, 비동기 처리 50% 할인 |
애그리게이터와 직접 연동: 리셀러가 더 저렴해지는 경우
DeepSeek, Google, Groq, Mistral에 직접 연결하면 특정 모델의 토큰당 가격은 가장 낮다. 대신 운영 비용이 따른다. API 키와 청구는 각각 관리해야 하고, 공급사 한 곳이 속도 제한에 걸렸을 때 수동으로 장애 조치를 해야 하며, 네 가지 SDK에 맞춰 캐싱과 재시도 로직도 다시 구현해야 한다.
애그리게이터가 파는 것은 바로 이 운영상 간극이다. OpenRouter는 공급사 가격에 추가 마크업 없이 5.5% 플랫폼 수수료를 붙이는 대신, 하나의 키와 하나의 청구서, 그리고 이 목록의 모델 전반에 걸친 자동 장애 조치를 제공한다. OpenRouter의 자체 설명에 따르면 손익분기점은 월 약 $50이다. 그 이하에서는 5.5% 수수료가 여러 공급사를 연동하는 엔지니어링 시간보다 저렴하고, 그 이상에서는 단일 최저가 공급사에 직접 연결하는 쪽이 순수 비용 기준으로 대체로 이긴다. 실제 손익분기점은 직접 연동해야 할 공급사 수와 트래픽 변동성에 따라 달라진다.
AIReiter 같은 리셀러 게이트웨이에도 같은 논리가 적용된다. DeepSeek, Gemini, Groq, Mistral 앞에 OpenAI 호환 엔드포인트 하나를 두므로, 클라이언트를 다시 작성하는 대신 모델명만 바꿔 모델을 교체할 수 있다.
FAQ
가장 저렴한 LLM API는 무엇인가요?
2026년 7월 기준 이 비교에서 일반 온디맨드 요금이 가장 낮은 것은 Groq의 Llama 3.1 8B Instant로, 100만 토큰당 $0.05/$0.08이다. Gemini 2.5 Flash-Lite는 배치 티어에서만 입력 $0.05가 가능하며, 일반 요금은 $0.10이다.
코딩에 가장 저렴한 LLM API는 무엇인가요?
코드 생성과 에이전트 루프에서는 Groq의 GPT-OSS 20B($0.075/$0.30) 또는 Llama 3.1 8B($0.05/$0.08)가 출력 가격과 속도 면에서 유리하다. Groq 외에서 코딩 특화 모델이 필요하다면 Mistral의 Devstral Small 2가 $0.10/$0.30으로 저렴한 선택지다.
무료 LLM API 티어만으로 프로덕션 운영이 가능한가요?
대체로 어렵다. Groq, Gemini Flash-Lite, GitHub Models의 무료 티어는 분당 요청 수를 제한하며 가동 시간 보장도 없다. 프로토타이핑에는 적합하지만, 초기 테스트 이후에는 위 표의 유료 요금제로 넘어가는 편이 좋다.
애그리게이터나 리셀러 API는 직접 연결보다 비싼가요?
토큰당으로는 그렇다. OpenRouter는 공급사 가격에 5.5% 수수료를 더하고, 리셀러 게이트웨이도 비슷한 운영 비용을 묶어 제공한다. 하지만 사용액이 적거나 여러 공급사 연동을 직접 유지해야 하는 경우에는 총비용이 더 낮을 수 있다. 수수료가 편의성의 가치를 넘어서면 직접 연결이 더 저렴해진다.
가장 저렴한 LLM API의 월 비용은 얼마인가요?
월간 입력 1,000만 토큰과 출력 500만 토큰을 사용하면 Groq Llama 3.1 8B 비용은 약 $0.90이다. 입력 $0.50과 출력 $0.40을 합한 값이다. Gemini 2.5 Flash-Lite는 일반 요금 기준 약 $3.00, 배치 기준 $1.50이다. 같은 사용량을 프런티어 비공개 모델(입력 100만 토큰당 $5 이상)에서 처리하면 비용은 몇 배 더 커진다.
그래서 무엇을 고를까
공급사가 지원한다면 프롬프트 캐싱을 켜고, 실시간이 필요하지 않은 작업은 배치로 보내자. 이 두 가지 설정이 공급사를 바꾸는 것보다 더 큰 비용 절감 효과를 낸다.
