무료 LLM API, 한눈에 비교
이 내용은 2026년 9월 8일 기준으로 확인했습니다. 한도는 모델, 계정, 지역, 수요에 따라 달라질 수 있으므로 최종 판단은 각 제공업체의 연결된 공식 문서를 기준으로 하세요.
카드 필요 여부, 상업적 사용, OpenAI 호환성 표기는 Free LLM API Hub comparison도 보조 자료로 교차 확인했습니다.
| 제공업체 | 무료 이용 조건 및 공개 할당량 | 카드/결제 조건 | API 형태 | 약관 관련 신호 | 주요 주의점 |
|---|---|---|---|---|---|
| Google AI Studio | Gemini 모델별 상이: 5–30 RPM, 15–1,000 RPD; Gemini 2.5 Flash 예시: 10 RPM / 250 RPD | 카드 필요 조건은 명시되지 않음. 계정 및 프로젝트 인증이 적용될 수 있음 | 검증된 비교 자료에서 OpenAI 호환 | 상업적 사용 가능으로 표기됨. 최신 약관 확인 필요 | Google은 현재 적용 한도를 AI Studio에서 확인하라고 안내 |
| Groq | 대표 모델 qwen/qwen3.6-27b: 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPD | Free Plan은 유료 업그레이드 불필요. Developer 티어는 결제 수단 필요 | 예, 대부분 | 상업적 사용 가능으로 표기됨. Free Plan 한도는 유료 용량과 다름 | 한도는 조직 및 모델 단위로 적용 |
| OpenRouter | 무료 변형 모델: 구매 크레딧이 $10 미만이면 20 RPM / 50 RPD; 누적 구매액이 $10 이상이면 1,000 RPD | 기본 무료 경로는 카드 불필요. 크레딧 구매 시 상한 증가 | 예, OpenAI Chat API 형식으로 정규화 | 상업적 사용 가능으로 표기됨. 무료 모델 제공 여부는 변동 | 더 큰 일일 할당량은 구매가 조건 |
| Cloudflare Workers AI | 계정 전체에서 공유하는 10,000 Neurons/일, 매일 00:00 UTC에 초기화 | 기본 할당량은 무료. 일부 모델은 유료 결제 설정 필요 | 검증된 비교 자료에서 OpenAI 호환 | 상업적 사용 가능으로 표기됨. 모델별 이용 가능 여부 상이 | Neuron은 고정 토큰 할당량이 아니라 컴퓨팅 단위 |
| Cerebras Inference | Free Trial: 대상 모델 기준 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD | 인증된 결제 수단 필요 | 인용한 문서에서 확인되지 않음 | 체험판 접근이며 크레딧은 30일 후 만료 | $5 체험 크레딧은 영구 제공이 아님 |
| SambaNova Cloud | Free Tier: 대상 모델 기준 20 RPM / 20 RPD / 200,000 TPD | Free Tier에서는 결제 수단 불필요. 연결하면 유료 Developer Tier가 활성화됨 | 예, 문서화된 차이점 존재 | 상업적 사용 가능으로 표기됨. 모델 약관 확인 필요 | 20 RPD 제한이 상당히 낮음 |
| Cohere | 월 1,000회 호출; Chat 20 RPM, Embed 분당 2,000 입력, Rerank 10 RPM | 검증된 비교 자료에는 카드 조건이 명시되지 않음. 가입 시 확인 필요 | 검증된 비교 자료에서 OpenAI 호환 | 검증된 비교 자료에서 평가 전용으로 표기 | 호출 횟수와 토큰은 서로 바꿔 계산할 수 없음 |
| Z.AI | GLM-4.7-Flash 및 GLM-4.5-Flash는 표시된 토큰 카테고리에서 $0; 공개 RPM/TPM은 미기재 | 검증된 비교 자료에 카드 조건 미기재 | 검증된 비교 자료에서 OpenAI 호환 | 상업적 사용 가능으로 표기됨. 모델 약관 확인 필요 | 토큰당 $0이라고 해서 처리 가능 용량이 드러나는 것은 아님 |
| NVIDIA NIM | 프로토타이핑용 Free Inference Endpoints 제공. 랜딩 페이지에 공통 할당량 없음 | 결제 조건은 엔드포인트별로 다름. 모델 페이지에서 확인 필요 | 인용한 문서에서 확인되지 않음 | 인용 페이지에서 프로토타입/평가 목적 신호 | 랜딩 페이지의 무료 표기가 공개된 할당량을 의미하지는 않음 |
| Hugging Face Inference Providers | 무료 사용자는 변경될 수 있는 $0.10/월 크레딧 제공. RPM/TPM은 공개되지 않음 | 공식 가격 문서에 카드 조건 미기재 | 검증된 비교 자료에서 OpenAI 호환 | 제공업체 및 모델별 약관 확인 필요 | 요청 할당량이 아니라 소액 크레딧 |
| Mistral Studio | Studio Free mode 제공. 문서 홈페이지에 공개 할당량 없음 | 홈페이지에 카드 조건 미기재 | OpenAI 스타일 엔드포인트는 문서화됨. 완전한 호환성은 주장하지 않음 | 체험·탐색·평가 목적 신호. 약관 확인 필요 | Free mode가 무제한 또는 프로덕션 준비 완료를 뜻하지는 않음 |
가장 큰 숫자만 보고 순위를 매기면 안 됩니다. 요청 수, 토큰, 호출 수, 달러, Neuron은 서로 다른 단위이며, 만료되는 체험판은 갱신되는 무료 할당량과 다릅니다.
이미지, 음성, 임베딩 등 다른 모달리티까지 포함해 보려면 free AI API comparison을 참고하세요. 이 글은 호스팅형 LLM 추론에만 집중합니다.
정기 제공 또는 카드 없이 쓰기 쉬운 서비스
Google AI Studio: 범용 프로토타입의 현실적인 출발점
Google의 공식 속도 제한 문서는 Gemini 할당량이 모델과 프로젝트에 따라 달라진다고 설명합니다. 일반적인 기준으로 RPM, 입력 TPM, RPD를 제시하며, 할당량은 API 키별이 아니라 Google Cloud 프로젝트별로 적용됩니다. 현재 적용되는 수치는 AI Studio에서 확인해야 하고, 일일 요청 할당량은 태평양 표준시 자정에 초기화됩니다.
검증된 보조 비교 자료에서는 Gemini 2.5 Flash의 수치를 10 RPM 및 250 RPD로, 모델 전체 범위는 5–30 RPM 및 15–1,000 RPD로 제시합니다. 다만 Google은 실제 한도가 달라질 수 있고 보장되지 않는다고 밝히므로, 이는 계획 수립용 수치로 보는 편이 맞습니다.
범용·멀티모달 프로토타입에는 Gemini가 잘 맞습니다. 다만 모델별 일일 상한 때문에 요청이 많은 워크로드에서는 제약이 생길 수 있습니다.
Groq: 공개된 요청 할당량 기준으로 가장 강한 무카드 선택지
Groq의 속도 제한 문서는 모델과 조직별 한도를 제공합니다. 현재 qwen/qwen3.6-27b의 Free Plan 항목에는 30 RPM, 1,000 RPD, 8,000 TPM, 200,000 TPD가 표시됩니다. 다른 모델은 일일 요청·토큰 상한이 다를 수 있습니다.
“Rate limits apply at the organization level, not individual users.” — Groq rate-limit documentation
여러 API 키를 만든다고 조직 전체 용량이 자동으로 늘어나지는 않습니다. Groq 문서는 HTTP 429 응답 처리에 필요한 retry-after, x-ratelimit-* 헤더도 설명합니다.
선택한 모델이 작업에 맞는다면, 자주 발생하는 소규모 요청에는 Groq가 가장 명확한 출발점입니다. 제공업체 전체에 하나의 공통 할당량이 있다고 보지 말고, 반드시 해당 모델 행을 확인하세요.
OpenRouter: 무료 모델을 가장 유연하게 연결하는 게이트웨이
OpenRouter는 수시로 바뀌는 무료 모델 변형을 하나의 API로 제공합니다. 현재 무료 접근 비교 기준으로 계정의 구매 크레딧이 $10 미만일 때는 분당 20회, 하루 50회 요청이 가능하며, 누적 구매 크레딧이 $10 이상이면 일일 할당량이 1,000회로 늘어납니다. 즉, 더 높은 상한은 구매가 전제입니다.
공식 제한 문서에 따르면 계정이나 API 키를 추가해도 플랫폼 전체의 전역 속도 제한은 바뀌지 않습니다. 서비스는 키 엔드포인트와 속도 제한 오류 헤더를 통해 할당량 정보를 제공합니다.
특정 모델을 고정하려면 :free 접미사를 쓰고, 사용 가능한 무료 모델을 자동 선택하려면 openrouter/free를 사용할 수 있습니다. 라우터는 도구 호출이나 이미지 이해 같은 기능을 기준으로 필터링할 수 있지만, 실제로 선택되는 기반 모델은 바뀔 수 있습니다.
OpenRouter는 실험과 폴백 라우팅에는 적합하지만, 무료 모델 하나의 일관된 동작에 의존하는 애플리케이션용으로는 맞지 않습니다.
Cloudflare Workers AI: 무료 토큰이 아니라 매일 갱신되는 컴퓨팅
Cloudflare 공식 가격 페이지는 계정마다 총 10,000-Neuron의 일일 무료 할당량을 제공합니다. 이 할당량은 Workers AI 활동 전체에서 공유되며, 00:00 UTC에 초기화됩니다. Workers Free 플랜에서는 할당량을 모두 사용한 뒤 추가 작업이 실패합니다.
Neuron은 요청에 필요한 GPU 컴퓨팅을 나타내는 단위입니다. Cloudflare는 10,000 Neurons가 일정한 프롬프트 수와 같다고 약속하는 대신, 모델별 토큰 환산 기준을 공개합니다.
또한 Cloudflare는 일부 최신 DeepSeek, GLM, Kimi 모델에 유료 결제 수단이 필요하다고 안내합니다. ‘10,000 Neurons 무료’가 모든 모델을 결제 설정 없이 쓸 수 있다는 뜻은 아닙니다.
무료지만 조건을 꼭 봐야 하는 서비스
Cerebras: 쓸 만한 체험판이지만 영구 무료 API는 아님
Cerebras의 속도 제한 문서는 대상 Free Trial 모델에 대해 5 RPM, 30,000 uncached TPM, 90,000 total TPM, 1 million TPD를 제시합니다. 또한 토큰 버킷은 단순한 일일 초기화를 기다리는 방식이 아니라 지속적으로 보충된다고 설명합니다.
신규 계정에는 $5 상당의 무료 크레딧이 제공되며, 이 크레딧은 30일 후 만료됩니다. Playground와 API 접근을 활성화하려면 인증된 결제 수단도 필요합니다. 크레딧이 만료되거나 소진되면 추가 구매 없이는 접근이 중단됩니다. 확인한 문서에는 영구적으로 갱신되는 공개 무료 할당량이 설명되어 있지 않습니다.
Cerebras는 단기 평가에는 유용합니다. 체험 기간 이후에도 계속 작동해야 하는 프로젝트의 유일한 의존성으로 삼아서는 안 됩니다.
SambaNova Cloud: 결제 상태에 따라 무료 경계가 가장 분명한 서비스
SambaNova는 결제 수단이 연결되지 않은 상태를 Free Tier로 정의합니다. 대상 Free Tier 모델의 공식 문서상 한도는 20 RPM, 20 RPD, 200,000 TPD입니다. 20 RPD는 토큰 할당량을 다 쓰기도 전에 폴링이 잦은 워크플로를 멈출 수 있는 수준입니다.
결제 수단을 연결하면 유료 Developer Tier가 활성화되며, 이를 무료 이용으로 계산하면 안 됩니다. SambaNova는 응답 헤더로 남은 요청 수와 초기화 정보도 제공합니다.
SambaNova는 저용량 PoC에만 쓰는 편이 좋습니다. 에이전트 워크플로에 적용하기 전에는 20 RPD 상한을 반드시 검증해야 합니다.
Cohere: RAG에는 유용하지만 호출 횟수를 꼼꼼히 계산해야 함
Cohere의 체험 키는 토큰 기반 무료 티어와 다릅니다. 현재 검증된 비교 자료는 월 1,000회 호출과 함께 엔드포인트별 제한으로 Chat 20 RPM, Embed 분당 2,000 입력, Rerank 10 RPM을 제시합니다. Cohere FAQ도 체험 키를 무료이지만 제한적인 방식으로 설명합니다.
이 구성은 검색 증강 생성 실험에 유용합니다. 하나의 프로젝트에서 생성, 임베딩, 리랭킹을 함께 시험할 수 있기 때문입니다. 그렇다고 고트래픽 채팅 백엔드가 되는 것은 아닙니다. 월 1,000회 호출을 하루 100만 토큰과 직접 비교해서도 안 됩니다.
검증된 비교 자료에서는 이 체험판을 평가 전용으로 분류합니다. 공개 또는 상업용 애플리케이션에 사용하기 전 최신 이용 정책을 확인하세요.
Z.AI: 무료 가격과 공개 할당량은 별개
Z.AI의 가격 문서는 GLM-4.7-Flash와 GLM-4.5-Flash를 표시된 토큰 카테고리에서 무료로 안내합니다. 그러나 확인한 공개 가격 페이지에는 RPM, RPD, TPM, TPD에 해당하는 구체적 수치가 없습니다.
Z.AI의 할당량은 알 수 없는 값으로 다루는 편이 안전합니다. 수동 테스트에는 맞을 수 있지만 배치 작업용으로 판단하기는 어렵습니다. 가입 시 엔드포인트, 모델 제공 여부, 약관을 확인하세요.
NVIDIA, Hugging Face, Mistral: 할당량 정보가 불완전한 탐색 경로
| 제공업체 | 무료 이용 신호 | 공개되지 않은 할당량 정보 | 실용적인 활용 방식 |
|---|---|---|---|
| NVIDIA NIM | 프로토타이핑용 Free Inference Endpoints | 랜딩 페이지에 공통 RPM, 토큰 할당량, 카드 조건, 초과 사용 가격 없음 | 원하는 엔드포인트를 시험한 뒤 모델별 약관 확인 |
| Hugging Face Inference Providers | 변경될 수 있는 무료 사용자 $0.10/월 크레딧 | 비교 가능한 RPM 또는 TPM 할당량 없음 | GPU 인프라를 직접 관리하지 않고 라우팅된 모델로 소규모 실험 |
| Mistral Studio | Studio Free mode 및 API 빠른 시작 가이드 | 문서 홈페이지에 할당량 또는 카드 조건 없음 | 유료 구성으로 확정하기 전에 Mistral API 기능 체험 |
어떤 무료 LLM API를 골라야 할까?
| 우선순위 | 첫 선택 | 이유 |
|---|---|---|
| 범용 프로토타입 | Google AI Studio | Gemini가 명확한 범용 기준점을 제공하며, 현재 한도는 AI Studio에서 확인 가능 |
| 빈번한 소규모 요청 | Groq | 모델별 Free Plan 한도가 공개되어 있고 1,000 RPD 사례 존재 |
| 하나의 API로 다양한 모델 사용 | OpenRouter | 무료 변형 모델, 라우팅, OpenAI 스타일 인터페이스 제공 |
| Cloudflare 중심 애플리케이션 | Workers AI | 매일 갱신되는 10,000 Neurons/일 할당량 |
| 명시된 체험판 토큰 수치가 가장 중요 | Cerebras | 최대 1M TPD지만, 카드가 필요한 30일 체험판에 한정 |
| 결제 수단을 절대 연결하지 않는 구성 | Groq 우선, 아주 낮은 볼륨이라면 SambaNova | SambaNova Free Tier는 20 RPD 상한 보유 |
| RAG 구성 요소 | Cohere | Chat, Embed, Rerank를 하나의 체험 키 생태계에서 제공 |
| GLM Flash 테스트 | Z.AI | 표시된 토큰 가격은 $0이지만 공개 할당량은 알 수 없음 |
| GPU 없이 오픈 모델 탐색 | Hugging Face | 라우팅 접근과 무료 사용자용 $0.10/월 제공 |
우선 제공업체 하나로 시작하고, 매 요청마다 모델 ID, HTTP 상태, 토큰 사용량, 남은 한도 헤더 네 가지를 기록하세요. 첫 경로에서 어떤 제한에 먼저 도달하는지 파악한 다음에만 두 번째 제공업체를 추가하는 편이 좋습니다. 키를 여러 개 사용한다고 반드시 용량이 늘어나는 것은 아닙니다.
사용 전 무료 LLM API를 검증하는 방법
출시 전에 다음 다섯 가지를 확인하세요.
- 할당량 단위: 요청 수, 토큰, 호출 수, 달러, 컴퓨팅 단위 중 무엇으로 측정되는가?
- 초기화 방식: UTC 또는 태평양 시간 기준으로 초기화되는가, 지속적으로 보충되는가, 매월 갱신되는가, 아니면 한 번 만료되는가?
- 적용 범위: 제한은 모델, 프로젝트, 계정, 조직 중 어디에 연결되는가?
- 결제 조건: 카드를 추가하면 용량만 늘어나는가, 유료 티어가 활성화되는가, 혹은 체험판에 카드가 필수인가?
- 약관 및 실패 처리 경로: 테스트·평가 전용인가, 그리고 클라이언트가 재시도 폭주 없이 HTTP 429를 처리하는가?
무료 LLM API FAQ
전반적으로 가장 좋은 무료 LLM API는 무엇인가요?
범용 프로토타입에는 Google AI Studio, 더 높은 무료 요청량에는 Groq, 모델 선택 폭에는 OpenRouter가 적합합니다.
신용카드 없이 무료 LLM API를 사용할 수 있나요?
네. 검증된 비교 자료에서는 Google, Groq, OpenRouter의 기본 경로, Cloudflare의 기본 할당량, SambaNova Free Tier를 무카드 선택지로 분류합니다. Cerebras는 Free Trial에 인증된 결제 수단이 필요합니다.
무료 LLM API는 정말 영구적인가요?
일부 정기 티어는 약관이 유지되는 동안 계속 제공될 수 있습니다. 하지만 체험판, 프로모션 가격, 순환하는 :free 경로는 제공업체 전체에 영구적으로 적용되는 할당량이 아닙니다. 하나에 의존하기 전 현재 문서와 모델 상태를 확인하세요.
무료 LLM API를 프로덕션에서 사용해도 되나요?
현재 약관, 할당량, 모델 제공 여부가 프로덕션 요구 사항을 충족하지 않는다면 단독 백엔드로 사용하지 마세요.
무료 한도에 도달하면 어떻게 되나요?
일반적으로 제공업체는 스로틀링 또는 할당량 오류를 반환합니다. Groq는 HTTP 429 처리 방법을 문서화하고 있으며, Cloudflare는 Free 플랜의 일일 할당량을 소진하면 이후 작업이 실패한다고 안내합니다. Cerebras는 체험 크레딧이 만료되거나 소진되면 접근을 중단합니다.