AIREITER
API 문서가격
템플릿
  • AIReiter
  • 블로그
  • 무료 LLM API 할당량 비교: 11개 제공업체(2026)

무료 LLM API 할당량 비교: 11개 제공업체(2026)

마지막 업데이트: 2026-09-08 08:42:43

무료 LLM API, 한눈에 비교

이 내용은 2026년 9월 8일 기준으로 확인했습니다. 한도는 모델, 계정, 지역, 수요에 따라 달라질 수 있으므로 최종 판단은 각 제공업체의 연결된 공식 문서를 기준으로 하세요.

카드 필요 여부, 상업적 사용, OpenAI 호환성 표기는 Free LLM API Hub comparison도 보조 자료로 교차 확인했습니다.

제공업체무료 이용 조건 및 공개 할당량카드/결제 조건API 형태약관 관련 신호주요 주의점
Google AI StudioGemini 모델별 상이: 5–30 RPM, 15–1,000 RPD; Gemini 2.5 Flash 예시: 10 RPM / 250 RPD카드 필요 조건은 명시되지 않음. 계정 및 프로젝트 인증이 적용될 수 있음검증된 비교 자료에서 OpenAI 호환상업적 사용 가능으로 표기됨. 최신 약관 확인 필요Google은 현재 적용 한도를 AI Studio에서 확인하라고 안내
Groq대표 모델 qwen/qwen3.6-27b: 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPDFree Plan은 유료 업그레이드 불필요. Developer 티어는 결제 수단 필요예, 대부분상업적 사용 가능으로 표기됨. Free Plan 한도는 유료 용량과 다름한도는 조직 및 모델 단위로 적용
OpenRouter무료 변형 모델: 구매 크레딧이 $10 미만이면 20 RPM / 50 RPD; 누적 구매액이 $10 이상이면 1,000 RPD기본 무료 경로는 카드 불필요. 크레딧 구매 시 상한 증가예, OpenAI Chat API 형식으로 정규화상업적 사용 가능으로 표기됨. 무료 모델 제공 여부는 변동더 큰 일일 할당량은 구매가 조건
Cloudflare Workers AI계정 전체에서 공유하는 10,000 Neurons/일, 매일 00:00 UTC에 초기화기본 할당량은 무료. 일부 모델은 유료 결제 설정 필요검증된 비교 자료에서 OpenAI 호환상업적 사용 가능으로 표기됨. 모델별 이용 가능 여부 상이Neuron은 고정 토큰 할당량이 아니라 컴퓨팅 단위
Cerebras InferenceFree Trial: 대상 모델 기준 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD인증된 결제 수단 필요인용한 문서에서 확인되지 않음체험판 접근이며 크레딧은 30일 후 만료$5 체험 크레딧은 영구 제공이 아님
SambaNova CloudFree Tier: 대상 모델 기준 20 RPM / 20 RPD / 200,000 TPDFree Tier에서는 결제 수단 불필요. 연결하면 유료 Developer Tier가 활성화됨예, 문서화된 차이점 존재상업적 사용 가능으로 표기됨. 모델 약관 확인 필요20 RPD 제한이 상당히 낮음
Cohere월 1,000회 호출; Chat 20 RPM, Embed 분당 2,000 입력, Rerank 10 RPM검증된 비교 자료에는 카드 조건이 명시되지 않음. 가입 시 확인 필요검증된 비교 자료에서 OpenAI 호환검증된 비교 자료에서 평가 전용으로 표기호출 횟수와 토큰은 서로 바꿔 계산할 수 없음
Z.AIGLM-4.7-Flash 및 GLM-4.5-Flash는 표시된 토큰 카테고리에서 $0; 공개 RPM/TPM은 미기재검증된 비교 자료에 카드 조건 미기재검증된 비교 자료에서 OpenAI 호환상업적 사용 가능으로 표기됨. 모델 약관 확인 필요토큰당 $0이라고 해서 처리 가능 용량이 드러나는 것은 아님
NVIDIA NIM프로토타이핑용 Free Inference Endpoints 제공. 랜딩 페이지에 공통 할당량 없음결제 조건은 엔드포인트별로 다름. 모델 페이지에서 확인 필요인용한 문서에서 확인되지 않음인용 페이지에서 프로토타입/평가 목적 신호랜딩 페이지의 무료 표기가 공개된 할당량을 의미하지는 않음
Hugging Face Inference Providers무료 사용자는 변경될 수 있는 $0.10/월 크레딧 제공. RPM/TPM은 공개되지 않음공식 가격 문서에 카드 조건 미기재검증된 비교 자료에서 OpenAI 호환제공업체 및 모델별 약관 확인 필요요청 할당량이 아니라 소액 크레딧
Mistral StudioStudio Free mode 제공. 문서 홈페이지에 공개 할당량 없음홈페이지에 카드 조건 미기재OpenAI 스타일 엔드포인트는 문서화됨. 완전한 호환성은 주장하지 않음체험·탐색·평가 목적 신호. 약관 확인 필요Free mode가 무제한 또는 프로덕션 준비 완료를 뜻하지는 않음

가장 큰 숫자만 보고 순위를 매기면 안 됩니다. 요청 수, 토큰, 호출 수, 달러, Neuron은 서로 다른 단위이며, 만료되는 체험판은 갱신되는 무료 할당량과 다릅니다.

이미지, 음성, 임베딩 등 다른 모달리티까지 포함해 보려면 free AI API comparison을 참고하세요. 이 글은 호스팅형 LLM 추론에만 집중합니다.

정기 제공 또는 카드 없이 쓰기 쉬운 서비스

Google AI Studio: 범용 프로토타입의 현실적인 출발점

Google의 공식 속도 제한 문서는 Gemini 할당량이 모델과 프로젝트에 따라 달라진다고 설명합니다. 일반적인 기준으로 RPM, 입력 TPM, RPD를 제시하며, 할당량은 API 키별이 아니라 Google Cloud 프로젝트별로 적용됩니다. 현재 적용되는 수치는 AI Studio에서 확인해야 하고, 일일 요청 할당량은 태평양 표준시 자정에 초기화됩니다.

검증된 보조 비교 자료에서는 Gemini 2.5 Flash의 수치를 10 RPM 및 250 RPD로, 모델 전체 범위는 5–30 RPM 및 15–1,000 RPD로 제시합니다. 다만 Google은 실제 한도가 달라질 수 있고 보장되지 않는다고 밝히므로, 이는 계획 수립용 수치로 보는 편이 맞습니다.

범용·멀티모달 프로토타입에는 Gemini가 잘 맞습니다. 다만 모델별 일일 상한 때문에 요청이 많은 워크로드에서는 제약이 생길 수 있습니다.

Groq: 공개된 요청 할당량 기준으로 가장 강한 무카드 선택지

Groq의 속도 제한 문서는 모델과 조직별 한도를 제공합니다. 현재 qwen/qwen3.6-27b의 Free Plan 항목에는 30 RPM, 1,000 RPD, 8,000 TPM, 200,000 TPD가 표시됩니다. 다른 모델은 일일 요청·토큰 상한이 다를 수 있습니다.

“Rate limits apply at the organization level, not individual users.” — Groq rate-limit documentation

여러 API 키를 만든다고 조직 전체 용량이 자동으로 늘어나지는 않습니다. Groq 문서는 HTTP 429 응답 처리에 필요한 retry-after, x-ratelimit-* 헤더도 설명합니다.

선택한 모델이 작업에 맞는다면, 자주 발생하는 소규모 요청에는 Groq가 가장 명확한 출발점입니다. 제공업체 전체에 하나의 공통 할당량이 있다고 보지 말고, 반드시 해당 모델 행을 확인하세요.

OpenRouter: 무료 모델을 가장 유연하게 연결하는 게이트웨이

OpenRouter는 수시로 바뀌는 무료 모델 변형을 하나의 API로 제공합니다. 현재 무료 접근 비교 기준으로 계정의 구매 크레딧이 $10 미만일 때는 분당 20회, 하루 50회 요청이 가능하며, 누적 구매 크레딧이 $10 이상이면 일일 할당량이 1,000회로 늘어납니다. 즉, 더 높은 상한은 구매가 전제입니다.

공식 제한 문서에 따르면 계정이나 API 키를 추가해도 플랫폼 전체의 전역 속도 제한은 바뀌지 않습니다. 서비스는 키 엔드포인트와 속도 제한 오류 헤더를 통해 할당량 정보를 제공합니다.

특정 모델을 고정하려면 :free 접미사를 쓰고, 사용 가능한 무료 모델을 자동 선택하려면 openrouter/free를 사용할 수 있습니다. 라우터는 도구 호출이나 이미지 이해 같은 기능을 기준으로 필터링할 수 있지만, 실제로 선택되는 기반 모델은 바뀔 수 있습니다.

OpenRouter는 실험과 폴백 라우팅에는 적합하지만, 무료 모델 하나의 일관된 동작에 의존하는 애플리케이션용으로는 맞지 않습니다.

Cloudflare Workers AI: 무료 토큰이 아니라 매일 갱신되는 컴퓨팅

Cloudflare 공식 가격 페이지는 계정마다 총 10,000-Neuron의 일일 무료 할당량을 제공합니다. 이 할당량은 Workers AI 활동 전체에서 공유되며, 00:00 UTC에 초기화됩니다. Workers Free 플랜에서는 할당량을 모두 사용한 뒤 추가 작업이 실패합니다.

Neuron은 요청에 필요한 GPU 컴퓨팅을 나타내는 단위입니다. Cloudflare는 10,000 Neurons가 일정한 프롬프트 수와 같다고 약속하는 대신, 모델별 토큰 환산 기준을 공개합니다.

또한 Cloudflare는 일부 최신 DeepSeek, GLM, Kimi 모델에 유료 결제 수단이 필요하다고 안내합니다. ‘10,000 Neurons 무료’가 모든 모델을 결제 설정 없이 쓸 수 있다는 뜻은 아닙니다.

무료지만 조건을 꼭 봐야 하는 서비스

Cerebras: 쓸 만한 체험판이지만 영구 무료 API는 아님

Cerebras의 속도 제한 문서는 대상 Free Trial 모델에 대해 5 RPM, 30,000 uncached TPM, 90,000 total TPM, 1 million TPD를 제시합니다. 또한 토큰 버킷은 단순한 일일 초기화를 기다리는 방식이 아니라 지속적으로 보충된다고 설명합니다.

신규 계정에는 $5 상당의 무료 크레딧이 제공되며, 이 크레딧은 30일 후 만료됩니다. Playground와 API 접근을 활성화하려면 인증된 결제 수단도 필요합니다. 크레딧이 만료되거나 소진되면 추가 구매 없이는 접근이 중단됩니다. 확인한 문서에는 영구적으로 갱신되는 공개 무료 할당량이 설명되어 있지 않습니다.

Cerebras는 단기 평가에는 유용합니다. 체험 기간 이후에도 계속 작동해야 하는 프로젝트의 유일한 의존성으로 삼아서는 안 됩니다.

SambaNova Cloud: 결제 상태에 따라 무료 경계가 가장 분명한 서비스

SambaNova는 결제 수단이 연결되지 않은 상태를 Free Tier로 정의합니다. 대상 Free Tier 모델의 공식 문서상 한도는 20 RPM, 20 RPD, 200,000 TPD입니다. 20 RPD는 토큰 할당량을 다 쓰기도 전에 폴링이 잦은 워크플로를 멈출 수 있는 수준입니다.

결제 수단을 연결하면 유료 Developer Tier가 활성화되며, 이를 무료 이용으로 계산하면 안 됩니다. SambaNova는 응답 헤더로 남은 요청 수와 초기화 정보도 제공합니다.

SambaNova는 저용량 PoC에만 쓰는 편이 좋습니다. 에이전트 워크플로에 적용하기 전에는 20 RPD 상한을 반드시 검증해야 합니다.

Cohere: RAG에는 유용하지만 호출 횟수를 꼼꼼히 계산해야 함

Cohere의 체험 키는 토큰 기반 무료 티어와 다릅니다. 현재 검증된 비교 자료는 월 1,000회 호출과 함께 엔드포인트별 제한으로 Chat 20 RPM, Embed 분당 2,000 입력, Rerank 10 RPM을 제시합니다. Cohere FAQ도 체험 키를 무료이지만 제한적인 방식으로 설명합니다.

이 구성은 검색 증강 생성 실험에 유용합니다. 하나의 프로젝트에서 생성, 임베딩, 리랭킹을 함께 시험할 수 있기 때문입니다. 그렇다고 고트래픽 채팅 백엔드가 되는 것은 아닙니다. 월 1,000회 호출을 하루 100만 토큰과 직접 비교해서도 안 됩니다.

검증된 비교 자료에서는 이 체험판을 평가 전용으로 분류합니다. 공개 또는 상업용 애플리케이션에 사용하기 전 최신 이용 정책을 확인하세요.

Z.AI: 무료 가격과 공개 할당량은 별개

Z.AI의 가격 문서는 GLM-4.7-Flash와 GLM-4.5-Flash를 표시된 토큰 카테고리에서 무료로 안내합니다. 그러나 확인한 공개 가격 페이지에는 RPM, RPD, TPM, TPD에 해당하는 구체적 수치가 없습니다.

Z.AI의 할당량은 알 수 없는 값으로 다루는 편이 안전합니다. 수동 테스트에는 맞을 수 있지만 배치 작업용으로 판단하기는 어렵습니다. 가입 시 엔드포인트, 모델 제공 여부, 약관을 확인하세요.

NVIDIA, Hugging Face, Mistral: 할당량 정보가 불완전한 탐색 경로

제공업체무료 이용 신호공개되지 않은 할당량 정보실용적인 활용 방식
NVIDIA NIM프로토타이핑용 Free Inference Endpoints랜딩 페이지에 공통 RPM, 토큰 할당량, 카드 조건, 초과 사용 가격 없음원하는 엔드포인트를 시험한 뒤 모델별 약관 확인
Hugging Face Inference Providers변경될 수 있는 무료 사용자 $0.10/월 크레딧비교 가능한 RPM 또는 TPM 할당량 없음GPU 인프라를 직접 관리하지 않고 라우팅된 모델로 소규모 실험
Mistral StudioStudio Free mode 및 API 빠른 시작 가이드문서 홈페이지에 할당량 또는 카드 조건 없음유료 구성으로 확정하기 전에 Mistral API 기능 체험

어떤 무료 LLM API를 골라야 할까?

우선순위첫 선택이유
범용 프로토타입Google AI StudioGemini가 명확한 범용 기준점을 제공하며, 현재 한도는 AI Studio에서 확인 가능
빈번한 소규모 요청Groq모델별 Free Plan 한도가 공개되어 있고 1,000 RPD 사례 존재
하나의 API로 다양한 모델 사용OpenRouter무료 변형 모델, 라우팅, OpenAI 스타일 인터페이스 제공
Cloudflare 중심 애플리케이션Workers AI매일 갱신되는 10,000 Neurons/일 할당량
명시된 체험판 토큰 수치가 가장 중요Cerebras최대 1M TPD지만, 카드가 필요한 30일 체험판에 한정
결제 수단을 절대 연결하지 않는 구성Groq 우선, 아주 낮은 볼륨이라면 SambaNovaSambaNova Free Tier는 20 RPD 상한 보유
RAG 구성 요소CohereChat, Embed, Rerank를 하나의 체험 키 생태계에서 제공
GLM Flash 테스트Z.AI표시된 토큰 가격은 $0이지만 공개 할당량은 알 수 없음
GPU 없이 오픈 모델 탐색Hugging Face라우팅 접근과 무료 사용자용 $0.10/월 제공

우선 제공업체 하나로 시작하고, 매 요청마다 모델 ID, HTTP 상태, 토큰 사용량, 남은 한도 헤더 네 가지를 기록하세요. 첫 경로에서 어떤 제한에 먼저 도달하는지 파악한 다음에만 두 번째 제공업체를 추가하는 편이 좋습니다. 키를 여러 개 사용한다고 반드시 용량이 늘어나는 것은 아닙니다.

사용 전 무료 LLM API를 검증하는 방법

출시 전에 다음 다섯 가지를 확인하세요.

  1. 할당량 단위: 요청 수, 토큰, 호출 수, 달러, 컴퓨팅 단위 중 무엇으로 측정되는가?
  2. 초기화 방식: UTC 또는 태평양 시간 기준으로 초기화되는가, 지속적으로 보충되는가, 매월 갱신되는가, 아니면 한 번 만료되는가?
  3. 적용 범위: 제한은 모델, 프로젝트, 계정, 조직 중 어디에 연결되는가?
  4. 결제 조건: 카드를 추가하면 용량만 늘어나는가, 유료 티어가 활성화되는가, 혹은 체험판에 카드가 필수인가?
  5. 약관 및 실패 처리 경로: 테스트·평가 전용인가, 그리고 클라이언트가 재시도 폭주 없이 HTTP 429를 처리하는가?

무료 LLM API FAQ

전반적으로 가장 좋은 무료 LLM API는 무엇인가요?

범용 프로토타입에는 Google AI Studio, 더 높은 무료 요청량에는 Groq, 모델 선택 폭에는 OpenRouter가 적합합니다.

신용카드 없이 무료 LLM API를 사용할 수 있나요?

네. 검증된 비교 자료에서는 Google, Groq, OpenRouter의 기본 경로, Cloudflare의 기본 할당량, SambaNova Free Tier를 무카드 선택지로 분류합니다. Cerebras는 Free Trial에 인증된 결제 수단이 필요합니다.

무료 LLM API는 정말 영구적인가요?

일부 정기 티어는 약관이 유지되는 동안 계속 제공될 수 있습니다. 하지만 체험판, 프로모션 가격, 순환하는 :free 경로는 제공업체 전체에 영구적으로 적용되는 할당량이 아닙니다. 하나에 의존하기 전 현재 문서와 모델 상태를 확인하세요.

무료 LLM API를 프로덕션에서 사용해도 되나요?

현재 약관, 할당량, 모델 제공 여부가 프로덕션 요구 사항을 충족하지 않는다면 단독 백엔드로 사용하지 마세요.

무료 한도에 도달하면 어떻게 되나요?

일반적으로 제공업체는 스로틀링 또는 할당량 오류를 반환합니다. Groq는 HTTP 429 처리 방법을 문서화하고 있으며, Cloudflare는 Free 플랜의 일일 할당량을 소진하면 이후 작업이 실패한다고 안내합니다. Cerebras는 체험 크레딧이 만료되거나 소진되면 접근을 중단합니다.

>_AIReiter 모델 디렉터리

이 가이드와 관련된 모델로 빠르게 API 접근

Gemini 3.6 Flash

Chat

고급 추론, 코딩, 에이전트 작업을 위한 빠른 Gemini 모델입니다.

GoogleAPI Key 생성 >

Gemini 2.5 Pro

Chat
GoogleAPI Key 생성 >

Claude Fable 5

Chat

심층 추론과 복잡한 장문 작업을 위한 프리미엄 Claude 모델입니다.

AnthropicAPI Key 생성 >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI Key 생성 >

Claude Opus 4.8

Chat

까다로운 추론과 전문적인 작업을 위한 고성능 Claude 모델입니다.

AnthropicAPI Key 생성 >

최근 게시글

Janitor AI에서 DeepSeek 사용하는 법 (2026 설정 가이드)

2026-09-08

Muse Spark 1.3 API 가격: Standard와 Contributor 비교

2026-09-08

GPT-6 Astra API 리뷰(2026): 에이전트용이지, 무조건 교체용은 아니다

2026-09-07

Kling API 연동 가이드: 공식 API와 애그리게이터 비교 (2026)

2026-09-07
AIREITER

문의가 있으신가요? 연락처
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 비디오

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 이미지

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

블로그

모두 보기 →

회사

개인정보 처리방침서비스 약관환불 정책

© 2026 AIReiter. All rights reserved.