무료 AI API, 어디까지 쓸 수 있나
AI API에서 ‘무료’는 거의 항상 무제한을 뜻하지 않는다. 대개 요청 횟수나 토큰 수에 제한이 있는 무료 티어이며, 매달 또는 매일 다시 채워지는 할당량일 수도 있고 소진하면 끝나는 프로모션 크레딧일 수도 있다. 아래 서비스는 모두 신용카드 없이 API 키를 발급하지만, 실제로 쓸 수 있는 규모는 하루 몇 건부터 수만 건까지 큰 차이가 난다.
이 글의 수치는 2026년 8월 각 제공업체의 공식 문서를 기준으로 확인했다. 요청 한도는 자주 바뀌므로 운영 용량을 계획할 때는 반드시 해당 서비스 콘솔에서 최신 값을 다시 확인해야 한다.
| 제공업체 | 무료 티어 핵심 정보 | 데이터 정책 핵심 | 추천 용도 |
|---|---|---|---|
| Google AI Studio | 카드·결제 계정 불필요, Gemini 모델 제공, 프로젝트별 할당량은 태평양 시간 자정에 초기화 | 무료 프롬프트는 Google 제품 학습에 사용 | 다양한 모델, 프로토타이핑 |
| Groq | Llama 3.1 8B 기준 14,400 RPD, Compound 모델 기준 70K TPM | 기본 추론 데이터 보관 없음, ZDR 제공 | 짧은 프롬프트의 고빈도 호출 |
| OpenRouter | 하루 무료 요청 50건, 무료 모델 25개 이상, BYOK 지원 | 상위 제공업체 정책에 따라 다름 | 여러 모델 테스트 |
| GitHub Models | 15 RPM / 150 RPD(로우 티어), 입력 8,000 + 출력 4,000 토큰 | Microsoft 데이터 약관 적용 | PAT로 빠른 실험 |
| Cloudflare Workers AI | 하루 10,000 Neurons(Llama 3.1 8B Fast에서 출력 약 280K 토큰) | 학습 미사용을 명시적으로 약속 | 민감한 데이터 처리 |
| Cohere | 분당 20건, 월 1,000회 호출 | 평가 라이선스 | 임베딩·리랭킹 테스트 |
| NVIDIA NIM | 가입 크레딧 1,000, 업무용 이메일 사용 시 최대 5,000 | 무료 엔드포인트 사용 기록 | 일회성 모델 테스트 |
| Hugging Face | 200개 이상 모델에 월 $0.10 | 할당량 변경 가능 | 데모 수준 추론 |
| Mistral | 무료 API 키 모드, 한도는 Admin Panel에서 확인 | Zero-retention 옵션 언급 | 유럽 호스팅 모델 |
9개 서비스 모두 신용카드 없이 키를 발급한다. 이 가운데 7곳은 주기적으로 갱신되는 무료 티어를 제공하며, NVIDIA와 Hugging Face는 다시 충전되지 않는 소진형 크레딧 방식이다. 격차도 크다. GitHub Models에서는 DeepSeek-R1을 하루 8회 호출할 수 있는 반면, Groq의 Llama 3.1 8B는 하루 14,400회까지 제공한다.
Google AI Studio: 가장 먼저 써볼 기본 무료 티어
결제 정보를 입력하지 않고 최상위급 모델을 무료로 사용하려면 Google AI Studio가 가장 자연스러운 출발점이다. Google 계정으로 로그인해 API 키를 만들면 바로 호출할 수 있으며, 신용카드나 결제 계정은 필요하지 않다.
무료 티어에서는 Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro 등을 포함한 Gemini 모델군을 사용할 수 있다. 텍스트와 임베딩 엔드포인트가 포함되며, 할당량은 프로젝트별로 적용되고 태평양 시간 자정에 초기화된다.
가입 전에는 실제 한도를 알기 어렵다
Google은 Groq나 OpenRouter처럼 단일한 ‘무료 티어’ 요청 한도표를 공개하지 않는다. 분당 요청 수, 분당 토큰 수, 일일 토큰 수 같은 실제 한도는 프로젝트를 만든 뒤에야 AI Studio 콘솔에서 확인할 수 있다. 사전에 용량을 계획하기는 어렵기 때문에, 프로젝트를 먼저 생성하고 Quotas 페이지의 제한값을 확인한 뒤 그 범위에 맞춰 설계하는 것이 현실적이다.
무료 티어 프롬프트는 Google 제품 학습에 활용된다
이 서비스에서 가장 중요한 주의점이다. Google 무료 티어 약관에는 프롬프트와 생성 콘텐츠가 Google 제품 개선에 사용될 수 있다고 명시돼 있다. 민감한 정보, 독점 데이터, 개인정보를 다룬다면 무료 티어는 적합하지 않다. 결제 계정이 연결된 Google Cloud를 통한 유료 Gemini API 사용에는 이 학습 조항이 적용되지 않지만, 신용카드가 필요하다.
Gemini를 통한 무료 이미지 생성도 사용할 수 없다. 무료 범위는 텍스트와 임베딩으로 한정된다.
Groq: 일일 한도가 명확한 고처리량 선택지
짧은 프롬프트를 자주 호출하는 워크로드라면 Groq 무료 티어가 가장 넉넉하다. 한도는 Groq 문서에 명확히 공개돼 있으며 사용자별이 아니라 조직별로 적용된다. 캐시된 토큰은 요청 한도 계산에 포함되지 않는다.
| 모델 | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14,400 | 6,000 | 500,000 |
| Llama 3.3 70B Versatile | 30 | 1,000 | 12,000 | 100,000 |
| GPT-OSS-120B | 30 | 1,000 | 8,000 | 200,000 |
| GPT-OSS-20B | 30 | 1,000 | 8,000 | 200,000 |
| Qwen 3.6-27B | 30 | 1,000 | 8,000 | 200,000 |
| Groq Compound | 30 | 250 | 70,000 | — |
| Groq Compound Mini | 30 | 250 | 70,000 | — |
| Whisper Large V3 | 20 | 2,000 | — | 하루 오디오 28,800초 |
가장 눈에 띄는 모델은 하루 14,400회를 제공하는 Llama 3.1 8B다. 본격적인 프로토타입은 물론 트래픽이 낮은 운영 엔드포인트에도 충분한 수준이다. Compound 모델은 분당 70,000 토큰으로 TPM 한도가 가장 높지만, 일일 요청 수는 250 RPD로 더 낮다.
Groq는 기본적으로 추론 데이터를 보관하지 않으며 Zero Data Retention(ZDR) 옵션도 제공한다. 무료 제공업체 중 개인정보 보호 측면에서 더 강력한 선택지에 속한다. 다만 8B 모델의 분당 토큰 한도는 6,000 TPM이므로, 긴 컨텍스트나 대량 생성 작업에서는 병목이 생길 수 있다.
OpenRouter: 무료 요청은 하루 50건
OpenRouter는 모델 호스팅 서비스가 아니라 API 게이트웨이다. 무료 티어에서는 OpenRouter가 비용을 지원하는 모델 풀을 호출할 수 있다. 모델 이름 뒤에 :free를 붙이거나 openrouter/free 자동 라우터를 사용하면 된다.
요청 한도: 무료 모델은 분당 20건, 하루 50건으로 제한된다. $10 크레딧을 한 번 구매하면 무료 모델의 영구 일일 한도가 1,000건으로 올라간다. 이 제한과 별개로 상위 제공업체의 스로틀링도 적용될 수 있다.
무료 모델 구성: 2026년 8월 기준 OpenRouter에는 텍스트 생성, 임베딩, 리랭킹에 걸친 무료 모델이 25개 이상 등록돼 있다. 7월의 15개에서 늘어난 수치다. NVIDIA의 Nemotron 3 Ultra, Super, Nano 제품군(최대 1M-토큰 컨텍스트), Google의 Gemma 4, Cohere의 North Mini Code, OpenAI의 gpt-oss-20b 등을 포함한다. 제공업체가 무료 엔드포인트를 추가하거나 철회하면서 목록은 자주 바뀐다.
BYOK(Bring Your Own Key): OpenRouter는 60개 이상 추론 제공업체에 대해 BYOK를 지원한다. 자체 제공업체 API 키를 입력하면 추론 비용은 해당 제공업체가 직접 청구하고, OpenRouter는 라우팅 레이어 비용만 청구한다. 무료 BYOK 할당량은 이제 고정 요청 수가 아니라 정가 기준 추론 비용으로 산정되며 플랜에 따라 달라진다. 최신 조건은 OpenRouter 가격 페이지에서 확인해야 한다.
실무에서 기억할 점은 OpenRouter의 ‘무료’가 토큰 비용이 없다는 뜻이지, 데이터가 보관되지 않는다는 뜻은 아니라는 것이다. 데이터 정책은 상위 제공업체마다 다르며, NVIDIA와 Poolside를 포함한 일부 업체는 무료 엔드포인트 사용을 명시적으로 기록하거나 프롬프트를 학습에 활용할 수 있다. 필요하다면 제공업체별 개인정보 보호 필터를 설정해야 한다.
추가로 살펴볼 무료 티어 6종
GitHub Models
GitHub Models는 GitHub Personal Access Token(PAT)으로 인기 모델을 사용할 수 있는 플레이그라운드와 API 엔드포인트를 제공한다. 로우 티어는 15 RPM과 150 RPD, 하이 티어는 10 RPM과 50 RPD다. 요청당 입력은 8,000토큰, 출력은 4,000토큰으로 제한된다. DeepSeek-R1도 사용할 수 있지만 하루 8회로 제한된다.
PAT 기반 인증이라 별도 가입 없이 빠르게 실험할 수 있다는 점은 편리하다. 다만 토큰과 요청 한도가 빡빡해 프로토타이핑 이상의 용도에는 맞지 않는다.
Cloudflare Workers AI
Cloudflare Workers AI는 모든 계정에 하루 10,000 Neurons를 제공하며, 00:00 UTC에 초기화된다. Llama 3.1 8B Fast 기준으로는 하루 출력 약 280,000토큰에 해당한다. Cloudflare는 FLUX도 무료 이미지 생성용으로 호스팅한다. 이 목록에서 신용카드 없이 쓸 수 있는 주요 이미지 생성 옵션이다.
개인정보 보호 정책은 여기서 다룬 서비스 중 가장 강력하다. Cloudflare는 동의 없이 고객 프롬프트나 출력을 학습 또는 서비스 개선에 사용하지 않겠다고 명시적으로 약속한다. 민감한 데이터를 다루는 작업에는 Workers AI를 가장 우선적으로 추천할 수 있는 이유다.
다만 Neurons는 요청 수나 토큰 수보다 직관성이 떨어진다. 특정 모델이 토큰당 얼마나 많은 Neurons를 소비하는지는 Workers AI 대시보드에서 확인해야 한다.
Cohere, NVIDIA, Hugging Face, Mistral
Cohere는 무료 티어에서 분당 20건, 월 1,000회 API 호출을 제공한다. 운영 트래픽보다는 평가와 테스트에 맞는 한도다. Cohere의 Command 모델과 임베딩 엔드포인트가 포함된다.
NVIDIA NIM은 가입 크레딧 1,000을 제공하며, 업무용 이메일을 사용하면 최대 5,000까지 받을 수 있다. 매달 갱신되는 무료 할당량이 아니라 일회성 소진형 크레딧이고, 크레딧당 요청 수 환산 기준은 공개돼 있지 않다. OpenRouter에서 제공되는 NVIDIA 무료 모델에는 경고가 붙는다. 무료 엔드포인트 사용은 기록되며, NVIDIA는 기밀 정보나 개인정보를 제출하지 말라고 안내한다.
Hugging Face는 Serverless Inference API를 통해 200개 이상 모델에 월 약 $0.10의 무료 추론 크레딧을 제공한다. 이 할당량은 변경될 수 있다고 명시돼 있다. 모델을 시험해 보는 데는 충분하지만, 서비스 기반으로 삼을 규모는 아니다.
Mistral은 무료 API 키 모드를 제공하지만 한도는 Admin Panel에서만 확인할 수 있다. Mistral 문서에는 zero-retention 옵션이 언급돼 있으나, 이를 무료 티어의 명확한 기본 정책으로 제시하지는 않는다. 따라서 개인정보에 민감한 용도에서 판단하기가 더 어렵다.
텍스트 외 기능: 이미지, 음성, 임베딩
텍스트 이외의 모달리티까지 무료로 지원하는 서비스는 두 곳이다.
- Cloudflare Workers AI는 이미지 생성 모델 FLUX를 무료로 호스팅한다. 이 목록에서 신용카드 없이 가능한 유일한 이미지 생성 옵션이다. Gemini 이미지 모델은 무료 티어에서 사용할 수 없다.
- Groq Whisper는 무료 플랜에서 하루 2,000회 요청과 하루 오디오 28,800초의 음성-텍스트 변환을 제공한다.
OpenRouter 무료 카탈로그에도 NVIDIA의 임베딩 및 리랭킹 모델이 추가돼, 무료 티어에서 검색·RAG 기능까지 구성할 수 있게 됐다.
데이터가 중요하다면 후보는 두 곳으로 좁혀진다
민감한 정보, 독점 데이터, 규제 대상 데이터를 다룬다면 이 목록의 상당수 서비스는 제외해야 한다.
- Google AI Studio는 무료 티어 프롬프트를 제품 학습에 사용한다.
- NVIDIA는 무료 엔드포인트 사용을 기록하며 기밀 데이터 제출을 경고한다.
- OpenRouter의 무료 모델은 상위 제공업체의 데이터 정책을 따른다. Poolside, Liquid 등 일부 업체는 무료 프롬프트를 학습에 사용한다고 명시한다.
- Hugging Face와 Mistral은 데이터 보관 조건이 불명확하거나 변경될 수 있다.
명확하고 명시적인 개인정보 보호 약속을 제공하는 곳은 두 곳이다.
- Cloudflare Workers AI — 동의 없는 학습 및 서비스 개선 미사용을 명시적으로 약속한다.
- Groq — 기본적으로 추론 데이터를 보관하지 않으며 Zero Data Retention 옵션을 제공한다.
개인정보에 민감하면서 사용량이 낮거나 중간 수준이라면 Cloudflare가 더 안전한 선택이다. 더 높은 처리량이 필요하고 Groq의 분당 토큰 한도 안에서 운용할 수 있다면 ZDR을 적용한 Groq가 대안이다.
무료 티어가 부족해졌을 때의 선택
이 목록의 모든 무료 티어는 언젠가 한도에 걸린다. 그때 어떻게 전환할지가 중요하다.
권장하는 방식은 여러 무료 티어를 옮겨 다니는 것이 아니라 한 제공업체의 종량제 유료 사용으로 전환하는 것이다. 요청 제한을 피하려고 제공업체를 계속 바꾸면 SDK, 데이터 정책, 장애 양상이 모두 달라져 운영 복잡도가 커진다. 보통은 API 비용을 아끼는 것보다 엔지니어링 시간 손실이 더 크다.
위에서 소개한 서비스 중 Groq, OpenRouter, Cloudflare Workers AI, Google AI Studio는 OpenAI 호환 엔드포인트를 지원한다. Google AI Studio는 OpenAI 호환 래퍼를 통해 지원한다. 따라서 애플리케이션 코드를 다시 작성하지 않고도 base URL과 API 키만 바꿔 무료에서 유료로 전환할 수 있다.
실질적인 전환 경로는 이렇다. 모델 선택 폭이 필요하다면 Google AI Studio, 처리량이 중요하다면 Groq에서 무료로 시작한다. 일일 한도에 지속적으로 도달하면 같은 제공업체에 결제 계정을 추가하고 종량제 요금제로 전환한다. 여러 모델을 비교할 때는 OpenRouter를 쓰고, 데이터 프라이버시가 절대 양보할 수 없는 조건이라면 Cloudflare를 선택하면 된다.
FAQ
신용카드 없이 사용할 수 있는 무료 AI API는 무엇인가? 위에 소개한 9개 제공업체 모두 신용카드 없이 API 키를 발급한다. Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face, Mistral이 해당한다.
일일 요청 한도가 가장 높은 무료 API는 무엇인가? Groq의 Llama 3.1 8B Instant는 하루 14,400회를 제공한다. 이 글에서 다룬 서비스 중 반복적으로 갱신되는 무료 티어 기준 가장 높은 일일 요청 수다.
OpenRouter는 정말 무료인가? OpenRouter의 :free 모델 변형은 토큰당 비용이 없지만 하루 50회로 제한된다. $10 크레딧을 구매하면 1,000회가 된다. BYOK 모드에서는 자체 제공업체 키를 통해 라우팅할 수 있으며, 플랜에 따라 무료 할당량이 적용된다. 어느 쪽도 완전한 무제한은 아니다.
무료 AI API를 운영 환경에서 사용해도 되는가? 요청 한도 안에서는 가능하다. Groq와 Cloudflare는 각각 처리량과 개인정보 보호라는 강점에서 가장 운영 환경에 가까운 무료 티어다. 무료 한도가 작업을 자주 끊기 시작하면 같은 제공업체의 유료 티어로 전환하는 편이 좋다.
개인정보에 민감한 데이터에는 어떤 무료 API가 가장 적합한가? Cloudflare Workers AI와 Groq만 무료 티어에서 학습 미사용 또는 데이터 미보관에 관한 명시적 약속을 제공한다. 나머지는 무료 프롬프트를 학습에 사용하거나(Google), 사용 기록을 남기거나(NVIDIA), 제공업체별 정책에 따라 달라진다(OpenRouter).