Gemini Omni Flash의 실제 API 가격은 720p 비디오 1초당 약 $0.10이며 — 이는 초당 5,792 토큰 기준으로 토큰 100만 개당 $17.50에 해당합니다. 자세한 내용은 Google의 Gemini API 가격 페이지에서 확인할 수 있으며, 2026년 7월 기준으로 확인되었습니다. 이 모델에는 무료 등급이 없습니다. 문서에 묻혀 있어 놓치기 쉬운 모델 ID는 gemini-omni-flash-preview이며, 여전히 "preview"로 표시되어 있어 정식 출시 전까지 가격 및 접근 세부 사항이 변경될 수 있습니다. 이 모델은 Google AI Studio와 Vertex AI라는 서로 다른 두 경로로 제공되며, 두 서비스는 코드를 공유하지 않습니다. 어딘가에서 "$0.20–0.60 per second"라는 추정치를 보셨다면, 그것은 Google이 실제 수치를 공개하기 전에 작성된 출시 전 추측이었으며, 지금은 더 이상 유효하지 않습니다.
Gemini Omni Flash가 실제로 무엇인지
Google의 출시 게시물에 따르면, Gemini Omni Flash는 새로운 "Omni" 제품군의 첫 번째 모델로, 텍스트, 이미지, 오디오, 비디오를 입력으로 받아 Gemini의 세계 지식에 기반한 비디오를 반환하는 any-to-any transformer입니다. Google AI Plus, Pro, Ultra 구독자는 Gemini 앱, Google Flow, YouTube Shorts/Create를 통해 이를 무료로 이용할 수 있으며, 개발자 API 접근은 2026년 6월 말에 이어졌습니다. VentureBeat에 따르면.
가장 돋보이는 기능은 대화형 다중 턴 편집입니다: 변경 사항을 설명하면, 캐릭터와 장면의 일관성을 유지한 채 편집을 적용하고, 같은 스레드에서 계속 반복 수정할 수 있습니다.
DeepMind 모델 카드에는 안전 가드레일이 나열되어 있습니다. 모든 클립에 대한 SynthID 워터마킹과 C2PA 콘텐츠 자격 증명, 실제 인물의 정지 사진을 오디오에 립싱크하는 기능 금지, 제한된 음성 편집 기능 — 그리고 세 가지 알려진 취약점: 여러 단계 편집 전반의 일관성, 복잡한 동작 장면, 정확한 화면 텍스트. 우리는 아래에서 이 세 가지를 모두 테스트했습니다.
우리는 멀티턴 편집을 직접 테스트했습니다
우리는 이를 Google Flow에서 두 라운드 편집 시퀀스로 실행했습니다: 손글씨로 적힌 골판지 표지판을 들고 있는 여성을 생성한 다음, 같은 클립을 편집해 야간으로 전환하고 네온 사인이 있는 장면으로 바꾸며 그녀가 돌아서 카메라를 향해 걸어오게 했습니다. 두 출력 파일 모두 720p, 24fps, 8초, 네이티브 스테레오 오디오로 돌아왔으며 — 서드파티 통합자들이 보고한 내용과 일치하고, 이제는 우리 자체 파일에서도 독립적으로 확인되었습니다.
종이판 표지판의 화면 상 텍스트 — "OPEN TODAY" — 가 전체 8초 동안 글자 깨짐 없이 완벽하게 렌더링되었습니다. 모델 카드 자체가 인정하듯, 정확한 텍스트 렌더링은 이 모델의 약점 중 하나이기 때문에 이는 주목할 만합니다.
실제 적용에서도 캐릭터 일관성 주장은 잘 유지됩니다: 같은 얼굴, 같은 빨간 패딩 재킷, 같은 흰색 스웨터, 같은 머리, 그리고 장면에 새 네온사인이 추가된 완전히 다른 조명 설정에도 깔끔하게 그대로 이어졌습니다. 다만 두 가지는 지시한 대로 되지 않았습니다:
배경 상점 간판의 텍스트 렌더링이 깨졌습니다 — 창문에 있는 "COFFEE" 간판이 "COFFFEE"라고 다시 나타났습니다(글자가 하나 더 있음), 비록 1라운드의 전경 카드보드 간판은 완벽했음에도 불구하고. 텍스트 정확도는 모델이 텍스트를 전혀 렌더링할 수 있는지 여부뿐 아니라, 그 텍스트가 화면에서 얼마나 눈에 띄고 중앙에 있는지에 크게 좌우되는 것 같습니다.
요청한 "몸을 돌려 카메라 쪽으로 걸어오기" 동작은 거의 일어나지 않았습니다. 위 클립을 보세요 — 대신 우리가 얻은 것은 피사체가 대부분 제자리에 있는 상태에서 카메라와의 거리만 미묘하게 변한 것이었고, 프롬프트에서 요구한 분명한 회전 및 걸어오기 동작은 아니었습니다. 이는 모델 카드에서 Google이 공개한 "complex-motion scenes" 제한과도 일치합니다; 여러 단계의 신체 동작은 아직 정적에서 정적로의 조명이나 장면 변화만큼 신뢰성 있게 지시를 따르지 못합니다.
예산을 잡을 때 또 하나 고려할 점이 있습니다: 오타가 난 한 번의 수정으로 인해 Flow에서 사용 가능한 생성 횟수 중 하나가 소모되었고, 이는 예상보다 빠르게 테스트 세션을 소진시키기에 충분했습니다. Google은 Omni Flash의 정확한 플랜별 생성 할당량을 공개하지 않으므로, 본격적으로 테스트한다면 계획했던 것보다 더 많은 시도를 하게 될 것을 예상해야 하며, 잘못된 프롬프트를 공짜로 다시 시도할 수 있다고 가정해서는 안 됩니다.
Gemini Omni Flash 가격, 세부 내역
다음은 Google의 Gemini API 요금 페이지에 따른 요금표입니다 — 무료 요금제는 없고, Standard 요금만 있습니다:
가격 | |
|---|---|
입력 (텍스트 / 이미지 / 비디오 / 오디오) | 1M 토큰당 $1.50 |
출력 — 텍스트 | 1M 토큰당 $9.00 |
출력 — 비디오 | 1M 토큰당 $17.50 |
동영상은 초 단위로 직접 요금이 부과되지 않습니다 — 출력 토큰 기준으로 과금되며, Google은 변환 기준을 명시합니다: 720p 동영상 1초당 5,792 토큰. 계산해 보면 ($17.50 ÷ 1,000,000 × 5,792) 대략 초당 $0.101이 나오며, 이는 Google의 문서에서 "approximately $0.10 per second."로 반올림됩니다.
실제 클립에서 720p 기준으로 이것이 의미하는 바는 다음과 같습니다:
클립 길이 | 대략적인 비용 |
|---|---|
4초 | $0.41 |
5초 | $0.51 |
6초 | $0.61 |
8초 | $0.81 |
10초 | $1.01 |
입력 토큰을 추가로 고려하세요 — 짧은 텍스트 프롬프트에 참조 이미지 한두 장을 더하면 보통 $1.50/1M 기준으로 몇 센트가 추가되며 — 8초 클립의 총액은 약 $0.85에 가깝습니다. Google의 페이지는 720p에 대한 토큰-초 변환만 문서화되어 있으며, 1080p와 4K는 별도로 나와 있지 않으므로, 이들은 아마 더 비쌀 것으로 보고 예산을 잡고 실제 운영 전에 라이브 페이지를 다시 확인하세요.
실제로 API 액세스 권한을 얻는 방법
실제로 공식적으로 확인된 채널은 두 개뿐입니다 — Google의 자체 채널이 완전히 개방되기 전에 더 넓은 재판매 접근을 주장하는 어떤 제3자 가이드에도 회의적이세요:
Google AI Studio —
aistudio.google.com/apikey에서 키를 받아GEMINI_API_KEY로 내보내고, Interactions API를 통해gemini-omni-flash-preview로 모델을 호출합니다(pip install -U google-genai또는npm install @google/genai). 테스트하기 위한 가장 빠른 방법입니다.Vertex AI — 동일한 기본 모델이지만, 별도의 엔터프라이즈급 엔드포인트를 통해 제공되며, 여기에 추가로 GCP 프로젝트 ID, region/location 설정, 그리고 일반 API 키 대신 IAM 기반 인증이 필요합니다. Google Cloud billing을 다뤄본 적이 없다면 설정에 30~60분을 예상하세요.
미리 고려할 가치가 있습니다: AI Studio와 Vertex AI는 서로 다른 Google 제품 표면입니다 — 문서도 다르고, SDK도 다르며, 인증 방식도 각각 API-key 인증과 GCP IAM 인증으로 다릅니다. 이들은 설계상 서로 대체 가능하지 않으므로, 나중에 AI Studio에서 프로토타입을 만든 뒤 Vertex로 그대로 복사해 옮길 수 있다고 가정하기보다, 먼저 실제로 배포할 플랫폼을 선택한 다음 그에 맞춰 빌드하세요.
시작하기 전에 알아두면 좋은 점이 하나 더 있습니다: Google's Interactions API 시작 가이드에 따르면, 비디오 생성은 동기식 응답이 아니라 장시간 실행되는 작업에 대해 기본적으로 background=True를 사용하며, 이는 또한 OpenAI chat-completions와 호환되지 않음을 의미합니다. 최소한의 Python 패턴 — 예시용입니다; 실제 적용 전에 정확한 필드 이름은 현재 google-genai SDK 참조 문서를 확인하세요:
from google import genai
import time
client = genai.Client() # 환경에서 GEMINI_API_KEY를 읽음
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="A drone shot pulling back from a lighthouse at sunset",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
여기에는 바로 사용할 수 있는 chat-completions 형식이 없습니다 — 기존 통합 코드가 OpenAI의 동기 응답 형식을 가정한다면, 모델 문자열만 바꾸는 것이 아니라 요청/응답 처리를 다시 작성해야 합니다.
Gemini Omni Flash 대 단일 샷 비디오 모델
대화형 편집 루프에는 Omni Flash를 선택하세요. 고정 해상도와 길이의 단일 텍스트/이미지에서 비디오 작업에는, 단발성 모델이 더 단순하고 비용도 더 예측하기 쉽습니다:
가장 적합한 용도 | 접근 | |
|---|---|---|
Gemini Omni Flash | 다회차 대화형 편집, 편집 전반에 걸친 캐릭터 일관성 | Google AI Studio 또는 Vertex AI에서 직접 |
고정 사양의 단발성 텍스트/이미지-투-비디오 | 각 벤더에서 직접, 또는 AIReiter와 같은 릴레이 플랫폼에 번들로 제공 |
Omni Flash는 아직 AIReiter나 이와 유사한 번들 릴레이 플랫폼에 올라와 있지 않습니다 — 멀티턴 워크플로의 경우, Google의 자체 API를 바로 사용하는 것이 여전히 가장 간단한 옵션입니다.
자주 묻는 질문
Gemini Omni Flash 모델 ID는 무엇인가요?
gemini-omni-flash-preview. Google AI Studio 또는 Vertex AI에서 Interactions API를 통해 호출할 때는 이 정확한 문자열을 사용하세요. 아직 preview 모델이므로, 정식 출시 시 ID가 변경될 수 있습니다.
Gemini Omni Flash의 비디오당 비용은 얼마인가요?
720p에서 초당 약 $0.10이므로, 일반적인 4~10초 클립은 $0.50~$1 정도입니다.
Gemini Omni Flash에 무료 티어가 있나요?
아니요. Google의 가격 페이지에는 무료 티어의 입력과 출력 모두에 대해 "사용 불가"로 표시되어 있으며, 표준(유료) 티어에만 해당됩니다.
AI Studio와 Vertex AI에서 동일한 코드를 사용할 수 있나요?
직접적으로는 아닙니다. 이들은 서로 다른 SDK와 인증 방식(API key vs. GCP IAM)을 사용하는 별개의 Google 제품 표면이므로, 하나에 맞게 작성한 코드를 다른 쪽으로 옮기려면 실제로 상당한 재작업이 필요합니다. 빌드하기 전에 배포 대상을 먼저 선택하세요.
Gemini Omni Flash는 OpenAI 스타일의 chat completions 코드와 함께 작동하나요?
아니요. 비디오 생성은 동기식 chat-completions 응답 형식이 아니라 비동기 작업 생성 및 폴링(background=True 및 interactions.get())을 통해 실행됩니다.
멀티턴 캐릭터 일관성이 실제로 작동하나요?
Google Flow를 통한 자체 2단계 테스트에서, 외형 측면에서는 그렇습니다. 같은 얼굴, 재킷, 머리카락이 낮에서 밤으로 바뀌는 전체 장면 전환에서도 깔끔하게 유지되었습니다. 하지만 복잡한 동작 지시를 따르는 데는 더 어려움을 겪었고(요청한 회전 후 걷기는 거의 반영되지 않았습니다), 배경 텍스트를 정확하게 렌더링하는 데도 어려움이 있었습니다. 이 두 가지는 모두 Google이 model card에서 공개한 제한 사항과 일치합니다.