Gemini Omni 출시: Google 최초의 "임의 입력" AI 모델, 영상 생성부터 시작 (2026 런칭 심층 분석)
Draft — 한국어판 Slug:
google-gemini-omni-multimodal-ai-video-modelTarget: 영문판과 동등한 분량 Status: first draft, ready for review. Cover:https://cdn.imaginetovideo.com/blog/cover/gemini-omni-flash.png원문: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/, deepmind.google/models/gemini-omni
2026년 5월 19일, Google DeepMind는 이번 주 이전에 작성된 모든 "AI 비디오 생성기" 비교 글을 다시 써야 하게 만드는 모델을 조용히 출시했습니다. Gemini Omni ── 그리고 첫 번째 출시 변종인 Gemini Omni Flash ── 는 채팅 모델 위에 비디오 모델을 덧붙인 결과물이 아닙니다. 임의의 입력 모달리티(텍스트, 이미지, 비디오, 오디오)를 받아 출력 모달리티를 생성하는 단일 아키텍처입니다. 지금은 비디오부터 시작하며, 이미지와 오디오는 "시간이 지나면" 추가됩니다.
Google DeepMind CTO Koray Kavukcuoglu는 런칭 블로그에서 한 문장으로 정의했습니다: "Omni is our new model that can create anything from any input." (Omni는 어떤 입력에서도 무엇이든 만들 수 있는 새로운 모델입니다). 이 정의는 무게가 있습니다. 이번 주까지 생성형 AI의 주류 패러다임은 전문화였습니다 ── 비디오는 Sora, 이미지는 Imagen, 오디오는 AudioLM, 대화는 Gemini. Omni는 이 분업을 거부합니다. 하나의 모델, 모든 모달리티, 양방향.
전체 그림은 다음과 같습니다: 무엇이 사실이고, 무엇이 아직 미확인이며, 오늘 어떤 플랫폼에서 사용할 수 있고, AI 비디오 프로덕션을 하는 사람에게 무엇을 의미하는지.
Gemini Omni란 무엇인가?
Gemini Omni는 Google DeepMind가 출시한 새로운 모델 패밀리의 이름입니다. 현재 사용 가능한 변종은 Gemini Omni Flash ── Google이 Gemini 패밀리에서 지연 최적화 계층을 표시하는 명명 규칙입니다(Gemini 2.5 Flash, Gemini Nano Flash 등에서 동일한 접미사를 사용). Pro 또는 Ultra 클래스는 명명에서 암시되지만 아직 발표되지 않았습니다.
정의적인 기술 주장은 공식 태그라인에 적혀 있습니다: "a model that can create anything from any input — starting with video." 주의 깊게 읽으면 두 개의 독립된 정보가 있습니다.
첫째, "임의의 입력에서 무엇이든 만든다": Omni는 텍스트, 이미지, 비디오, 오디오를 받아들입니다(런칭 게시물에 따르면 음성 참조는 이미 지원, 다른 오디오 타입은 "곧 제공"). 멀티모달 입력은 새롭지 않습니다 ── Gemini 1.5는 2년 전에 이미 비디오와 오디오를 입력으로 받았습니다.
둘째, "비디오부터 시작": Omni는 비디오를 생성하는 능력을 네이티브로, 오늘부터 갖추고 있습니다. 이미지와 오디오 출력은 미래 기능으로 명시적으로 플래그가 붙어 있습니다("in time we will support"). 그래서 런칭 일의 비대칭성은 진짜입니다 ── 어떤 입력이든 들어가고, 비디오가 나옵니다. "anything in, anything out" 태그라인은 아키텍처적 야망을 묘사하는 것이지, 2026년 5월 22일에 실제로 할 수 있는 것을 묘사하지는 않습니다.
Kavukcuoglu의 런칭 게시물은 모델이 런칭 시점에 존재하는 플랫폼을 나열합니다:
- Gemini App ── AI Plus, AI Pro, AI Ultra 구독자 대상.
- Google Flow ── Google의 영상 제작 도구. Omni는 여기서 이전의 Veo 기반 파이프라인을 대체하거나 보강합니다(런칭 게시물은 관계를 명시적으로 밝히지 않음).
- YouTube Shorts ── Shorts 크리에이터 플로우 내에서 무료로 사용 가능.
- YouTube Create App ── 전용 단편 크리에이터 앱. 역시 무료.
- 개발자 + 엔터프라이즈 API ── 게시물에 따르면 "몇 주 내".
이것이 현재 배포 표면의 전부입니다. 런칭 시점에 Vertex AI Gemini Omni Flash 엔드포인트는 없고, Google AI Studio 토글도 없고, 제3자 플랫폼 통합도 없습니다 ── 특히 ImagineToVideo도 포함됩니다. API 출시를 면밀히 추적하고 있습니다. 이는 나중에 다시 다룹니다.
"임의 입력, 임의 출력"이 오늘 실제로 의미하는 것
Omni를 읽는 가장 깔끔한 방법은 이를 행렬로 보는 것입니다. Google의 공식 게시물에서 직접 가져온 런칭 일 상태:
| 입력 → | 텍스트 | 이미지 | 비디오 | 오디오 |
|---|---|---|---|---|
| 출력: 비디오 | ✅ 가동 중 | ✅ 가동 중 | ✅ 가동 중 (편집) | ✅ 음성 참조 가동, 기타 "곧" |
| 출력: 이미지 | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" |
| 출력: 오디오 | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" | 🕗 "시간이 지나면" |
그래서 런칭 일에 "비디오 출력" 행의 모든 셀이 가동 중이거나 부분 가동 중이며, 다른 행은 모두 약속입니다. Google이 이미지와 오디오 출력을 출시할 때까지 실무적으로 "Omni"는 "임의 입력 → 비디오"를 의미합니다. 이것도 의미 있는 주장이며, 어떤 공개 모델도 정확히 이 행렬을 출시한 적이 없습니다.
런칭 시 Google이 공개하지 않은 몇 가지 구체적인 사항도 표시해 둡니다:
컨텍스트 길이. 런칭 게시물은 입력 비디오의 최대 길이나 프롬프트의 최대 길이를 명시하지 않습니다. Veo 3는 런칭 시 약 8초 출력을 발표했고, Sora 2는 Pro 계층에서 25초까지였습니다. Omni의 최대 클립 길이와 최대 입력 길이는 공개 자료에서 TBD입니다.
벤치마크. 런칭 게시물에는 공개된 품질 벤치마크, ELO 순위, Veo·Sora·기타 특정 경쟁사와의 직접 대결 수치가 일체 없습니다. Google은 Omni가 누군가를 이겼다고 주장하지 않았습니다. 이는 기록할 만한 부재입니다 ── 역사적으로 Google은 유리한 수치가 있을 때는 런칭 당일 델타를 출시했으므로, 이번 침묵은 결정적이라기보다 시사적입니다.
생성당 가격. YouTube Shorts는 무료, Gemini App은 Gemini 2.5와 동일한 방식으로 AI Plus / Pro / Ultra 구독 계층에 의해 게이트됩니다. 초당 크레딧 비용은 아직 공개되지 않았으며, API 출시 시 함께 나옵니다.
해상도 및 프레임 레이트. 명시 없음. Veo 3는 네이티브 1080p / 일부 4K 경로, Kling 3.0은 네이티브 4K 60fps, Sora는 오프라인 전까지 1080p 전용이었습니다. Omni의 해상도 상한은 런칭 자료에 없습니다.
이것은 출시 발표이지 스펙 시트가 아닙니다. 위 수치를 알려진 미지수로 다루세요 ── 다음 몇 주 동안 Google이 API와 함께 문서를 공개하면서 채워질 것입니다.
런칭 일 시연된 다섯 가지 능력
런칭 게시물과 DeepMind 모델 페이지는 함께 다섯 개의 서로 다른 능력 카테고리를 시연합니다. 각각이 다른 프로덕션 워크플로를 시사하므로 별도로 이해할 가치가 있습니다.
1. 자연어 지시로 비디오 편집. Omni는 기존 비디오 클립을 입력으로 받아 수정할 수 있습니다 ── 객체 색 변경, 동작 교체, 조명 변경, 피사체 뒤 배경 교체. 런칭 페이지의 데모는 단일 소스 클립이 텍스트 프롬프트로부터 시각적으로 뚜렷이 다른 여러 변종으로 렌더링됩니다. 아키텍처적 의의는 별도의 인페인팅 모델, 별도의 리라이팅 모델, 별도의 배경 교체 모델이 필요 없다는 점입니다. 한 모델, 한 프롬프트, 한 렌더링.
2. 비디오 작업으로서의 물리 시뮬레이션. Omni 데모에는 레일 위 구슬의 궤적, 유체역학, 기타 물리적 상호작용을 비디오로 표현한 것이 포함됩니다. 이는 Sora 2와 Veo 3가 강하게 밀어붙인 카테고리와 같습니다 ── 측정 가능한 모델 품질 축으로서의 물리 충실도. Google은 수치 "물리 점수"를 공개하지 않았지만 데모 선택이 포지셔닝을 명확히 보여줍니다.
3. 복잡한 개념의 시각화. 런칭 페이지에서는 Omni가 추상적이거나 시각화하기 어려운 아이디어를 렌더링합니다 ── 영어 알파벳 구조, 단백질 접힘 시퀀스, 수학적 개념. 이는 영화 용도보다는 교육 용도에 가까우며 Veo나 Sora가 전면에 내세우지 않은 카테고리입니다.
4. 멀티모달 참조 융합. Omni에 스타일 참조(이미지), 모션 참조(비디오 클립), 텍스트 프롬프트를 동시에 주면 출력이 세 가지를 융합합니다. 스타일 전송과 모션 전송은 별도 모델로 수년간 존재해 왔습니다(AnimateDiff, ControlNet 등). Omni는 이를 단일 모델의 프롬프트 파라미터로 압축합니다.
5. 디지털 아바타 비디오 생성. 런칭 데모에는 아바타 스타일 출력이 포함됩니다 ── 프레임 간 일관된 정체성을 유지하는 캐릭터 비디오. 이는 Kling V3 Omni의 reference-to-video 능력과 Veo 3의 정체성 고정 피사체와 겹치지만, Google의 표현은 Omni를 둘 다보다 유연하게 그립니다: 임의의 참조, 임의의 길이, 임의의 모달리티.
이 모든 것에서 런칭 샘플은 짧고 ── 보통 몇 초 ── "프로모 비디오" 프레이밍은 프로덕션 환경에서의 실패 모드가 어떻게 보이는지 알기 어렵게 합니다. 데모 릴을 보증으로 받아들이지 마세요. Google이 프롬프트와 시드를 신중히 골랐을 때 가능한 것의 상한으로 다루세요.
지금 Omni를 사용할 수 있는 곳
네 개의 입구, 세 가지 가격 모델, 한 가지 일관된 제약("API는 몇 주 후"). 각각의 사고방식:
Gemini App (AI Plus / Pro / Ultra). 캐주얼한 탐색을 위한 가장 깊은 입구입니다. 모델을 둘러싼 완전한 대화 인터페이스 ── 텍스트, 이미지, 음성 참조, 다중 턴 정제. AI Plus는 입문 계층, AI Ultra는 프로덕션 계층. Omni가 특정 사용 사례에 무엇을 할 수 있는지 테스트한다면 여기서 테스트하세요.
Google Flow. Flow는 Google의 영상 제작 도구로, Veo가 기반 생성기로 존재했던 같은 제품입니다. Flow 내에서 Omni가 Veo를 대체하거나 보강한다는 것(런칭 게시물은 구체적이지 않음)은 Flow에 접근 권한이 있는 사람은 이미 Omni 접근 권한이 있다는 뜻입니다. Flow의 편집기 표면 ── 타임라인, 씬 제어, 샷 일관성 ── 은 Gemini App의 채팅 인터페이스보다 프로덕션 지향적입니다. 장편 또는 다중 씬 작업에는 Flow가 올바른 입구입니다.
YouTube Shorts. 무료. 이것이 서프라이즈입니다 ── YouTube 크리에이터는 Shorts 생성 플로우 내에서 업로드 시점에 Omni를 얻습니다. Google이 여기에 출시한 정확한 UX는 런칭 게시물에 완전히 문서화되어 있지 않습니다. 이전에 Dream Screen이나 Veo 기반 파이프라인으로 라우팅되던 생성 프롬프트, 리믹스 동작, text-to-Short 플로우가 앞으로 Omni에 의해 서비스될 것으로 예상됩니다. 60초 세로 콘텐츠를 만드는 크리에이터에게는 Omni를 시도하는 가장 저렴한 방법입니다 ── 지불할 것도 없고 대기 목록도 없습니다.
YouTube Create App. 무료. Google 전용 단편 모바일 제작 앱으로 YouTube 본체와 분리되어 있습니다. Omni 기능은 여기에 Shorts와 병행하여 도착합니다.
개발자 + 엔터프라이즈 API. 아직 사용 불가. 게시물에는 "몇 주 내"라고 되어 있습니다. 프로덕션 파이프라인이 프로그래밍 접근 ── 웹훅, 배치 생성, 다중 사용자 워크플로 ── 에 의존한다면 기다려야 합니다. 우리는 면밀히 추적하고 있으며, Google API 엔드포인트가 가동되는 순간 블로그 를 업데이트할 것입니다.
이 배포 구조에는 실제적인 결과가 있습니다: 다음 몇 주 동안 Omni를 규모로 평가하는 유일한 방법은 대화형 표면 ── Gemini App, Flow, YouTube ── 을 통해서입니다. 자동화 벤치마킹, Kling V3나 Veo 3.1과의 동일 프롬프트 병렬 비교, 프로덕션 통합 ── 모두 API 출시 시기에 막혀 있습니다.
가격과 접근 계층
런칭 일 가격 풍경을 Google이 현재 공개한 구독 문서와 런칭 게시물에서 정리:
| 계층 | 입구 | 가격 | Omni 접근 |
|---|---|---|---|
| YouTube Shorts | 모바일/웹 Shorts 크리에이터 | 무료 | 포함 |
| YouTube Create App | 모바일 앱 | 무료 | 포함 |
| Gemini App — AI Plus | Gemini 무료 계층 (속도 제한) | 입문 가격 지역별 | 제한적 |
| Gemini App — AI Pro | Gemini 유료 계층 | 구독, 지역별 | 완전 |
| Gemini App — AI Ultra | Gemini 최상위 계층 | 프리미엄 구독 | 완전, 우선순위 |
| Google Flow | 일부 Gemini 계층에 번들 | AI Pro / Ultra와 연동 | 완전 |
| 개발자 API | 미공개 | 생성당 TBD | "몇 주 내" |
Google은 아직 AI Plus / Pro / Ultra 어느 계층에서도 Omni 생성의 초당 크레딧 비용을 공개하지 않았습니다. Gemini App 쪽 가격 모델은 종량제가 아닌 구독 번들제이므로, 월 상한 내에서는 자유롭게 생성할 수 있습니다 ── 상한에 도달할 때까지.
무료 YouTube 표면의 경우, "무료"가 헤드라인이지만 암묵적 비용은 제약된 창작 표면입니다: YouTube Shorts는 세로 전용 60초 미만 컨테이너이며 프롬프트 UI는 프로덕션 파이프라인이 아닌 캐주얼 크리에이터를 위해 설계되었습니다. 무료는 Omni를 시도하기엔 좋지만, 브랜드 캠페인을 출시할 곳은 아닙니다.
API 가격은 Omni 위에 무언가를 구축하려는 모든 사람에게 가장 중요한 미지수입니다. Google의 이전 Gemini 모델의 개발자 측 가격은 텍스트에 대해 OpenAI와 Anthropic 대비 백만 토큰당 역사적으로 경쟁력 있었습니다. 비디오의 생성당 가격은 더 변동적이었습니다. AI Studio와 Vertex AI 페이지를 주시하세요 ── 그곳에 먼저 나타납니다.
Gemini Omni vs Veo 3 vs Sora 2 vs Kling vs Seedance — 현재 시장 지형
흥미로운 질문은 "Omni가 좋은가"가 아닙니다. Google의 데모는 좋아 보입니다. 흥미로운 질문은 런칭 순간에 Omni가 경쟁 풍경의 어디에 위치하는가입니다.
2026년 5월 22일 기준 시장 지형:
| 모델 | 네이티브 4K | 최대 fps | 네이티브 오디오 | 멀티모달 입력 | 멀티모달 출력 | API 상태 |
|---|---|---|---|---|---|---|
| Gemini Omni Flash | 미공개 | 미공개 | 음성 참조 ✅, 기타 🕗 | ✅ (텍스트, 이미지, 비디오, 오디오) | 비디오 지금, 이미지/오디오 "시간이 지나면" | "몇 주 내" |
| Google Veo 3.1 | ✅ 네이티브 | 24fps | 일부 계층에서 네이티브 오디오 | 텍스트, 이미지 | 비디오 전용 | 가동 중 (Vertex AI) |
| OpenAI Sora 2 | ❌ 1080p 전용 | — | 네이티브 | 텍스트, 이미지 | 비디오 전용 | 2026-03-24 오프라인 |
| Kling Video 3.0 / Omni | ✅ 네이티브 4K | 60fps | 네이티브 (Omni 변종) | 텍스트, 이미지, 오디오 (Omni) | 비디오 전용 | 가동 중 |
| Seedance 2.0 | ❌ 1080p 전용 | — | ❌ (무음) | 텍스트, 이미지 | 비디오 전용 | 가동 중 |
| Runway Gen-4 | ❌ 1080p 전용 | — | ❌ | 텍스트, 이미지 | 비디오 전용 | 가동 중 |
명시적이지 않은 몇 가지 결론.
Omni의 특징적 주장은 행렬 전체이지 셀별 점수가 아닙니다. 목록의 다른 모든 모델은 비디오 생성을 합니다. 단일 아키텍처로 시간이 지나면 이미지와 오디오도 생성할 것이라고 주장하는 모델은 하나도 없습니다. Google이 암시하는 일정에 따라 행렬의 나머지를 출시한다면, Omni의 셀링 포인트는 "최고의 비디오 모델"이 아니라 "한 모델, 모든 모달리티, 양방향"이 됩니다. 이는 구조적 주장이지 벤치마크 주장이 아닙니다.
비디오 출력 축에서는 Veo 3.1과 Kling V3가 직접적인 경쟁자입니다. 오늘 비디오를 생성해야 한다면, Veo와 Kling은 성숙하고 실전 검증되었습니다. Omni는 새롭고, 해상도가 문서화되지 않았으며, 대화형 표면 뒤에 잠겨 있습니다. 이번 달 프로덕션 작업에 Omni는 추적 대상이지 도구가 아닙니다.
Sora 2의 오프라인화는 방 안의 코끼리입니다. OpenAI는 2026년 3월 24일에 Sora 2를 내렸습니다. 이 은퇴로 남겨진 공백이 바로 Google이 메우려는 것입니다. 런칭 타이밍은 우연이 아닙니다.
4K-60fps 슬롯은 여전히 독점적으로 유지됩니다. Kling V3는 공개 시장에서 네이티브 3840×2160 @ 60fps를 하는 유일한 모델입니다. Omni의 해상도 상한은 발표되지 않았으므로 여기서 경쟁할지 1080p 대역에 머물지 알 수 없습니다. Google이 발언할 때까지는 Kling 4K 모드가 해상도 리더라고 가정하세요.
네이티브 오디오 출력은 부분적입니다. Omni는 런칭 시 음성 참조를 지원합니다 ── 음성 클립을 입력할 수 있다는 뜻. 완전한 오디오 생성과 비디오와의 동기화는 아직 개발 중인 것으로 보입니다. Kling V3 Omni와 Veo 3.1은 오늘 생성 파이프라인 내에서 네이티브 오디오(대사, 환경음, 음악 큐)를 출시합니다. Omni는 아직입니다.
2026년 5월 경쟁 해석: Omni는 현재 가장 야심찬 아키텍처, 가장 검증되지 않은 제품, API 활주로가 가장 길게 남아 있는 것입니다. 향후 18개월 동안의 엔터프라이즈 구매라면 Omni는 도박입니다. 이번 달 콘텐츠를 출시한다면 Veo 또는 Kling이 답입니다.
"Omni" 아키텍처가 비디오 생성에 정말로 중요한 이유
런칭 카피를 벗기면 진짜 이야기는 아키텍처 수준입니다. AI 비디오의 기본 멘탈 모델 ── 비디오 모델, 사운드 모델, 업스케일러, 립싱크 모델을 파이프라인으로 조립 ── 은 지금까지 규모로 출시된 유일한 모델입니다. 파이프라인 접근에는 알려진 약점이 있습니다: 각 단계가 품질 게이트이고, 오류가 합성되고, 단계 간 정체성 드리프트가 들어오고, 오디오-비디오 동기화는 두 모달리티가 독립적으로 생성되어 사후에 정렬되므로 어렵습니다.
진정으로 통합된 아키텍처 ── 이미지, 비디오, 텍스트, 오디오를 내부에서 함께 표현하는 단일 모델 ── 는 구조적으로 이 모든 실패 모드를 우회합니다. 정체성은 모델 간 핸드오프되지 않으므로 일관됩니다. 오디오와 비디오는 함께 디코딩되므로 동기화됩니다. 잠재 공간이 공유되므로 스타일은 프레임 간 일관됩니다. 원리적으로.
Omni가 프로덕션 환경에서 이 원리를 실현할지는 2026년 5월 22일에는 답할 수 없는 질문입니다. Google의 데모는 가능성을 시사합니다. 런칭 게시물의 "starting with video" 표현은 통합 아키텍처가 아직 모든 출력 모달리티에서 완전히 표현되지 않았음을 시사합니다 ── 단계적으로 출시되고 있습니다. 진짜 증거는 다음 두 분기에 나옵니다 ── API가 열리고, 제3자 벤치마크가 안착하고, 실패 모드가 프로덕션 작업에서 표면화되면서.
관련된 질문이 있습니다: Omni가 아키텍처적으로 통합되어 있다면, 각 모달리티에서 전문 모델을 지배할까요? 반드시 그렇지는 않습니다. 통합 모델은 너비를 깊이와 교환합니다 ── 모든 모달리티가 표현 예산을 받고, 어느 한 모달리티가 전부를 차지하지는 않습니다. Kling V3 같은 전문 모델(비디오 전용, 비디오에 무거운 훈련, 4K-60fps)은 한동안 Omni를 원시 비디오 지표에서 계속 능가할 수 있습니다. Omni의 우위는 단일 축이 아니라 모델을 떠나지 않고 할 수 있는 일의 너비에 있습니다.
프로덕션 빌더에게 추적할 가치가 있는 질문: Omni의 아키텍처적 우위가 전문가 대비 모달리티별 품질 격차를 상쇄할 수 있을까? 답은 전적으로 워크로드에 달려 있습니다. 혼합 프롬프트, 참조, 즉흥 편집으로 짧은 비디오를 만드는 크리에이터 ── Omni가 편의성에서 이깁니다. 4K-60fps로 TV 광고용 히어로 컷을 찍는 브랜드 ── Kling V3 4K가 아마도 중요한 지표에서 계속 이길 것입니다, Omni가 해상도에서 따라잡을 때까지.
개발자는 언제 API를 얻을까 (ImagineToVideo가 지켜보는 것)
런칭 게시물은 개발자 + 엔터프라이즈 API를 "몇 주 내"로 약속합니다. Google은 아직 날짜, SLA, 가격 구조, 문서 URL을 공개하지 않았습니다. 이전 Gemini 패밀리 런칭의 선례 ── 2.5 Flash, 2.5 Pro, Nano 패밀리 ── 에 기반하면 "App 액세스 가동"에서 "Vertex AI 엔드포인트 가동"까지의 일반적인 윈도우는 4~8주였습니다.
ImagineToVideo 에게 API 타이밍은 게이트 요인입니다. Gemini Omni 엔드포인트가 HTTPS로 도달 가능하고 문서화된 스키마와 속도 제한이 있을 때까지 플랫폼에 통합할 수 없습니다. 사용 가능해지면 로드맵은 분명합니다:
- Phase 1 (API 첫 주): Gemini Omni Flash를 text-to-video와 reference-to-video 플로우에 모델 옵션으로 추가. 가격은 Google 요율 + 표준 인프라 오버헤드를 1:1로 통과시킵니다.
- Phase 2: Omni 고유 능력 ── 다중 참조 융합, 클립 내 편집, 음성 참조 입력 ── 을 생성기 UI의 1급 컨트롤로 노출.
- Phase 3: 동일한 프롬프트 세트로 Kling V3, Veo 3.1, Seedance 2.0과 병렬 비교 실행, 투명성을 위해 결과를 이 블로그에 게시.
ImagineToVideo 블로그 를 구독하거나 업데이트를 팔로우하세요 ── Google API 엔드포인트가 가동되는 같은 날 통합을 출시할 것입니다. 그 전까지, 오늘 실전 검증된 모델에서 AI 비디오를 만들기 시작하고 싶다면 Seedance 2.0으로 제품 클립부터, Kling V3 Omni로 영화적 다중 샷 작업, 또는 Kling 4K 모드로 방송 등급 히어로 컷 을 시작하세요.
자주 묻는 질문
Gemini Omni가 무엇이고 일반 Gemini와 어떻게 다른가요?
Gemini Omni는 Google DeepMind의 새로운 모델 패밀리로, Gemini 텍스트/채팅 계보와는 별개입니다. 현재 출시된 변종은 Gemini Omni Flash입니다. 핵심 아키텍처 차이는 Omni가 멀티모달 입력 그리고 멀티모달 출력 ── 텍스트, 이미지, 비디오, 오디오를 양방향 ── 을 위해 처음부터 구축되었다는 점입니다. 이전 Gemini 모델은 멀티모달 입력을 받았지만 텍스트 출력에 특화되었습니다. 런칭 시 Omni는 비디오를 생성합니다. 이미지와 오디오 출력은 Google DeepMind에 의해 미래 기능으로 플래그가 붙어 있습니다.
Gemini Omni는 무료로 사용할 수 있나요?
부분적으로요. YouTube Shorts와 YouTube Create 앱 내에서 Omni를 무료로 사용할 수 있으며, 둘 다 크리에이터에게 추가 비용 없이 모델이 포함됩니다. Gemini App 내에서 Omni는 AI Plus, Pro, Ultra 구독 계층에 게이트됩니다. 독립 개발자 API는 아직 사용 불가하며, 그 가격은 엔드포인트가 열릴 때 함께 발표됩니다.
Gemini Omni는 언제 ImagineToVideo에서 사용 가능해지나요?
개발자 API 출시를 면밀히 추적하고 있습니다. Google은 API에 대해 "몇 주 내"로 약속했습니다. 가동되면 통합 일정은 일 단위입니다 ── 플랫폼에는 이미 새 비디오 모델을 추가하는 인프라가 있으며, 엔드포인트가 열린 직후 Omni가 text-to-video와 reference-to-video 플로우에 사용 가능해집니다. 통합 발표를 위해 블로그를 구독 하세요.
Gemini Omni는 Veo 3와 어떻게 다른가요?
Veo는 Google의 이전 세대 비디오 모델이며 Omni 이전에는 Google Flow의 기반 엔진이기도 했습니다. Veo는 텍스트와 이미지 입력을 받아 비디오를 생성하며 일부 계층에서 네이티브 오디오를 포함합니다. Omni의 표명된 야망은 더 넓습니다: 임의 모달리티 입력, 임의 모달리티 출력. 오늘 실무적으로 둘 다 비디오를 생성하며 해상도, 프레임 레이트, 오디오 출력의 구체적인 차이는 아직 확립 중입니다. Google Flow 내에서는 Omni가 Veo의 역할을 대체하거나 보강하는 것으로 보입니다 ── 런칭 게시물은 경계선을 명확히 그리지 않았습니다.
Gemini Omni가 Sora를 대체할까요?
Sora 2는 2026년 3월 24일에 오프라인이 되었으므로 직접 비교가 아닙니다. Sora 2 은퇴 전의 프로덕션 워크플로 일부는 Kling V3와 Seedance 2.0으로 마이그레이션되었습니다. Omni는 이제 그 워크플로의 세 번째 마이그레이션 대상입니다. Omni가 사실상의 대체가 될지는 API 가격과 품질이 기존 대안 대비 어디에 안착하느냐에 달려 있습니다.
Gemini Omni는 한국어 프롬프트를 지원하나요?
Gemini의 텍스트 인코더는 여러 모델 세대에 걸쳐 한국어(및 수십 개의 다른 언어)를 지원해 왔습니다. 런칭 게시물은 Omni의 프롬프트 인터페이스가 구체적으로 어떤 언어를 지원하는지 명시적으로 열거하지 않지만, 아키텍처 계보는 광범위한 다국어 커버리지를 시사합니다. 구체적인 언어는 Gemini App에서 테스트하세요 ── 가장 빠른 확인 방법입니다.
Gemini Omni를 상업적으로 사용할 수 있나요?
Omni 출력의 라이선스 조건은 사용 중인 표면의 표준 조건을 따릅니다. YouTube 출력은 YouTube 상업 조건의 적용을 받습니다. Gemini App 출력은 Google AI Plus / Pro / Ultra 조건의 적용을 받습니다 ── 일반적으로 상업적 사용을 허용하며 모델 생성 콘텐츠에 대한 일반적 주의 사항이 있습니다. 엔터프라이즈 또는 대규모 상업 프로덕션의 경우 프로덕션 배포를 위해 조건이 명시적으로 작성된 API + 엔터프라이즈 계층을 기다리세요.
Gemini Omni가 Gemini 3와 같은가요?
아니요. Gemini Omni는 자체 명명 계열(Flash 출시, Pro/Ultra 암시되나 미발표)을 가진 자체 모델 패밀리로, 메인 Gemini 채팅 계보와 병행합니다. Google은 Omni의 훈련이 가상의 Gemini 3와 어떻게 관계되는지 명시하지 않았으며 런칭 자료는 둘을 별도 제품 라인으로 다룹니다.
결론
Gemini Omni는 올해 AI 비디오 분야에서 누구든 한 가장 야심찬 아키텍처적 도박입니다. 모든 모달리티를 양방향으로 하는 단일 모델이라는 약속은 2024년과 2025년을 정의한 파이프라인 접근과 구조적으로 다릅니다. Google이 암시하는 일정에 따라 행렬의 나머지 부분 ── 이미지 출력, 오디오 출력, 더 긴 컨텍스트 ── 을 출시한다면 "어떤 AI 비디오 도구를 사용할까"라는 멘탈 모델 전체가 다시 쓰입니다.
약속은 2026년 5월 19일의 뉴스입니다. 증거는 "몇 주 내"의 API 출시, 그리고 그 후 몇 개월의 제3자 벤치마킹입니다. 오늘 Omni를 추적 대상으로 다루고 도구로 다루지 마세요. Kling V3, Veo 3.1, Seedance 2.0은 이번 달 프로덕션 작업의 정답으로 남아 있습니다 ── 문서화되고, 가격이 명확하고, 통합되고, 규모로 가동 중입니다.
이번 주 콘텐츠를 출시하는 모든 사람에게: 작동하는 것을 계속 사용하세요. 향후 18개월을 위해 구축 중인 모든 사람에게: API 대기 목록을 구독하고, AI Studio와 Vertex AI 문서를 주시하고, 엔드포인트가 열리는 순간 병렬 벤치마크를 실행할 수 있는 분기를 계획하세요.
Omni를 기다리는 동안 지금 실전 검증된 모델에서 AI 비디오를 만들기 시작하고 싶다면:
→ Seedance 2.0으로 빠른 제품 클립과 참조 클립을 시도하기 (5초당 약 1달러, 720p)
→ Kling V3 Omni로 네이티브 오디오 포함 영화적 다중 샷 작업을 시도하기 (다중 샷 시퀀싱, 립싱크)
→ Kling 4K 모드로 방송 등급 히어로 컷을 시도하기 (네이티브 3840×2160 @ 60fps)
Google의 API 엔드포인트가 가동되는 같은 날 ImagineToVideo에서 Gemini Omni 통합을 출시할 것입니다. 그 전까지 ── 이 블로그를 주시하고 계속 콘텐츠를 만드세요.



