Gemini Omni يصل: أول نموذج ذكاء اصطناعي "أي مدخل" من Google يبدأ بتوليد الفيديو (تحليل إطلاق 2026)
Draft — النسخة العربية Slug:
google-gemini-omni-multimodal-ai-video-modelTarget: مكافئ للنسخة الإنجليزية Status: first draft, ready for review. Cover:https://cdn.imaginetovideo.com/blog/cover/gemini-omni-flash.pngالمصادر الأصلية: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/، deepmind.google/models/gemini-omni
في 19 مايو 2026، فعّل Google DeepMind بهدوء نموذجاً يعيد كتابة كل مقالة مقارنة "مولّد فيديو بالذكاء الاصطناعي" نُشرت قبل هذا الأسبوع. Gemini Omni ── وأول متغيراته المُطلقة، Gemini Omni Flash ── ليس نموذج فيديو مُلصقاً على نموذج دردشة. إنه بنية واحدة تقبل أي صيغة إدخال (نص، صورة، فيديو، صوت) وتولّد صيغة إخراج، بدءاً بالفيديو اليوم وإضافة الصورة والصوت "مع الوقت".
صاغها Koray Kavukcuoglu، المدير التقني في Google DeepMind، في جملة واحدة على مدونة الإطلاق: "Omni is our new model that can create anything from any input" ("Omni هو نموذجنا الجديد الذي يمكنه إنشاء أي شيء من أي مدخل"). هذا التأطير مهم. حتى هذا الأسبوع، كان النموذج السائد في الذكاء الاصطناعي التوليدي هو التخصص ── Sora للفيديو، Imagen للصور، AudioLM للصوت، Gemini للدردشة. Omni يرفض هذا التقسيم. نموذج واحد، كل الصيغ، في الاتجاهين.
إليك الصورة الكاملة: ما هو حقيقي، وما لم يُؤكَّد بعد، وأي منصات تملكه اليوم، وماذا يعني إن كنت تنشر فيديو ذكاء اصطناعي في الإنتاج.
ما هو Gemini Omni؟
Gemini Omni هو اسم عائلة نماذج جديدة من Google DeepMind. المتغير المتاح حالياً هو Gemini Omni Flash ── اصطلاح Google لتسمية المستوى المُحسَّن للكمون داخل عائلة Gemini (نفس اللاحقة التي رأيتها في Gemini 2.5 Flash، Gemini Nano Flash، إلخ). مستوى Pro أو Ultra مُلمَّح إليه من التسمية لكنه لم يُعلَن.
الادعاء التقني التعريفي موجود في الشعار الرسمي: "a model that can create anything from any input — starting with video." اقرأه بعناية. هناك جزءان مستقلان.
أولاً، "أي شيء من أي مدخل": Omni يقبل النص والصور والفيديو والصوت (المراجع الصوتية مدعومة بالفعل، وأنواع الصوت الأخرى "قريباً"، وفقاً لمنشور الإطلاق). المدخل متعدد الصيغ ليس جديداً ── كان Gemini 1.5 يقبل الفيديو والصوت كإدخال منذ عامين.
ثانياً، "بدءاً بالفيديو": Omni يولّد الفيديو بشكل أصلي، اليوم. مخرجات الصورة والصوت مُعلَّمة صراحةً كقدرات مستقبلية ("in time we will support"). فعدم التماثل عند الإطلاق حقيقي ── أي مدخل يدخل، فيديو يخرج. شعار "anything in, anything out" يصف الطموح المعماري، وليس ما يمكنك فعله في 22 مايو 2026.
يُدرج منشور إطلاق Kavukcuoglu المنصات التي يعيش عليها النموذج عند الإطلاق:
- Gemini App ── متاح لمشتركي AI Plus وAI Pro وAI Ultra.
- Google Flow ── أداة Google لصناعة الأفلام، حيث يحلّ Omni محلّ خط الأنابيب السابق المعتمد على Veo أو يعزّزه (لا يحدّد منشور الإطلاق العلاقة صراحةً).
- YouTube Shorts ── مجاناً داخل تدفق إنشاء Shorts.
- YouTube Create App ── مجاناً، في تطبيق إنشاء المحتوى القصير المخصص.
- API للمطورين + المؤسسات ── "في الأسابيع المقبلة"، وفقاً للمنشور.
هذا هو إجمالي سطح التوزيع الحالي. لا يوجد نقطة نهاية Gemini Omni Flash على Vertex AI عند الإطلاق، ولا مفتاح في Google AI Studio، ولا أي تكامل لمنصات أطراف ثالثة ── بما في ذلك، تحديداً، ImagineToVideo، حيث نتتبع إصدار API عن كثب. سنعود إلى ذلك.
ماذا يعني "أي مدخل، أي مخرج" فعلياً اليوم
أنظف طريقة لقراءة Omni هي كمصفوفة. هذه الحالة في يوم الإطلاق، مأخوذة مباشرة من منشورات Google الرسمية:
| الإدخال → | نص | صورة | فيديو | صوت |
|---|---|---|---|---|
| الإخراج: فيديو | ✅ نشط | ✅ نشط | ✅ نشط (تحرير) | ✅ مرجع صوتي نشط، الباقي "قريباً" |
| الإخراج: صورة | 🕗 "مع الوقت" | 🕗 "مع الوقت" | 🕗 "مع الوقت" | 🕗 "مع الوقت" |
| الإخراج: صوت | 🕗 "مع الوقت" | 🕗 "مع الوقت" | 🕗 "مع الوقت" | 🕗 "مع الوقت" |
ففي يوم الإطلاق، كل خلية في صف "إخراج الفيديو" نشطة أو نشطة جزئياً. كل صف آخر وعد. حتى يطلق Google إخراج الصورة والصوت، يعني "Omni" عملياً "أي مدخل → فيديو"، وهو ادعاء ذو مغزى ── لم يطلق أي نموذج عام هذه المصفوفة الدقيقة من قبل.
بعض الأشياء المحدّدة التي لم يكشف عنها Google عند الإطلاق وتستحق الإشارة:
طول السياق. لا يُصرّح منشور الإطلاق بأقصى طول لفيديو الإدخال أو أقصى طول للموجِّه (prompt). أعلن Veo 3 عند إطلاقه عن مخرجات بحوالي 8 ثوانٍ؛ ووصل Sora 2 إلى 25 ثانية في مستوى Pro. أقصى طول مقطع لـ Omni وأقصى طول إدخال هما TBD في المواد العامة.
الـ Benchmarks. لا توجد مقاييس جودة منشورة، ولا تصنيف ELO، ولا أرقام مقارنة مباشرة مع Veo أو Sora أو أي منافس محدد في منشور الإطلاق. لم يدّعِ Google أن Omni هزم أي شخص بعينه. هذا غياب جدير بالملاحظة ── تاريخياً، تصدر Google deltas الـ benchmark يوم الإطلاق عندما يكون لديها أرقام مواتية، لذا فالصمت إيحائي بدلاً من حاسم.
السعر لكل توليد. YouTube Shorts مجاني؛ Gemini App مُغلَق خلف مستويات اشتراك AI Plus / Pro / Ultra، بنفس الطريقة التي كان عليها Gemini 2.5. لم تُنشَر بعد تكلفة رصيد لكل ثانية. سيظهر السعر لكل توليد عندما يفتح API.
الدقة ومعدّل الإطارات. لم يُذكَر. يطلق Veo 3 بدقة 1080p أصلية / مسارات 4K محددة؛ ويطلق Kling 3.0 بدقة 4K أصلية بمعدل 60fps؛ وكان Sora بدقة 1080p فقط قبل خروجه من الخدمة. سقف دقة Omni ليس في مواد الإطلاق.
هذا إعلان إطلاق، وليس ورقة مواصفات. تعامل مع الأرقام أعلاه كمجاهيل معروفة ── ستُملَأ خلال الأسابيع القليلة القادمة بينما تُطلق Google التوثيق جنباً إلى جنب مع API.
القدرات الخمس المعروضة
يعرض منشور الإطلاق وصفحة نموذج DeepMind معاً خمس فئات قدرات متميزة. كل واحدة تستحق الفهم بشكل منفصل لأنها تتضمن سير عمل إنتاج مختلف.
1. تحرير الفيديو بتعليمات اللغة الطبيعية. يمكن لـ Omni أخذ مقطع فيديو موجود كمدخل وتعديله ── تغيير لون كائن، استبدال إجراء، تغيير الإضاءة، تغيير البيئة خلف موضوع. تعرض ديمو الإطلاق مقطع مصدر واحد مُقدَّم في عدة متغيرات متمايزة بصرياً من موجِّهات نصية. الأهمية المعمارية هي أنك لا تحتاج إلى نموذج inpainting منفصل، ونموذج relighting منفصل، ونموذج استبدال خلفية منفصل. نموذج واحد، موجِّه واحد، إنتاج واحد.
2. محاكاة الفيزياء كمهمة فيديو. تشمل ديموهات Omni مسارات الكرات على القضبان، وديناميكا السوائل، وتفاعلات فيزيائية أخرى مُقدَّمة كفيديوهات. هذه نفس الفئة التي دفعها Sora 2 وVeo 3 بقوة ── الإخلاص الفيزيائي كمحور قابل للقياس لجودة النموذج. لم تنشر Google "درجة فيزياء" رقمية ولكن اختيار الديمو يوضح الموقف.
3. تصور المفاهيم المعقدة. تعرض صفحة الإطلاق Omni وهو يُقدّم أفكاراً مجردة أو يصعب تصورها ── بنية الأبجدية الإنجليزية، تسلسلات طي البروتين، مفاهيم رياضية. هذا أقرب إلى حالة استخدام تعليمية من سينمائية، وهو فئة لم يضعها Veo وSora في المقدمة.
4. دمج المراجع متعدد الصيغ. يمكنك تغذية Omni بمرجع نمط (صورة)، ومرجع حركة (مقطع فيديو)، وموجِّه نصي، وسيمزج الإخراج الثلاثة. وُجد نقل النمط ونقل الحركة كنماذج منفصلة لسنوات (فكر: AnimateDiff، ControlNet)؛ يطوي Omni هذه إلى معاملات موجِّه على نموذج واحد.
5. توليد فيديو الأفاتار الرقمي. تشمل ديموهات الإطلاق مخرجات على نمط الأفاتار ── فيديوهات شخصيات تحافظ على هوية متسقة عبر الإطارات. يتداخل هذا مع قدرة Kling V3 Omni في reference-to-video ومواضيع Veo 3 ذات الهوية المقفلة، لكن صياغة Google تقدّم Omni كأكثر مرونة من كليهما: أي مرجع، أي مدة، أي صيغة.
لكل واحدة من هذه، أمثلة الإطلاق قصيرة ── عادة بضع ثوانٍ ── وإطار "فيديو ترويجي" يجعل من الصعب معرفة كيف تبدو أنماط الفشل في الإنتاج. لا تأخذ بكرة الديمو كضمان. تعامل معها كحد أعلى لما هو ممكن عندما تنسّق Google الموجِّه والـ seed.
أين يمكنك استخدام Omni الآن
أربع أسطح، ثلاثة نماذج تسعير، تحفظ متسق ("API في الأسابيع المقبلة"). إليك كيفية التفكير في كل واحدة:
Gemini App (AI Plus / Pro / Ultra). هذا أعمق سطح للاستكشاف العادي. تحصل على الواجهة المحادَثية الكاملة ── نص، صور، مراجع صوتية، صقل متعدد الأدوار ── ملتفّة حول النموذج. AI Plus هو مستوى الدخول؛ AI Ultra مستوى الإنتاج. إن كنت تختبر ما يمكن لـ Omni فعله لحالة استخدامك المحددة، فهذا هو المكان.
Google Flow. Flow هو أداة Google لصناعة الأفلام ── نفس المنتج الذي كان فيه Veo مولّداً أساسياً. أن يحلّ Omni محلّ Veo داخل Flow (أو يعزّزه؛ منشور الإطلاق ليس محدّداً) يعني أن أي شخص لديه وصول إلى Flow لديه بالفعل وصول إلى Omni. سطح محرّر Flow ── جدول زمني، تحكم بالمشاهد، اتساق اللقطات ── أكثر توجهاً للإنتاج من واجهة الدردشة لـ Gemini App. للعمل طويل الشكل أو متعدد المشاهد، Flow هو نقطة الدخول الصحيحة.
YouTube Shorts. مجاناً. هذه هي المفاجأة ── يحصل منشئو YouTube على Omni عند نقطة الرفع، داخل تدفق إنشاء Shorts. تجربة المستخدم الدقيقة التي طرحتها Google هنا ليست موثّقة بالكامل في منشور الإطلاق؛ توقع أن تكون موجِّهات التوليد، وإجراءات الـ remix، وتدفقات text-to-Short التي كانت سابقاً تمر عبر Dream Screen أو خط أنابيب معتمد على Veo، مخدومة بواسطة Omni من الآن فصاعداً. للمنشئين الذين يصنعون محتوى رأسي مدته 60 ثانية، هذه أرخص طريقة لتجربة Omni ── لا شيء تدفعه ولا قائمة انتظار.
YouTube Create App. مجاناً. تطبيق Google المخصّص للجوال لإنشاء المحتوى القصير، منفصل عن YouTube الرئيسي. تهبط ميزات Omni هنا بالتوازي مع Shorts.
API للمطورين + المؤسسات. غير متاح بعد. يقول المنشور "في الأسابيع المقبلة". إن كانت خط أنابيب الإنتاج لديك يعتمد على الوصول البرمجي ── webhooks، التوليد بالدفعات، سير العمل متعدد المستخدمين ── فأنت تنتظر. نحن نتتبع هذا عن كثب وسنحدّث مدونتنا في اللحظة التي تصبح فيها نقطة النهاية حية.
نتيجة عملية لهذا التوزيع: للأسابيع القليلة القادمة، الطريقة الوحيدة لتقييم Omni على نطاق واسع هي عبر الأسطح التفاعلية ── Gemini App أو Flow أو YouTube. الـ benchmarking المؤتمت، المقارنات جنباً إلى جنب مع Kling V3 أو Veo 3.1 على موجِّهات متطابقة، والتكامل في الإنتاج ── جميعها معطّلة بسبب إصدار API.
التسعير ومستويات الوصول
إليك مشهد التسعير في يوم الإطلاق، مأخوذ من توثيق الاشتراك المنشور حالياً من Google ومن منشور الإطلاق ذاته:
| المستوى | السطح | التكلفة | الوصول إلى Omni |
|---|---|---|---|
| YouTube Shorts | منشئ Shorts للجوال/الويب | مجاناً | مُضمَّن |
| YouTube Create App | تطبيق الجوال | مجاناً | مُضمَّن |
| Gemini App — AI Plus | المستوى المجاني لـ Gemini (محدود السرعة) | سعر الدخول يختلف حسب المنطقة | محدود |
| Gemini App — AI Pro | المستوى المدفوع لـ Gemini | اشتراك، يختلف حسب المنطقة | كامل |
| Gemini App — AI Ultra | أعلى مستوى لـ Gemini | اشتراك مميّز | كامل، أولوية |
| Google Flow | مرفق مع مستويات Gemini مختارة | مربوط بـ AI Pro / Ultra | كامل |
| API للمطورين | لم يُفتح بعد | TBD لكل توليد | "الأسابيع المقبلة" |
لم تنشر Google تكلفة رصيد لكل ثانية لتوليدات Omni في أي من مستويات AI Plus / Pro / Ultra. نموذج التسعير في جهة Gemini App مُجمَّع مع الاشتراك، وليس مُقاساً ── ففي حدود السقف الشهري لمستواك، تولّد بحرية حتى تصل إلى السقف.
بالنسبة لأسطح YouTube المجانية، "مجاناً" هو العنوان لكن التكلفة الضمنية هي السطح الإبداعي المُقيَّد: YouTube Shorts حاوية رأسية فقط، أقل من 60 ثانية، وواجهة موجِّه مبنية للمنشئين العاديين بدلاً من خطوط أنابيب الإنتاج. مجاناً رائع لتجربة Omni؛ ليس المكان الذي ستطلق فيه حملة علامة تجارية.
سعر API هو أهم مجهول لأي شخص يبني على Omni. أسعار Google الموجهة للمطورين على نماذج Gemini السابقة كانت تاريخياً تنافسية مقابل OpenAI وAnthropic لكل مليون رمز للنص؛ أسعار التوليد للفيديو كانت أكثر تقلباً. راقب صفحات AI Studio وVertex AI ── هناك ستظهر أولاً.
Gemini Omni مقابل Veo 3 مقابل Sora 2 مقابل Kling مقابل Seedance ── أين يقف الميدان
السؤال الشيّق ليس "هل Omni جيد". ديموهات Google تبدو جيدة. السؤال الشيّق هو أين يقع Omni في المشهد التنافسي في لحظة الإطلاق.
إليك الميدان في 22 مايو 2026:
| النموذج | 4K أصلي | أقصى fps | صوت أصلي | إدخال متعدد الصيغ | إخراج متعدد الصيغ | حالة API |
|---|---|---|---|---|---|---|
| Gemini Omni Flash | غير مكشوف | غير مكشوف | مرجع صوتي ✅، الباقي 🕗 | ✅ (نص، صورة، فيديو، صوت) | فيديو الآن، صورة/صوت "مع الوقت" | "الأسابيع المقبلة" |
| Google Veo 3.1 | ✅ أصلي | 24fps | صوت أصلي في بعض المستويات | نص، صورة | فيديو فقط | نشط (Vertex AI) |
| OpenAI Sora 2 | ❌ 1080p فقط | — | أصلي | نص، صورة | فيديو فقط | غير متصل منذ 2026-03-24 |
| Kling Video 3.0 / Omni | ✅ 4K أصلي | 60fps | أصلي (متغير Omni) | نص، صورة، صوت (Omni) | فيديو فقط | نشط |
| Seedance 2.0 | ❌ 1080p فقط | — | ❌ (صامت) | نص، صورة | فيديو فقط | نشط |
| Runway Gen-4 | ❌ 1080p فقط | — | ❌ | نص، صورة | فيديو فقط | نشط |
عدة استنتاجات غير واضحة.
الادعاء المميّز لـ Omni هو المصفوفة، وليس درجات الخلايا. كل نموذج آخر في هذه القائمة يقوم بتوليد الفيديو. لا أحد يدّعي أنه بنية واحدة ستولّد، مع الوقت، الصورة والصوت أيضاً. إن أطلقت Google بقية المصفوفة على الجدول الزمني المُلمَّح إليه، فإن نقطة بيع Omni ليست "أفضل نموذج فيديو" ── إنها "نموذج واحد، كل الصيغ، في الاتجاهين". هذا ادعاء بنيوي، وليس ادعاء benchmark.
على محور إخراج الفيديو، Veo 3.1 وKling V3 هما المنافسان المباشران. اليوم، إن احتجت لتوليد فيديو، فإن Veo وKling ناضجان ومُجرَّبان في الميدان. Omni جديد، غير موثّق على الدقة، ومُغلق خلف أسطح تفاعلية. لعمل الإنتاج هذا الشهر، Omni متعقّب، وليس أداة.
كون Sora 2 غير متصل هو الفيل في الغرفة. سحبت OpenAI سحبت Sora 2 في 24 مارس 2026. الفراغ الذي خلّفه ذلك التقاعد هو ما تملؤه Google. توقيت الإطلاق ليس صدفة.
خانة 4K-60fps لا تزال محتفظ بها بشكل فريد. Kling V3 هو النموذج الوحيد في السوق العام اليوم الذي يقوم بـ 3840×2160 أصلي بمعدل 60fps. سقف دقة Omni لم يُعلَن، فلا نعرف ما إن كان يتنافس هنا أو يجلس في نطاق 1080p. حتى تتحدث Google، افترض أن وضع Kling 4K هو رائد الدقة.
إخراج الصوت الأصلي جزئي. المراجع الصوتية مدعومة في Omni عند الإطلاق ── أي يمكنك تغذية مقطع صوتي. توليد الصوت الكامل بجانب الفيديو يبدو أنه لا يزال قيد التطوير. Kling V3 Omni وVeo 3.1 يطلقان صوتاً أصلياً (حوار، أجواء، إشارات موسيقية) في خط أنابيب التوليد الخاص بهما اليوم. Omni بعدُ لا.
قراءة تنافسية لمايو 2026: Omni هو البنية الأكثر طموحاً في الميدان، المنتج الأقل اختباراً، والذي لديه أطول مدرج API لم يُطلق بعد. إن كنت مؤسسة تشتري لـ 18 شهراً قادمة، فإن Omni هو الرهان. إن كنت تنشر محتوى هذا الشهر، فإن Veo أو Kling هو الإجابة.
لماذا بنية "Omni" مهمة فعلاً لتوليد الفيديو
اخلع نسخة الإطلاق وستكون القصة الحقيقية معمارية. النموذج الذهني الافتراضي للفيديو بالذكاء الاصطناعي ── تجميع نموذج فيديو ونموذج صوت وupscaler ونموذج lip-sync في خط أنابيب ── هو النموذج الوحيد الذي شحنه أي شخص على نطاق واسع حتى الآن. لنهج خط الأنابيب نقاط ضعف معروفة: كل مرحلة بوابة جودة، الأخطاء تتراكم، انحراف الهوية يتسلل عبر المراحل، ومزامنة الصوت والفيديو صعبة لأن الصيغتين تُولَّدان بشكل مستقل وتُحاذيان في مرحلة ما بعد الإنتاج.
بنية موحَّدة حقاً ── نموذج يمثّل داخلياً الصورة والفيديو والنص والصوت معاً ── تتجنّب كل أنماط الفشل تلك بحكم التصميم. الهوية تبقى متسقة لأنها لا تُسلَّم بين النماذج. الصوت والفيديو يبقيان متزامنين لأنهما يُفكَّكان معاً. النمط يبقى متماسكاً عبر الإطارات لأن الفضاء الكامن مشترك. من حيث المبدأ.
ما إذا كان Omni يحقق المبدأ في الإنتاج هو السؤال الذي لا يمكن لـ 22 مايو 2026 الإجابة عنه. ديموهات Google تشير إلى أنه يفعل. ادعاء "starting with video" في منشور الإطلاق يشير إلى أن البنية الموحَّدة لم تُعبَّر عنها بالكامل بعد عبر كل صيغ الإخراج ── إنهم يطلقونها على مراحل. الدليل الحقيقي سيأتي خلال الربعين القادمين بينما يفتح API، وتهبط مقاييس الأطراف الثالثة، وتظهر أنماط الفشل في عمل الإنتاج.
سؤال ذو صلة: إن كان Omni موحَّداً معمارياً، فهل يهيمن على النماذج المتخصصة في كل صيغة؟ ليس بالضرورة. النموذج الموحَّد يقايض العرض بالعمق ── كل صيغة تحصل على ميزانية تمثيل، ولا صيغة واحدة تحصل على الكل. النماذج المتخصصة مثل Kling V3 (فيديو فقط، تدريب ثقيل على الفيديو، 4K-60fps) قد تستمر في التفوق على Omni على مقاييس الفيديو الخام لبعض الوقت. ميزة Omni ليست على أي محور واحد؛ إنها على عرض ما يمكنك فعله دون مغادرة النموذج.
لبناة الإنتاج، هذا هو السؤال الجدير بالتعقب: هل ميزة Omni المعمارية تفوق فجوة الجودة لكل صيغة نسبة إلى المتخصصين؟ الإجابة تعتمد كلياً على عبء العمل. للمنشئ الذي يصنع فيديوهات قصيرة بموجِّهات مختلطة ومراجع وتعديلات مخصّصة ── Omni يفوز في الراحة. لحملة علامة تجارية تصوّر لقطات هيرو بـ 4K-60fps لإعلان تلفزيوني ── Kling V3 4K يحتمل أن يستمر في الفوز على المقاييس المهمة، حتى يلحق Omni بالدقة.
متى سيحصل المطورون على API (وما الذي يراقبه ImagineToVideo)
يلتزم منشور الإطلاق بـ API للمطورين + المؤسسات "في الأسابيع المقبلة". لم تنشر Google تاريخاً ولا SLA ولا هيكل تسعير ولا رابط توثيق. بناءً على السوابق التي وضعتها إطلاقات عائلة Gemini السابقة ── 2.5 Flash، 2.5 Pro، عائلة Nano ── كانت النافذة النموذجية بين "وصول التطبيق نشط" و"نقطة نهاية Vertex AI نشطة" من أربعة إلى ثمانية أسابيع.
بالنسبة لنا في ImagineToVideo، توقيت API هو العامل الحاسم. حتى تكون نقطة نهاية Gemini Omni قابلة للوصول عبر HTTPS بمخطط موثّق وحد سرعة، لا يمكننا دمجها في المنصة. بمجرد توفرها، خارطة طريقنا واضحة:
- Phase 1 (الأسبوع 1 من API): إضافة Gemini Omni Flash كخيار نموذج في تدفقات text-to-video وreference-to-video. سيتم تمرير السعر واحداً لواحد مقابل سعر Google زائد العبء الإضافي للبنية التحتية القياسية لدينا.
- Phase 2: إبراز قدرات Omni الخاصة ── دمج مراجع متعددة، تحرير داخل المقطع، إدخال مرجع صوتي ── كعناصر تحكم درجة أولى في واجهة المُولِّد.
- Phase 3: تشغيلات مقارنة جنباً إلى جنب مقابل Kling V3 وVeo 3.1 وSeedance 2.0 على نفس مجموعات الموجِّهات، مع نتائج منشورة على هذه المدونة من أجل الشفافية.
اشترك في مدونة ImagineToVideo أو تابع تحديثاتنا ── سننشر التكامل في نفس اليوم الذي تفتح فيه نقطة نهاية API من Google. في غضون ذلك، إن أردت البدء في إنتاج فيديو ذكاء اصطناعي على نموذج مُجرَّب في الميدان اليوم، ابدأ بـ Seedance 2.0 لمقاطع المنتجات، أو Kling V3 Omni للعمل السينمائي متعدد اللقطات، أو وضع Kling 4K للقطات هيرو بجودة البث.
الأسئلة الشائعة
ما هو Gemini Omni وما الفرق بينه وبين Gemini العادي؟
Gemini Omni عائلة نماذج جديدة من Google DeepMind، منفصلة عن سلالة Gemini للنص/الدردشة. المتغير المُطلق حالياً هو Gemini Omni Flash. الفارق المعماري الأساسي هو أن Omni مبني من الصفر لإدخال متعدد الصيغ وإخراج متعدد الصيغ ── نص وصورة وفيديو وصوت في الاتجاهين ── بينما كانت نماذج Gemini السابقة تقبل إدخالاً متعدد الصيغ لكنها متخصصة في إخراج النص. عند الإطلاق، يولّد Omni فيديو؛ إخراج الصورة والصوت مُعلَّم كقدرات مستقبلية من قِبل Google DeepMind.
هل Gemini Omni مجاني الاستخدام؟
جزئياً. يمكنك استخدام Omni مجاناً داخل YouTube Shorts وتطبيق YouTube Create، وكلاهما يتضمّن النموذج دون تكلفة إضافية للمنشئين. داخل Gemini App، Omni مُغلَق خلف مستويات اشتراك AI Plus أو Pro أو Ultra. API المطورين المستقلة غير متاحة بعد؛ سيُعلَن تسعيرها عند فتح نقطة النهاية.
متى سيكون Gemini Omni متاحاً على ImagineToVideo؟
نحن نتتبع إصدار API للمطورين عن كثب. التزمت Google بـ "الأسابيع المقبلة" لـ API. بمجرد أن يصبح حياً، جدولنا الزمني للتكامل من رتبة الأيام ── لدينا بالفعل البنية التحتية للمنصة لإضافة نماذج فيديو جديدة، وسيكون Omni متاحاً في تدفقات text-to-video وreference-to-video بعد فتح نقطة النهاية بقليل. اشترك في المدونة لإعلان التكامل.
كيف يختلف Gemini Omni عن Veo 3؟
Veo هو الجيل السابق من نماذج فيديو Google والمحرّك الأساسي في Google Flow قبل Omni. يقبل Veo مدخلات نصية وصورية ويولّد الفيديو، بما في ذلك صوت أصلي في بعض المستويات. طموح Omni المُعلَن أوسع: إدخال من أي صيغة، إخراج إلى أي صيغة. عملياً اليوم، كلاهما يولّد فيديو، والاختلافات في الدقة ومعدّل الإطارات وإخراج الصوت لا تزال تُحدَّد. داخل Google Flow تحديداً، يبدو أن Omni يحلّ محلّ دور Veo أو يعزّزه ── منشور الإطلاق لا يرسم الخط الدقيق بينهما.
هل سيستبدل Gemini Omni Sora؟
خرج Sora 2 من الخدمة في 24 مارس 2026، لذا فالمقارنة ليست مباشرة. هاجرت بعض سير عمل الإنتاج التي كانت تستخدم Sora 2 قبل تقاعده إلى Kling V3 وSeedance 2.0؛ Omni الآن هدف هجرة ثالث لتلك السير. ما إذا كان Omni سيصبح البديل بحكم الواقع يعتمد على كيفية هبوط أسعار وجودة API نسبة إلى البدائل القائمة.
هل يدعم Gemini Omni موجِّهات بالعربية؟
دعم مُشفِّر النص في Gemini العربية (وعشرات اللغات الأخرى) لعدة أجيال من النماذج. لا يُعدّد منشور الإطلاق صراحة اللغات التي تدعمها واجهة الموجِّه لـ Omni تحديداً، لكن السلالة المعمارية تشير إلى تغطية متعددة اللغات واسعة. اختبر في Gemini App بلغتك المحددة ── هذه أسرع طريقة للتأكد.
هل يمكنني استخدام Gemini Omni للعمل التجاري؟
تتبع شروط الترخيص لمخرجات Omni الشروط القياسية للسطح الذي تستخدمه. تخضع مخرجات YouTube لشروط YouTube التجارية. تخضع مخرجات Gemini App لشروط Google AI Plus / Pro / Ultra ── التي تسمح عموماً بالاستخدام التجاري، مع التحذيرات المعتادة بشأن المحتوى المُولَّد بالنموذج. للإنتاج التجاري للمؤسسات أو ذي الحجم الكبير، انتظر API + المستوى المؤسسي حيث تُكتَب الشروط صراحةً للنشر في الإنتاج.
هل Gemini Omni هو نفسه Gemini 3؟
لا. Gemini Omni عائلة نماذج خاصة به بخط تسميته الخاص (Flash، مع تلميح Pro/Ultra دون إعلان)، موازية لسلالة دردشة Gemini الرئيسية. لم تذكر Google كيف يرتبط تدريب Omni بـ Gemini 3 افتراضي، وتعامل مواد الإطلاق الاثنين كخطّي منتجات منفصلين.
الخلاصة
Gemini Omni هو الرهان المعماري الأكثر طموحاً الذي قام به أي شخص في فيديو الذكاء الاصطناعي هذا العام. وعد نموذج واحد لكل صيغة، في الاتجاهين، مختلف بنيوياً عن نهج خط الأنابيب الذي حدد 2024 و2025. إن أطلقت Google بقية المصفوفة ── إخراج الصورة، إخراج الصوت، سياق أطول ── على الجدول الزمني المُلمَّح إليه، فإن النموذج الذهني بأكمله لـ "أي أداة فيديو ذكاء اصطناعي أستخدم" يُعاد كتابته.
الوعد هو خبر 19 مايو 2026. الدليل هو إصدار API في "الأسابيع المقبلة"، يتبعه شهور من benchmarking الأطراف الثالثة. تعامل مع Omni اليوم كمتعقّب، لا كأداة. يبقى Kling V3 وVeo 3.1 وSeedance 2.0 الإجابات الصحيحة لعمل الإنتاج هذا الشهر ── إنها موثّقة ومُسعَّرة ومُدمَجة وتعمل على نطاق واسع.
لكل من ينشر محتوى هذا الأسبوع: استمر في استخدام ما يعمل. لكل من يبني للـ 18 شهراً القادمة: اشترك في قائمة انتظار API، راقب توثيق AI Studio وVertex AI، وخطّط لربع يمكنك فيه تشغيل benchmarks جنباً إلى جنب في اللحظة التي تفتح فيها نقطة النهاية.
إن أردت البدء في إنتاج فيديو ذكاء اصطناعي على نموذج مُجرَّب في الميدان الآن بينما ننتظر Omni:
→ جرّب Seedance 2.0 لمقاطع المنتجات والمراجع السريعة (حوالي 1 دولار لكل مقطع 5 ثوانٍ، 720p)
→ جرّب Kling V3 Omni للعمل السينمائي متعدد اللقطات مع صوت أصلي (تسلسل متعدد اللقطات، lip-sync)
→ جرّب وضع Kling 4K للقطات هيرو بجودة البث (3840×2160 أصلي بـ 60fps)
سننشر تكامل Gemini Omni على ImagineToVideo في نفس اليوم الذي تصبح فيه نقطة نهاية API من Google حية. حتى ذلك الحين ── راقب هذه المدونة، واستمر في النشر.



