Google Gemini Omni:打通图文音视频,统一理解还能生成视频

Google’s Gemini Omni turns images, audio, and text into video — and that’s just the start

来源 TechCrunch AI 日期 英语原文

Google在I/O大会上发布了Gemini Omni多模态模型家族,能够跨文本、图像、音频、视频进行统一推理,并生成视频内容。首发产品为Omni Flash,用户可以组合图片、音频、视频和文本,通过对话方式生成高质量视频,理解物理规律、文化、历史背景。

Google在I/O大会上发布了Gemini Omni多模态模型家族,能够跨文本、图像、音频、视频进行统一推理,并生成视频内容。首发产品为Omni Flash,用户可以组合图片、音频、视频和文本,通过对话方式生成高质量视频,理解物理规律、文化、历史背景。

对 AI 行业的影响

Gemini Omni代表了Google在多模态统一建模上的实质性进展。不同于此前多模态模型的简单拼接,Omni能跨格式深度推理并生成一致的视频内容。这是AIGC工具链的重要进步,视频制作门槛将显著降低。对Runway、Pika等视频AI公司形成直接压力。


原文参考

来源:TechCrunch AI · 2026-05-19

Google’s Gemini Omni is a new multimodal model that reasons across text, images, audio, and video to generate and edit videos through simple conversation — starting with Omni Flash.