谷歌发布 Gemini Omni:任意模态转换的 AI 新模型

Google’s new anything-to-anything AI model is wild

来源 The Verge AI 日期 英语原文

Gemini Omni 能够实现文本、图像、视频、音频之间的任意模态转换,在多项基准测试中刷新纪录,引发 AI 社区强烈关注。

技术能力

Gemini Omni 被设计为真正的多模态模型,用户输入一段视频,模型可以直接输出对应的文本摘要、图像分析与语音解说,无需分步处理。这种端到端的任意模态转换能力在行业尚属首次。

作者的亲身测试

本文作者以儿子的玩偶鹿为主角,用 Gemini Omni 制作了一段度假视频,验证了模型的图像生成与视频处理能力。作者承认从未将这些视频给四岁的孩子看过,但这一实验揭示了 Gemini Omni 在消费端的真实潜力。

行业影响

该模型发布正值谷歌在 AI 竞争中面临 OpenAI 与 Anthropic 的双重压力,Gemini Omni 被视为谷歌反击的核心产品之一。多模态能力的企业级应用场景包括视频内容审核、医疗影像分析与智能客服,市场空间巨大。

对 AI 行业的影响

Gemini Omni 的任意模态能力若能稳定商业化,将对 OpenAI 的 GPT 系列与 Anthropic 的 Claude 形成正面竞争,尤其是在需要跨模态推理的企业场景中。谷歌在 AI 产品化路径上迈出关键一步,对国内百度文心、阿里通义等多模态产品同样构成参考压力与技术方向指引。


原文参考

来源:The Verge AI · 2026-05-23

Last year I deepfaked my kid’s stuffed animal to make it look like his plush deer was on vacation. It was an experiment to see if I could re-create the events depicted in a Gemini ad Google was running, and I never showed the videos of Buddy the deer on his adventures to my four-year-old. […]