谷歌推进AI融合计划：Gemini与Veo模型整合，打造全能型数字助手

🤖 由文心大模型生成的文章摘要

谷歌宣布，其AI研发部门DeepMind正加速推进“AI融合计划”，将旗下多模态大模型Gemini与视频生成模型Veo深度整合，以构建更强大的全能型AI助手。根据DeepMind首席执行官Demis Hassabis在播客节目中的披露，Gemini与Veo的融合旨在提升AI对物理世界的理解能力。Gemini作为谷歌的核心多模态模型，已支持文本、图像、音频生成，而Veo 2通过分析海量YouTube视频数据，掌握了物体运动规律和场景动态。两者的结合将使AI助手不仅能生成内容，还能基于现实逻辑推理，例如预测物体运动的轨迹或模拟复杂环境中的交互。

Hassabis在由领英联合创始人Reid Hoffman共同主持的播客节目Possible中透露了这一计划。他表示：“我们从一开始就将Gemini这一基础模型打造为多模态模型，因为我们有着构建一个通用数字助手的愿景，这个助手能够在现实世界中真正为你提供帮助。”

目前，整个AI行业正逐渐朝着“全能”模型的方向发展，这些模型能够理解和整合多种媒体形式。谷歌最新Gemini模型不仅可以生成图像和文本，还能生成音频；而OpenAI在 ChatGPT中的默认模型如今也能创建图像，包括宫崎骏风格的艺术作品。亚马逊也宣布计划在今年晚些时候推出一款“任意到任意”的模型。

据了解，这些“全能”模型需要大量的训练数据，包括图像、视频、音频、文本等。Hassabis 暗示，Veo的视频数据主要来源于谷歌旗下的YouTube平台。他说道：“通过观看大量的 YouTube视频，Veo 2能够了解世界的物理规律。” 此前，谷歌曾表示，其模型可能会根据与YouTube创作者达成的协议，使用“部分”YouTube 内容进行训练。据报道，该公司去年扩大了服务条款的部分内容，以便获取更多数据来训练其AI模型。

「93913原创内容，转载请注明出处」

谷歌推进AI融合计划：Gemini与Veo模型整合，打造全能型数字助手

相关文章

亚马逊正在开发代号为“Metis”的ChatGPT竞品

缪斯还是威胁？生成式AI对东南亚艺术界的影响

博士眼镜：上半年营收超6亿元官宣携手雷鸟创新布局音频+AI眼镜

深圳发布“智霁2.0”和“智瞳”提升气象早期预警能力

Meta与伯克利团队在强化学习领域取得重大突破，推出新算法SWEET – RL

OpenAI竞争对手Anthropic推出其迄今为止最强大AI模型

推荐

聚焦苹果HMD创新专利：攻克双视难题，升级视觉体验，重塑XR动态门户

三星专利新突破：Galaxy Ring、Watch与Android XR、智能眼镜协同，解锁XR UI导航新姿势

苹果“Vision Air”电源线曝光

Looking Glass推出27英寸裸眼3D显示器

AI应用推荐

热门

聚焦苹果HMD创新专利：攻克双视难题，升级视觉体验，重塑XR动态门户

三星专利新突破：Galaxy Ring、Watch与Android XR、智能眼镜协同，解锁XR UI导航新姿势

友情链接

推荐

聚焦苹果HMD创新专利：攻克双视难题，升级视觉体验，重塑XR动态门户

三星专利新突破：Galaxy Ring、Watch与Android XR、智能眼镜协同，解锁XR UI导航新姿势

苹果“Vision Air”电源线曝光

Looking Glass推出27英寸裸眼3D显示器