谷歌于9月25日对外发布消息,在上周推出Gemini 3.8 Live版本后,如今又增添了Live Avatar功能,为原生实时对话模型带来近乎即时的视觉展现。
这项技术把接近实时生成的视频与语音融为一体,能构建出可以聆听、观察并以动态视觉形象进行交流的互动体验,凭借精确的唇形同步、自然的表情以及流畅的对话轮次切换,助力企业拓展更具互动性的虚拟服务。相关演示视频已附在下方:
对话本质上就是多模态的,人们通过倾听、观察、说话和面部表情来沟通。Live Avatar将这些能力赋予企业智能代理,它同时处理视觉和音频输入,生成更丰富的对话内容,从而带来更全面的交互感受。
除了视觉方面的提升,该功能还依托于Gemini的高级推理能力。通过异步工具调用,Live Avatar能在后台触发工具调用并获取数据,同时保持对话正常进行,在处理复杂任务时确保对话流程不被打断。
Live Avatar支持原生多语言语音同步,能动态调整唇形同步与表情,可在97种语言之间无缝切换,且不会降低视频清晰度或产生视觉偏移。
除了预设的多样化形象库,企业还能自定义Live Avatar。开发者可以利用高质量参考图像生成完整动画、响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征。目前,自定义虚拟形象仅向企业白名单用户开放。
谷歌为Live Avatar建立了严格的安全保障机制,所有AI生成内容都通过SynthID添加隐形水印,直接嵌入音频与视频输出,以便识别AI生成内容,减少错误信息和归属错误问题。如果你对这类前沿交互技术感兴趣,可以通过乐鱼体育网站入口了解更多相关动态。
目前,带有Live Avatar功能的Gemini 3.8 Live已在Gemini Enterprise上线,用户可通过官方文档探索API并开始使用。