5月21日,搜狗联合新华社推出的全球首个3D AI合成主播“新小微”正式亮相,为全国观众带来最新的两会新闻资讯报道。基于搜狗人工智能核心技术“搜狗分身”打造的“新小微”,将拉开中国传媒行业全面进入智慧时代的序幕。
作为AI合成主播的开创者和引领者,自2018年基于搜狗分身技术推出全球首个AI合成主播后,搜狗分身持续取得重大突破,此次的3D AI合成主播就是搜狗分身最新的突破性成果。

“新小微”以新华社记者赵琬微为原型,基于超写实3D数字人建模、多模态识别及生成、实时面部动作生成及驱动、迁移学习等多项人工智能前沿技术,使机器可以基于输入文本生成逼真度极高的3D数字人视频内容。
3D AI合成主播结合了原力科技提供的业界领先的扫描还原、面部肌肉驱动、表情肢体捕捉等技术,生产出了高度还原真人发肤、形象逼真的数字人模型;同时基于搜狗分身领先的端到端多模态建模技术,使用语音、图像、文本、3D肌肉运动数据等多模态信息完成联合建模训练。在AI算法的驱动下,只需输入文本内容,“新小微”就能根据语义实时播报新闻,其表情唇动、肢体动作和语音表达高度契合、自然逼真。
搜狗推出全球第一位AI合成主播后,通过不断迭代更新使AI合成主播具备了多语种播报、对话交互等诸多能力,用最前沿的技术能力和产品效果,不断推动传媒行业内容生产的效率变革。据统计,首位 AI 合成主播“新小浩”已在新华社客户端上持续为观众服务500 多天,先后产出13,000多条新闻报道,累计时长超过35,000分钟。

较之前的2D AI合成主播,3D“新小微”不仅立体、灵活,可控,还具有同时支持多机位多景深,360°任意角度呈现内容等能力,在应用空间上拥有更多的可能性,为新闻节目多样化制作和呈现带来了更多选择。
从最初的2D到今天的3D AI合成主播,其背后不仅仅是搜狗分身技术的一次次突破迭代,更体现出人工智能驱动传媒行业生产效率与生产流程的不断革新。不仅减轻了行业从业者的重复性工作,更让相关工作“拟人化”、“生动化”,让传媒新闻播报更加有趣,更具现场性。不久的将来,3D AI合成主播还会走出演播厅,支持外景播报和互动采访,为观众带来最前沿的新闻讯息。
在5G全面铺展的新技术时代,随着分身技术落地经验的不断积累以及产品技术的突破创新,搜狗分身也会从传媒领域出发,快速向影音娱乐、医疗健康、教育金融等众多领域蔓延辐射,持续推动大众智能生活的建设。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。