北京智源研究院发布原生多模态世界模型Emu3

发布时间:2025-01-04 14:37:37 来源: sp20250104

  本报电  (记者刘峣)近日,北京智源人工智能研究院正式发布原生多模态世界模型Emu3。该模型实现了视频、图像、文本三种模态的统一理解与生成,成功验证了基于下一个token(词元)预测的多模态技术范式,释放其在大规模训练和推理上的潜力。

  据了解Emu3只基于下一个token预测,无需扩散模型或组合式方法,把图像、文本和视频编码为一个离散空间,在多模态混合序列上从头开始联合训练一个Transformer。

  智源研究院院长王仲远表示,Emu3为构建多模态通用人工智能提供了广阔的技术前景,有机会将基础设施建设收敛到一条技术路线上,为大规模多模态训练和推理提供基础。未来,多模态世界模型将促进机器人大脑、自动驾驶、多模态对话和推理等场景应用。

(责编:李昉、郝孟佳)
选择用户
全部人员 全选 撤消
谢志刚
李岩
李海涛
谢志强
李亚琴
潘潇潇
杨亚男
高荣新
郑文静
金琳
张银波
张欣
陈曦
刘涛
王长青
高广柱
孙圆
行政专员
付雪枫
张雪莲
张璐
刘相群
张明璇
李静
孙静
王晨
赵夏
马洪亮
张兰
黄莉
李潍伊
常恩宁
侯昭宇
韩岩峰
冯亚红
林洋
陈静
刘婧
魏保国
唐彦秀
张楠
刘瑞萍
付严明
荣伶
马建国
邓爱青
系统管理员