2024年10月21日,智源研究院正式发布原生多模态世界模型Emu3。该模型只基于下一个token预测,无需扩散模型或组合方法,即可完成文本、图像、视频三种模态数据的理解和生成。

Emu3在图像生成、视频生成、视觉语言理解等任务中超过了 SDXL 、LLaVA、OpenSora等知名开源模型,但是无需扩散模型、CLIP视觉编码器、预训练的LLM等技术,只需要预测下一个token。
Emu3提供了一个强大的视觉tokenizer,能够将视频和图像转换为离散token。这些视觉离散token可以与文本tokenizer输出的离散token一起送入模型中。与此同时,该模型输出的离散token可以被转换为文本、图像和视频,为Any-to-Any的任务提供了更加统一的研究范式。而在此前,社区缺少这样的技术和模型。
此外,受益于Emu3下一个token预测框架的灵活性,直接偏好优化(DPO)可无缝应用于自回归视觉生成,使模型与人类偏好保持一致。
商务合作:13146398132
媒体合作:13341147250
爆料投稿:editor@vrarworld.cn
版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。
如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。
本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。

三星Galaxy XR可选追踪手柄已售罄,新用户或将等待三周以上

阿里巴巴将于24日零点开启夸克AI眼镜预售,平台补贴后最低3699元

亚马逊发布“Amelia”智能眼镜,内置显示屏和始终开启的摄像头

理湃光晶完成新一轮融资,几何光波导全面引领AR产业爆发

用科技延伸仁心:创新工具守护生命健康

2025 AIRS香港科技峰会圆满落幕,勾勒“AI与机器人+”时代新图景

《铸魂·台湾光复》VR互动电影于台湾光复80周年“第十二届大江论坛”首展

M5 Apple Vision Pro现已上市,但M2型号无法以旧换新

王自如对话李宏伟:AR眼镜的“iPhone时刻”或在2027年

三星Galaxy XR可选追踪手柄已售罄,新用户或将等待三周以上

阿里巴巴将于24日零点开启夸克AI眼镜预售,平台补贴后最低3699元

亚马逊发布“Amelia”智能眼镜,内置显示屏和始终开启的摄像头

理湃光晶完成新一轮融资,几何光波导全面引领AR产业爆发

用科技延伸仁心:创新工具守护生命健康

2025 AIRS香港科技峰会圆满落幕,勾勒“AI与机器人+”时代新图景

《铸魂·台湾光复》VR互动电影于台湾光复80周年“第十二届大江论坛”首展

M5 Apple Vision Pro现已上市,但M2型号无法以旧换新

王自如对话李宏伟:AR眼镜的“iPhone时刻”或在2027年