2024年10月21日,智源研究院正式发布原生多模态世界模型Emu3。该模型只基于下一个token预测,无需扩散模型或组合方法,即可完成文本、图像、视频三种模态数据的理解和生成。

Emu3在图像生成、视频生成、视觉语言理解等任务中超过了 SDXL 、LLaVA、OpenSora等知名开源模型,但是无需扩散模型、CLIP视觉编码器、预训练的LLM等技术,只需要预测下一个token。
Emu3提供了一个强大的视觉tokenizer,能够将视频和图像转换为离散token。这些视觉离散token可以与文本tokenizer输出的离散token一起送入模型中。与此同时,该模型输出的离散token可以被转换为文本、图像和视频,为Any-to-Any的任务提供了更加统一的研究范式。而在此前,社区缺少这样的技术和模型。
此外,受益于Emu3下一个token预测框架的灵活性,直接偏好优化(DPO)可无缝应用于自回归视觉生成,使模型与人类偏好保持一致。
商务合作:13146398132
媒体合作:13341147250
爆料投稿:editor@vrarworld.cn
版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。
如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。
本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。

三星首款AI眼镜Galaxy Glasses亮相:无屏显,长续航,强AI

闪极将在全国最大的万象城开设一家AI眼镜旗舰店

Halliday发布第二代AI眼镜:AI可实时参与会议

AI让健康触手可及|生生纪携 AI 心探、本若岚亮相 2026 世界人工智能大会

LumiMind亮相2026世界人工智能大会:从脑电技术到睡眠体验,探索神经科技消费化新路径

AR+AI走进真实场景,亮亮视野在WAIC展示系统化产业应用能力

端侧智能让穿戴设备更“懂你”

WAIC 2026爆款复盘:趣致集团Q-Gen引擎10分钟生成AI营销短剧,内容生产的“最后一公里”被踏平了

维信诺首次亮相ChinaJoy展会,OLED显示龙头加码数字娱乐新场景

三星首款AI眼镜Galaxy Glasses亮相:无屏显,长续航,强AI

闪极将在全国最大的万象城开设一家AI眼镜旗舰店

Halliday发布第二代AI眼镜:AI可实时参与会议

维信诺首次亮相ChinaJoy展会,OLED显示龙头加码数字娱乐新场景

数智赋能组织管理,莫界与北森达成生态战略合作

苹果Apple Park游客中心启动升级改造,AR展览区暂时关闭

多伦多大学研究:VR会扭曲人对自己身体尺寸的感知

华泰证券:AI眼镜有望成为AI Agent进入物理世界的高频入口

中日联合研究团队发明新型AR显示技术,可在提升现实世界可视性的同时保持虚拟物体的逼真度