2024年10月21日,智源研究院正式发布原生多模态世界模型Emu3。该模型只基于下一个token预测,无需扩散模型或组合方法,即可完成文本、图像、视频三种模态数据的理解和生成。

Emu3在图像生成、视频生成、视觉语言理解等任务中超过了 SDXL 、LLaVA、OpenSora等知名开源模型,但是无需扩散模型、CLIP视觉编码器、预训练的LLM等技术,只需要预测下一个token。
Emu3提供了一个强大的视觉tokenizer,能够将视频和图像转换为离散token。这些视觉离散token可以与文本tokenizer输出的离散token一起送入模型中。与此同时,该模型输出的离散token可以被转换为文本、图像和视频,为Any-to-Any的任务提供了更加统一的研究范式。而在此前,社区缺少这样的技术和模型。
此外,受益于Emu3下一个token预测框架的灵活性,直接偏好优化(DPO)可无缝应用于自回归视觉生成,使模型与人类偏好保持一致。
商务合作:13146398132
媒体合作:13341147250
爆料投稿:editor@vrarworld.cn
版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。
如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。
本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。

ROG XREAL R1正式开启预约,首发价5999元

显耀股份推进量产架构升级,MicroLED微显示迈向12英寸晶圆时代

2026中国上海VR/AR产业博览会圆满落幕

《卧底特工》将于7月登陆Steam,支持VR和PC版

VR音游Synth Riders推出新曲目《节奏地牢》

MR恐龙建造体验游戏Le Dino Labo最新DLC《白垩纪掠食者与猎物》现已推出

Quest最新PTC更新可将网页照片转换为3D图片

Meta和依视路陆逊梯卡在阿联酋推出两款全新的Ray-Ban Meta光学款AI眼镜

全球首款杜比视界认证AR眼镜,雷鸟全新旗舰GT系列即将发布

ROG XREAL R1正式开启预约,首发价5999元

显耀股份推进量产架构升级,MicroLED微显示迈向12英寸晶圆时代

2026中国上海VR/AR产业博览会圆满落幕

《卧底特工》将于7月登陆Steam,支持VR和PC版

VR音游Synth Riders推出新曲目《节奏地牢》

MR恐龙建造体验游戏Le Dino Labo最新DLC《白垩纪掠食者与猎物》现已推出

Quest最新PTC更新可将网页照片转换为3D图片

Meta和依视路陆逊梯卡在阿联酋推出两款全新的Ray-Ban Meta光学款AI眼镜

全球首款杜比视界认证AR眼镜,雷鸟全新旗舰GT系列即将发布