3月27日凌晨,阿里巴巴发布并开源首个端到端全模态大模型通义千问Qwen2.5-Omni-7B,可同时处理文本、图像、音频和视频等多种输入,并实时生成文本与自然语音合成输出。在权威的多模态融合任务OmniBench等测评中,Qwen2.5-Omni刷新业界纪录,全维度远超Google的Gemini-1.5-Pro等同类模型。
性能测评对比,图源:网络
据了解,Qwen2.5-Omni以接近人类的多感官方式“立体”认知世界并与之实时交互,还能通过音视频识别情绪,在复杂任务中进行更智能、更自然的反馈与决策。现在,开发者和企业可免费下载商用Qwen2.5-Omni,手机等终端智能硬件也可轻松部署运行。
Qwen2.5-Omni采用了通义团队全新首创的Thinker-Talker双核架构、Position Embedding (位置嵌入)融合音视频技术、位置编码算法TMRoPE(Time-aligned Multimodal RoPE)。双核架构Thinker-Talker让Qwen2.5-Omni拥有了人类的“大脑”和“发声器”,形成了端到端的统一模型架构,实现了实时语义理解与语音生成的高效协同。具体而言,Qwen2.5-Omni支持文本、图像、音频和视频等多种输入形式,可同时感知所有模态输入,并以流式处理方式实时生成文本与自然语音响应。
得益于上述突破性创新技术,Qwen2.5-Omni在一系列同等规模的单模态模型权威基准测试中,展现出了全球最强的全模态优异性能,其在语音理解、图片理解、视频理解、语音生成等领域的测评分数,均领先于专门的Audio或VL模型,且语音生成测评分数(4.51)达到了与人类持平的能力。(新闻来源:钱江晚报)
商务合作:13146398132
媒体合作:13341147250
爆料投稿:editor@vrarworld.cn
版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。
如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。
本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。
PICO开始支持个人开发者自助上架+分发付费应用
谷歌将在I/O大会低调举办Android XR讲座
Reality Labs受到重创,Meta裁员上百人
OpenAI推出轻量级ChatGPT深度研究工具,免费用户也能用
Adobe挑战OpenAI,安卓/iOS版AI生图工具Firefly蓄势待发
Horizon Worlds现已支持音乐会等活动的3D 180°视频
影核VR新作《海上传奇:女王的崛起》登陆PICO平台
腾讯混元3D模型全新升级
Sightful推出推出适用于Windows的AR办公套装Spacetop,售价899美元
苹果将为Vision Pro原生支持Godot免费开源游戏引擎
Ray-Ban智能眼镜实用性大增,Meta推出实时翻译功能
Meta开卖翻新版Quest 3S,售价270美元起
The Sandbox与Bruce Lee Enterprises合作,李小龙“入驻”元宇宙
歌尔股份发布2025年Q1财报:净利润4.69亿元,同比增长23.53%
Vision Pro新专利:佩戴者眼球一动,实现解锁、切换设置等
北京国际电影节举办AI+VR项目创投会,VRAR星球参展
PICO视频新预告:3D穿越机带你飞掠绿野山居、地下迷窟、VR宇宙之旅第二季-宇宙射线
Character.AI推出AvatarFX模型:AI实现静转动,让图片角色开口说话