首页
资讯
深度
投融资
政策
活动
视频
当前模式 菜单关闭
我们能帮忙找点什么吗?

中国头部AR公司登上IEEE期刊!

发布日期:2026-08-19 20:53:34
字号:A+A-

/ VRAR星球 Fuku小福


近日,计算机图形学领域顶级学术期刊《IEEE Transactions on Visualization and Computer Graphics》(IEEE TVCG)刊发了一篇题为《LAE-Net: Large Pretrained Models Assistant Text-Guided Image Editing Adversarial Network》的研究论文。

 

该论文由中国头部AR企业乐奇Rokid研发团队与杭州电子科技大学研究团队合作完成,乐奇Rokid首席算法科学家、XR Lab负责人向学勤博士位列论文作者之一。IEEE TVCG被中国计算机学会(CCF)认定为CCF-A类期刊,此次发表标志着乐奇Rokid在前沿视觉算法领域的学术积累获得国际权威认可。

 

围绕文本引导图像编辑这一热点方向,研究团队提出LAE-Net框架,旨在解决真实图像编辑中的核心难题:如何让AI既能精准理解用户自然语言指令,又能严格保护与编辑意图无关的图像区域。

 

以“把橙色火车变成绿色”为例,理想效果应仅改变火车颜色,而车站、铁轨、天空等背景结构丝毫无损。当前主流扩散模型虽细节表现优异,但往往依赖多轮去噪和高昂计算成本,且容易误改无关区域;传统生成对抗网络(GAN)虽推理速度快,却受限于训练规模和语义理解能力。

 

 

LAE-Net的创新在于,在判别器中并行引入CLIP和DINO两类预训练模型——CLIP充当“语言顾问”,确保编辑结果与文本语义一致;DINO扮演“视觉质检”,约束物体形状与背景结构不失真。GAN生成器则负责一次前向传播高效输出,三者协同兼顾语义正确性、内容保真度和实时效率。

 

为进一步提升连续编辑过程中的指令一致性,团队设计了深层语义编辑网络,通过Mogrifier LSTM在多层特征间传递“工作记忆”,使各编辑模块始终围绕同一目标协同运作,有效避免语义偏移。

 

论文在CUB鸟类数据集和复杂COCO数据集上展开多类任务评测,结果显示LAE-Net在图像真实性、图文语义相似度、源图保真度和编辑精度等多项指标上取得有竞争力的表现。消融实验证实各核心模块均有独立贡献,组合使用效果更优。

 

 

效率方面,与文中对比的FPE方法相比,LAE-Net仅用约1/13的参数量和约1/830的推理时间,便获得更高的CLIPSIM分数(0.206 vs 0.202),充分展示了轻量化与高性能的平衡可能。

 

研究也坦诚指出当前局限:模型仍依赖训练数据覆盖范围,对罕见对象、跨领域风格及大幅形状变化的编辑能力有待加强,部分复杂场景下的局部细节尚不及扩散模型。未来拟通过拓展训练领域、引入更强预训练生成器或调整约束策略持续优化。

 

乐奇Rokid表示,LAE-Net涉及的多模态语义理解、生成式AI和实时推理能力,正是空间计算与自然人机交互的关键技术基石。公司将持续深耕多模态智能与下一代交互体验,让数字内容与现实空间的连接更加自然、精准。论文代码已同步开源,为学术界与工业界提供可复现的参考实现。


商务合作:13146398132undefined

媒体合作:13341147250

爆料投稿:editor@vrarworld.cn

版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。

如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。

本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。

发表评论(0