十方融海联合高校破解视觉大模型 “幻觉” 难题,成果被国际顶会 EMNLP 收录
近日,自然语言处理领域顶级国际会议 EMNLP 2026 公布录用结果,一篇由深圳十方融海科技有限公司联合广东工业大学、南洋理工大学完成的论文《YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models》被大会收录。研究聚焦大视觉语言模型普遍存在的 “幻觉”问题,核心方法 YARD(Y 型架构寄存器解码)通过在模型内部引入一种新的解码机制,在不额外增加训练与推理负担的前提下抑制幻觉。
公开信息显示,EMNLP 全称 “自然语言处理经验方法会议”,是自然语言处理领域公认的顶级国际学术会议。此次被收录文章里的 YARD 研究,并非一项停留在算法层面的孤立创新,更代表了产学研协同在 AI 可靠性方向上的一个务实样本:高校提供理论深度与方法设计,企业将真实场景中的多模态交互需求与视觉理解痛点带入研究,三方合力推动视觉大模型幻觉这一产业级难题向前迈出可量化的一步。
随着人工智能的快速发展,视觉大模型正在图像理解、图文对话、多模态推理等场景快速落地,但 “幻觉” 始终是制约其落地的一道坎 —— 模型有时会描述图像中并不存在的物体,捏造颜色、数量或空间关系,也就是常说的 “一本正经地胡说八道”。这一问题能否解决,直接关系到 AI 回答是否可信,也关系到视觉大模型能否进入工业、医疗、内容生产等对准确性要求更高的场景。当下行业焦点已从 “能不能看懂图” 转向 “看得准不准、说得真不真”,当 AI 开始介入辅助诊断、工业质检、智能审核等任务时,幻觉的代价被急剧放大。
针对这一问题,YARD 的思路是:在模型内部构建一条 “退化分支”,让它保留图像的全局语义、丢掉细粒度的局部细节,再与完整信息分支做对比,从而引导模型在生成时更 “忠于” 画面本身。打个比方:模型先扫一眼画面、再回头细看,两次 “看到” 的差异之处,往往就是容易产生幻觉的地方 —— 通过对比,模型得以区分真实信息和自身 “脑补”。而这一方案无需额外训练,能在抑制幻觉的同时保持了更低的开销。
值得一提的是,在多个国际通用评测基准上,YARD 均带来明显改善:幻觉率显著下降、判别准确率明显提升,并可迁移至多种主流视觉大模型,以更小的开销取得更优的抑制效果。换言之,模型 “看到的”与 “说出的” 之间更一致了,且不必为此付出成倍的算力代价。对内容生产、辅助决策等实际场景,这意味着更少的人工纠错和更高的可用性。
从研究分工看,这是一项典型的产学研协同成果。论文由广东工业大学、南洋理工大学的研究团队与十方融海团队联合完成。十方融海方面深度参与了研究方案的设计与实验验证,将长期在多模态产品交互中积累的用户意图感知与视觉理解痛点前置到方法设计中,为研究提供了来自真实场景的方向性校准。企业创始人黄冠、陈劢、雷浪声与小智AI业务负责人杜君等均在作者之列 —— 企业核心成员集体署名,在产学研合作论文中并不常见,从侧面反映出该企业对底层技术研究的重视程度。
作为一家以 AI 驱动的全民终身学习新基建企业,十方融海始终坚持底层技术攻关与产业应用落地双轮驱动,已构建起覆盖多模态交互与跨场景应用的大模型技术体系。其在大模型、多模态交互等方向已积累 30 余项专利、200 余件技术型知识产权,旗下 Openbuddy、Tens AI、小智 AI 等自研模型在开源生态与产业落地中持续释放价值。此次 EMNLP 收录,正是其底层技术能力走向国际学术前沿的一次具体体现。
在团队看来,大模型是否可靠,决定了 AI 能否从演示走进千家万户。用底层技术的确定性去对抗 AI 的不确定性,是十方融海坚持的方向。随着视觉大模型进入更多真实场景,围绕 “幻觉” 等可靠性问题的研究,或将成为下一阶段 AI 落地的关键一环。企业将继续沿着底层技术攻关与产业落地的方向推进研究与产品化,让技术以更可信的方式进入每个人的工作与生活,回应 “让每个人,因 AI 而不同”的愿景。

