首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ECCV 2026|同济&蚂蚁集团提出CLI:视觉语言融合新方法

ECCV 2026|同济&蚂蚁集团提出CLI:视觉语言融合新方法

作者头像
Amusi
发布2026-07-22 17:52:18
发布2026-07-22 17:52:18
860
举报
文章被收录于专栏:CVerCVer

论文题目:From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

会议:ECCV 2026

论文:https://arxiv.org/abs/2601.10710

代码:github.com/codefuse-ai/CLI

模型权重(CLI-0.5B)

https://huggingface.co/codefuse-ai/CLI-0.5B;CLI-7B:https://huggingface.co/codefuse-ai/CLI-7B

本文工作由同济大学、蚂蚁集团、上海创新研究院联合完成。论文关注一个在视觉语言模型(VLM)中非常基础、但长期被低估的问题:视觉编码器已经提取了多层级图像信息,为什么语言模型最终仍然容易漏看细节?

作者提出 Cross-Layer Injection(CLI),将传统“一对一”的静态视觉连接升级为动态“多对多”跨层融合。CLI 让不同 LLM 解码层能够根据当前上下文,主动查询视觉编码器不同层级的信息,从而在需要时看局部纹理、看结构关系,也看全局语义。

引言

多模态大模型看不清图像细节,问题可能并不在于视觉编码器“没有看到”,而在于这些信息没有被完整地传给语言模型。

目前,大多数视觉语言模型(VLM)只提取视觉编码器最后一层的特征,再通过投影器送入大语言模型。这样的连接简单高效,却像一条狭窄的“视觉信息单行道”:浅层捕捉到的纹理、边缘和局部结构,在进入 LLM 前已经大量丢失。

为此,作者提出 Cross-Layer Injection(CLI),将传统的静态“一对一”连接升级为动态“多对多”融合。CLI 让不同 LLM 解码层能够根据当前上下文,主动查询视觉编码器不同层级的信息,在需要时看细节、看结构,也看全局语义。

该工作 From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion 已被 ECCV 2026 接收。作者在两类主流 VLM 架构和 28 项评测上进行了验证。在 LLaVA-OneVision-7B 上,CLI 分别在 LLaVA-in-the-Wild、OCR-Bench 和 MME 上带来 +6.5、+4.7 和 +3.3 的提升。

目前,作者已同步开源 CLI 的训练模型与代码,包含 CLI-0.5B 和 CLI-7B 两个版本,方便社区直接复现、评测和二次开发。

背景介绍:VLM 的视觉信息为何会“堵”在最后一层?

图:CLI 的动机案例与学习到的动态跨层连接

视觉 Transformer 会在不同层中逐步理解图像:浅层关注边缘、颜色和纹理,中间层形成局部结构与空间关系,深层则更多表达物体类别和全局语义。

然而,主流 VLM 通常只保留最后一层特征。换句话说,视觉编码器完成了从细节到语义的一整套分析,LLM 最终拿到的却只有“最终摘要”。当任务需要核对某个字符、轮廓或局部结构时,语言模型已经没有足够的视觉证据可用。

论文中的冰鞋案例非常直观。用户询问图中的鞋是否适合轮滑,基线模型将冰鞋误认为轮滑鞋,回答“Yes”。它识别出了“鞋”这一高层概念,却忽略了底部是冰刀而不是滚轮。CLI 同时利用物体语义与局部结构,给出了正确答案“No”。

这暴露出传统 VLM 的一个核心矛盾:

复杂的视觉推理需要同时使用局部细节与全局语义,但模型只在输入端接收一次、且只有单一层级的视觉信息。

现有方法要么将同一份视觉特征直接注入多个 LLM 层,缺少筛选,容易引入干扰;要么预先规定“第几个视觉层连接第几个语言层”,连接关系固定,无法随问题和解码上下文变化。

因此,仅仅“多传几层特征”并不足够。真正需要解决的是:在不同推理阶段,LLM 应该从哪些视觉层读取什么信息?

核心思路:让 LLM 成为主动观察者

CLI 的核心思想可以浓缩成一句话:

视觉信息不应只在输入端传递一次,而应在 LLM 的解码过程中被反复、按需地查询。

CLI 从多个视觉层提取层级特征,并在多个 LLM 解码层设置注入点。每个注入点都不是机械地接收某个固定视觉层,而是根据当前隐藏状态,从完整视觉层级中动态选择信息,由此形成可学习的、交叉的“多对多”信息流。

当模型识别文字时,它可以重新读取浅层的笔画和纹理;当模型判断物体关系或回答开放问题时,它又可以结合深层的场景语义。LLM 不再只是视觉特征的被动接收者,而是一个能在推理过程中不断“回看图像”的主动观察者。

CLI:两大模块打通动态跨层融合

CLI 由两个相互配合的模块组成:Adaptive Multi-Projection(AMP) 和 Adaptive Gating Fusion(AGF)。

图:CLI 整体框架

1. AMP:让不同视觉层“说同一种语言”

浅层视觉特征偏向纹理和结构,深层特征偏向语义,两者的数据分布明显不同。共享一个固定投影器难以同时对齐它们,而为每一层训练完整投影器又会带来较大开销。

AMP 保留原有预训练投影器,同时为不同视觉层配置专属的 LoRA 适配分支。每个分支只需学习少量低秩参数,就能把对应视觉层映射到统一的语言表示空间。

可以把 AMP 理解为一个“多层视觉翻译器”:它保留各层的特征差异,又让这些信息最终以 LLM 能理解的方式表达出来。

2. AGF:不是全部注入,而是按需选择

获得更多视觉特征,只解决了“有没有信息”的问题,却没有解决“当前需不需要”的问题。无差别叠加可能造成信息过载,甚至破坏 LLM 已经形成的隐藏状态。

AGF 分别提炼候选视觉特征和当前 LLM 隐藏状态,再通过门控控制器生成动态权重,以决定哪些视觉信息应该注入、注入多少。

这一过程可以理解为模型不断追问:

“基于我现在已经理解的内容,还缺少哪些视觉证据?”

正是这种动态筛选,让 CLI 与简单的多层特征堆叠产生本质区别:模型不仅看得更多,而且知道什么时候该看什么。

实验结果:28 项评测验证动态融合的有效性

作者将 CLI 集成到两套结构不同的 VLM 中:

·LLaVA-OneVision-0.5B/7B:采用 Qwen2 与 SigLIP;

·LLaVA-1.5-7B:采用 Vicuna-7B 与 CLIP。

评测覆盖图表与文档理解、通用视觉感知、多学科推理、真实场景问答、OCR 和视觉定位等 28 项任务。

在 LLaVA-OneVision-7B 上,相比相同数据重新训练的基线模型,CLI 取得了多项明显提升:

·LLaVA-in-the-Wild:68.0 → 74.5,+6.5

·OCR-Bench:+4.7

·MME:85.1 → 88.4,+3.3

·MMStar:54.1 → 56.5,+2.4

·28 项评测的性能增量合计达到 +19.06

图:CLI 在各项评测上的性能增量

在论文表 1 的九项任务中,LLaVA-OneVision-7B 的总分由 650.9 提升至 660.6,接近 InternVL-2-8B 的 660.9。

OCR 需要识别细小字符笔画,视觉定位则既要理解目标语义,又要判断空间位置。在 OCR 与九组 RefCOCO/+/g 评测上,CLI 均取得稳定提升,说明动态跨层融合可以同时服务于细节识别和全局理解。

图:CLI 在 OCR 与视觉定位任务上的结果

当 CLI 迁移到结构不同的 LLaVA-1.5-7B 后,两组评测的部分总分分别提升 7.5 和 8.6,表明该方法并不依赖某一特定主干,而是一种可接入不同 VLM 的通用融合框架。

消融实验:关键不是“信息更多”,而是“选择更准”

图:CLI 的消融实验的结果

消融实验进一步揭示了 CLI 有效的关键。

在 LLaVA-OneVision-0.5B 的设置中,基线总分为 366.72,仅加入 AMP 后为 367.89,提升有限;仅加入 AGF 后达到 370.60;AMP 与 AGF 联合使用时进一步达到 371.51。

这说明:视觉信息的丰富程度只是基础,根据当前上下文筛选相关信息,才是多层视觉融合真正有效的关键。

作者还设计了参数量相近的静态 Parallel Fusion 作为对照,将第 i 个视觉层固定连接到第 i 个语言层。在 LLaVA-in-the-Wild 上,静态方案比基线下降 6.5 分,而 CLI 提升 6.5 分,两者相差超过 13 分。

因此,CLI 的收益并不是简单来自更多参数,而是来自动态、多对多的信息组织方式。

定性结果:看清文字,也理解整体语义

从实际案例中可以更直观地看到 CLI 的作用:

·面对艺术化字体时,基线模型生成了与图像无关的单词,CLI 的输出仍与真实笔画保持对应;

·当问题要求寻找“最大的白色单词”时,CLI 能结合局部文字和整体版式识别出“love”,基线则错误选择“EMBRACE”;

·在常识视觉问答中,CLI 的回答也更加稳定。

图:CLI 与基线模型的定性对比

这些结果表明,CLI 不只是提升了细粒度感知,也让 LLM 在生成答案时拥有更充分的视觉依据,从而减少由细节缺失带来的误识别和幻觉。

CLI 的价值:不换主干,重新设计视觉信息流

CLI 不需要重新设计视觉编码器或语言模型,而是从两者之间的连接方式入手,改善视觉信息进入 LLM 的路径:

·动态性:融合内容由当前解码上下文决定,而不是预先固定;

·通用性:已在 LLaVA-OneVision 与 LLaVA-1.5 两类架构上验证;

·参数高效:AMP 使用 LoRA 适配不同视觉层,避免为每层训练完整投影器。

在 LLaVA-OneVision-0.5B 的消融设置中,AMP + AGF 的总参数量约为基线的 104.37%。在 MMBench 单样本测试中,推理前向显存从 241.2 MB 增至 244.4 MB,增幅约 1.3%。

相比单纯扩大模型规模或增加训练数据,CLI 探索了另一条路径:让已经存在的层级视觉信息被更充分、更准确地使用。

开源模型:CLI-0.5B 与 CLI-7B 已发布

为了方便更多研究者复现和使用,作者已在 Hugging Face 发布两个训练模型:

·CLI-0.5B:https://huggingface.co/codefuse-ai/CLI-0.5B

·CLI-7B:https://huggingface.co/codefuse-ai/CLI-7B

其中,CLI-0.5B 更适合快速测试、轻量部署和方法验证;CLI-7B 则适合追求更强多模态理解能力的评测与应用场景。相关训练和推理代码已同步开源在 GitHub:

https://github.com/codefuse-ai/CLI

欢迎大家试用、反馈,也欢迎基于 CLI 探索更多动态视觉-语言融合方式。

结语

传统 VLM 将视觉编码器最后一层一次性送入语言模型,这种静态“一对一”连接压缩了丰富的视觉层级,也限制了 LLM 在推理过程中重新核对图像证据的能力。

CLI 将这一过程改造为动态“多对多”融合:AMP 负责对齐不同视觉层,AGF 负责根据当前上下文选择信息,多个跨层注入点则让 LLM 在解码过程中持续更新视觉理解。

作者希望这项工作能够传递一个简单但重要的观点:更强的多模态理解,不仅取决于视觉编码器看到了什么,也取决于语言模型能否在正确的时机访问正确的视觉信息。

本文系学术转载,如有侵权,请联系CVer小助手删文

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-21,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 CVer 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 引言
  • 背景介绍:VLM 的视觉信息为何会“堵”在最后一层?
  • 核心思路:让 LLM 成为主动观察者
  • CLI:两大模块打通动态跨层融合
    • 1. AMP:让不同视觉层“说同一种语言”
    • 2. AGF:不是全部注入,而是按需选择
  • 实验结果:28 项评测验证动态融合的有效性
  • 消融实验:关键不是“信息更多”,而是“选择更准”
  • 定性结果:看清文字,也理解整体语义
  • CLI 的价值:不换主干,重新设计视觉信息流
  • 开源模型:CLI-0.5B 与 CLI-7B 已发布
  • 结语
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档