
论文题目:From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion
会议:ECCV 2026
论文:https://arxiv.org/abs/2601.10710
代码:github.com/codefuse-ai/CLI
模型权重(CLI-0.5B)
https://huggingface.co/codefuse-ai/CLI-0.5B;CLI-7B:https://huggingface.co/codefuse-ai/CLI-7B
本文工作由同济大学、蚂蚁集团、上海创新研究院联合完成。论文关注一个在视觉语言模型(VLM)中非常基础、但长期被低估的问题:视觉编码器已经提取了多层级图像信息,为什么语言模型最终仍然容易漏看细节?
作者提出 Cross-Layer Injection(CLI),将传统“一对一”的静态视觉连接升级为动态“多对多”跨层融合。CLI 让不同 LLM 解码层能够根据当前上下文,主动查询视觉编码器不同层级的信息,从而在需要时看局部纹理、看结构关系,也看全局语义。
多模态大模型看不清图像细节,问题可能并不在于视觉编码器“没有看到”,而在于这些信息没有被完整地传给语言模型。
目前,大多数视觉语言模型(VLM)只提取视觉编码器最后一层的特征,再通过投影器送入大语言模型。这样的连接简单高效,却像一条狭窄的“视觉信息单行道”:浅层捕捉到的纹理、边缘和局部结构,在进入 LLM 前已经大量丢失。
为此,作者提出 Cross-Layer Injection(CLI),将传统的静态“一对一”连接升级为动态“多对多”融合。CLI 让不同 LLM 解码层能够根据当前上下文,主动查询视觉编码器不同层级的信息,在需要时看细节、看结构,也看全局语义。
该工作 From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion 已被 ECCV 2026 接收。作者在两类主流 VLM 架构和 28 项评测上进行了验证。在 LLaVA-OneVision-7B 上,CLI 分别在 LLaVA-in-the-Wild、OCR-Bench 和 MME 上带来 +6.5、+4.7 和 +3.3 的提升。
目前,作者已同步开源 CLI 的训练模型与代码,包含 CLI-0.5B 和 CLI-7B 两个版本,方便社区直接复现、评测和二次开发。

图:CLI 的动机案例与学习到的动态跨层连接
视觉 Transformer 会在不同层中逐步理解图像:浅层关注边缘、颜色和纹理,中间层形成局部结构与空间关系,深层则更多表达物体类别和全局语义。
然而,主流 VLM 通常只保留最后一层特征。换句话说,视觉编码器完成了从细节到语义的一整套分析,LLM 最终拿到的却只有“最终摘要”。当任务需要核对某个字符、轮廓或局部结构时,语言模型已经没有足够的视觉证据可用。
论文中的冰鞋案例非常直观。用户询问图中的鞋是否适合轮滑,基线模型将冰鞋误认为轮滑鞋,回答“Yes”。它识别出了“鞋”这一高层概念,却忽略了底部是冰刀而不是滚轮。CLI 同时利用物体语义与局部结构,给出了正确答案“No”。
这暴露出传统 VLM 的一个核心矛盾:
复杂的视觉推理需要同时使用局部细节与全局语义,但模型只在输入端接收一次、且只有单一层级的视觉信息。
现有方法要么将同一份视觉特征直接注入多个 LLM 层,缺少筛选,容易引入干扰;要么预先规定“第几个视觉层连接第几个语言层”,连接关系固定,无法随问题和解码上下文变化。
因此,仅仅“多传几层特征”并不足够。真正需要解决的是:在不同推理阶段,LLM 应该从哪些视觉层读取什么信息?
CLI 的核心思想可以浓缩成一句话:
视觉信息不应只在输入端传递一次,而应在 LLM 的解码过程中被反复、按需地查询。
CLI 从多个视觉层提取层级特征,并在多个 LLM 解码层设置注入点。每个注入点都不是机械地接收某个固定视觉层,而是根据当前隐藏状态,从完整视觉层级中动态选择信息,由此形成可学习的、交叉的“多对多”信息流。
当模型识别文字时,它可以重新读取浅层的笔画和纹理;当模型判断物体关系或回答开放问题时,它又可以结合深层的场景语义。LLM 不再只是视觉特征的被动接收者,而是一个能在推理过程中不断“回看图像”的主动观察者。
CLI 由两个相互配合的模块组成:Adaptive Multi-Projection(AMP) 和 Adaptive Gating Fusion(AGF)。

图:CLI 整体框架
浅层视觉特征偏向纹理和结构,深层特征偏向语义,两者的数据分布明显不同。共享一个固定投影器难以同时对齐它们,而为每一层训练完整投影器又会带来较大开销。
AMP 保留原有预训练投影器,同时为不同视觉层配置专属的 LoRA 适配分支。每个分支只需学习少量低秩参数,就能把对应视觉层映射到统一的语言表示空间。
可以把 AMP 理解为一个“多层视觉翻译器”:它保留各层的特征差异,又让这些信息最终以 LLM 能理解的方式表达出来。
获得更多视觉特征,只解决了“有没有信息”的问题,却没有解决“当前需不需要”的问题。无差别叠加可能造成信息过载,甚至破坏 LLM 已经形成的隐藏状态。
AGF 分别提炼候选视觉特征和当前 LLM 隐藏状态,再通过门控控制器生成动态权重,以决定哪些视觉信息应该注入、注入多少。
这一过程可以理解为模型不断追问:
“基于我现在已经理解的内容,还缺少哪些视觉证据?”
正是这种动态筛选,让 CLI 与简单的多层特征堆叠产生本质区别:模型不仅看得更多,而且知道什么时候该看什么。
作者将 CLI 集成到两套结构不同的 VLM 中:
·LLaVA-OneVision-0.5B/7B:采用 Qwen2 与 SigLIP;
·LLaVA-1.5-7B:采用 Vicuna-7B 与 CLIP。
评测覆盖图表与文档理解、通用视觉感知、多学科推理、真实场景问答、OCR 和视觉定位等 28 项任务。
在 LLaVA-OneVision-7B 上,相比相同数据重新训练的基线模型,CLI 取得了多项明显提升:
·LLaVA-in-the-Wild:68.0 → 74.5,+6.5
·OCR-Bench:+4.7
·MME:85.1 → 88.4,+3.3
·MMStar:54.1 → 56.5,+2.4
·28 项评测的性能增量合计达到 +19.06

图:CLI 在各项评测上的性能增量
在论文表 1 的九项任务中,LLaVA-OneVision-7B 的总分由 650.9 提升至 660.6,接近 InternVL-2-8B 的 660.9。
OCR 需要识别细小字符笔画,视觉定位则既要理解目标语义,又要判断空间位置。在 OCR 与九组 RefCOCO/+/g 评测上,CLI 均取得稳定提升,说明动态跨层融合可以同时服务于细节识别和全局理解。

图:CLI 在 OCR 与视觉定位任务上的结果
当 CLI 迁移到结构不同的 LLaVA-1.5-7B 后,两组评测的部分总分分别提升 7.5 和 8.6,表明该方法并不依赖某一特定主干,而是一种可接入不同 VLM 的通用融合框架。

图:CLI 的消融实验的结果
消融实验进一步揭示了 CLI 有效的关键。
在 LLaVA-OneVision-0.5B 的设置中,基线总分为 366.72,仅加入 AMP 后为 367.89,提升有限;仅加入 AGF 后达到 370.60;AMP 与 AGF 联合使用时进一步达到 371.51。
这说明:视觉信息的丰富程度只是基础,根据当前上下文筛选相关信息,才是多层视觉融合真正有效的关键。
作者还设计了参数量相近的静态 Parallel Fusion 作为对照,将第 i 个视觉层固定连接到第 i 个语言层。在 LLaVA-in-the-Wild 上,静态方案比基线下降 6.5 分,而 CLI 提升 6.5 分,两者相差超过 13 分。
因此,CLI 的收益并不是简单来自更多参数,而是来自动态、多对多的信息组织方式。
从实际案例中可以更直观地看到 CLI 的作用:
·面对艺术化字体时,基线模型生成了与图像无关的单词,CLI 的输出仍与真实笔画保持对应;
·当问题要求寻找“最大的白色单词”时,CLI 能结合局部文字和整体版式识别出“love”,基线则错误选择“EMBRACE”;
·在常识视觉问答中,CLI 的回答也更加稳定。

图:CLI 与基线模型的定性对比
这些结果表明,CLI 不只是提升了细粒度感知,也让 LLM 在生成答案时拥有更充分的视觉依据,从而减少由细节缺失带来的误识别和幻觉。
CLI 不需要重新设计视觉编码器或语言模型,而是从两者之间的连接方式入手,改善视觉信息进入 LLM 的路径:
·动态性:融合内容由当前解码上下文决定,而不是预先固定;
·通用性:已在 LLaVA-OneVision 与 LLaVA-1.5 两类架构上验证;
·参数高效:AMP 使用 LoRA 适配不同视觉层,避免为每层训练完整投影器。
在 LLaVA-OneVision-0.5B 的消融设置中,AMP + AGF 的总参数量约为基线的 104.37%。在 MMBench 单样本测试中,推理前向显存从 241.2 MB 增至 244.4 MB,增幅约 1.3%。
相比单纯扩大模型规模或增加训练数据,CLI 探索了另一条路径:让已经存在的层级视觉信息被更充分、更准确地使用。
为了方便更多研究者复现和使用,作者已在 Hugging Face 发布两个训练模型:
·CLI-0.5B:https://huggingface.co/codefuse-ai/CLI-0.5B
·CLI-7B:https://huggingface.co/codefuse-ai/CLI-7B
其中,CLI-0.5B 更适合快速测试、轻量部署和方法验证;CLI-7B 则适合追求更强多模态理解能力的评测与应用场景。相关训练和推理代码已同步开源在 GitHub:
https://github.com/codefuse-ai/CLI
欢迎大家试用、反馈,也欢迎基于 CLI 探索更多动态视觉-语言融合方式。
传统 VLM 将视觉编码器最后一层一次性送入语言模型,这种静态“一对一”连接压缩了丰富的视觉层级,也限制了 LLM 在推理过程中重新核对图像证据的能力。
CLI 将这一过程改造为动态“多对多”融合:AMP 负责对齐不同视觉层,AGF 负责根据当前上下文选择信息,多个跨层注入点则让 LLM 在解码过程中持续更新视觉理解。
作者希望这项工作能够传递一个简单但重要的观点:更强的多模态理解,不仅取决于视觉编码器看到了什么,也取决于语言模型能否在正确的时机访问正确的视觉信息。
本文系学术转载,如有侵权,请联系CVer小助手删文