首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >顶刊TPAMI 2026!自进化推理破局导航难题!LLM驱动视觉语言导航全新范式

顶刊TPAMI 2026!自进化推理破局导航难题!LLM驱动视觉语言导航全新范式

作者头像
Amusi
发布2026-07-13 18:39:10
发布2026-07-13 18:39:10
1450
举报
文章被收录于专栏:CVerCVer

转载自:视觉语言导航

✨导读:大模型加持的机器人导航,为何总陷入“决策黑箱”、泛化差、易过拟合的困境?传统方案直接输入输出映射无推理、思维链训练缺优质标签,难以落地。本文提出EvolveNav两阶段自进化具身推理框架,兼顾精度、可解释性与速度,在四大权威基准登顶SOTA,重新定义LLM视觉语言导航!

  • 作者:Bingqian Lin, Yunshuang Nie, Khun Loun Zai, Ziming Wei, Mingfei Han, Rongtao Xu, Minzhe Niu, Jianhua Han, Hanwang Zhang, Liang Lin, Bokui Chen, Cewu Lu, Xiaodan Liang
  • 单位:上海交通大学,中山大学深圳校区,鹏城实验室,广东省大数据分析与处理重点实验室,清华大学深圳国际研究生院,穆罕默德·本·扎耶德人工智能大学, Spatialtemporal AI,引望智能,南洋理工大学,中山大学
  • 标题:EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
  • 发表期刊:IEEE TPAMI 2026
  • 论文链接:https://ieeexplore.ieee.org/abstract/document/11478375
  • 项目链接:https://github.com/expectorlin/EvolveNav

🔍 研究背景:LLM导航的三大核心痛点

视觉语言导航(VLN)是具身AI的核心任务,简单说就是让机器人听懂人类自然语言指令,在真实室内环境自主走到目标位置,是服务机器人、智能家居、智能巡检的关键技术。

但当前基于大语言模型(LLM)的VLN方案,始终面临三大致命问题:

  1. 决策黑箱,无推理可解释性: 主流方法直接把视觉+语言输入映射为导航动作,没有中间推理步骤,机器人“怎么想的”完全未知,出问题无法溯源。
  2. 思维链(CoT)训练无优质标签: CoT能提升推理与精度,但导航场景复杂多变,不存在唯一正确的推理标签,人工标注成本极高、几乎无法完成。
  3. 固定标签训练易过拟合: 纯监督微调固定CoT标签,模型只会死记硬背,换到陌生环境立刻“迷路”,泛化能力极差。

为破解这些行业痛点,本文提出EvolveNav自进化具身推理框架,让大模型导航从“被动执行”变成“主动思考、自我优化”。

🚀 核心贡献:四大创新颠覆传统范式

  1. 首创自进化具身推理框架: 首次将自我优化理念引入LLM-VLN,通过两阶段训练实现自适应、可泛化的导航推理,填补具身大模型自优化技术空白。
  2. 形式化CoT标签,提速又增效: 摒弃冗余自由式推理,设计极简模板化CoT标签,推理速度提升3倍,同时激活模型导航推理能力。
  3. 自增强+自反思双机制,根治过拟合: 用模型自身正确推理做自增强标签,搭配正负样本对比的自反思任务,让模型自主学习正确推理模式,彻底摆脱固定标签束缚。
  4. 全基准SOTA,通用性拉满: 在R2R、CVDN、REVERIE、SOON四大权威VLN数据集上,任务专属训练、跨任务统一训练均超越所有同类方法,落地潜力拉满。

🛠️ 研究方法:两阶段自进化,从“会导航”到“会思考”

EvolveNav基于NaviLLM改进,整体架构包含场景编码器、LLM主干、动作预测头,核心是先激活推理→再自我进化的两阶段训练流程。

阶段1:形式化CoT监督微调——激活推理能力

这一阶段的目标是让模型先学会“有条理地推理”,同时保证推理速度。

  1. 极简形式化CoT标签构建通过Tag2Text图像描述模型提取视觉地标,结合导航方向信息,填充固定模板生成标签:I should go to an observation with [地标] to the [方向] of me无冗余信息、格式统一,完美解决自由式CoT的低效问题。
  2. 训练目标公式总损失由动作决策损失+CoT生成损失加权组成:
  • :导航动作预测损失
  • :形式化思维链自回归生成损失
  • :损失平衡系数,稳定训练

阶段2:自反思后训练——实现自我进化

解决固定标签过拟合问题,让模型边导航边优化自己的推理逻辑

  1. 自增强CoT标签更新以动作是否正确为标准,动态替换标签,丰富监督多样性:

动作正确→用模型自身推理做新标签;动作错误→保留原始标签。

  1. 自反思辅助任务构建正确/错误推理样本对,让模型判别最优推理,强化正确逻辑学习。
  2. 最终训练目标

新增自反思损失,多目标协同优化,全面提升推理与导航能力。

推理模式:灵活适配场景

支持纯动作输出(追求速度)、推理+动作同步输出(追求可解释)两种模式,结果完全一致,兼顾工业落地与科研可解释性。

📊 实验验证:全维度吊打基线,性能拉满

实验配置

  • 测试数据集:R2R、CVDN、REVERIE、SOON
  • 训练范式:单任务专属训练、多任务跨数据集统一训练
  • 对比基线:NaviLLM、NavGPT、NavCoT、MapGPT等主流LLM-VLN模型
  • 核心指标:SR(成功率)、SPL(路径长度加权成功率)、NE(导航误差)、GP(目标进度)

关键实验结果

  1. R2R数据集: 相较基线NaviLLM,SPL提升3.2% ,导航误差显著降低,轨迹更短更精准。
  2. CVDN数据集: 目标进度GP达到7.07,大幅超越所有对比方法,对话导航能力领先。
  3. 跨任务统一训练: 一个模型适配全部4个数据集,全面超越NaviLLM,真正实现通用导航大模型

消融实验:核心设计全验证

  • 形式化CoT标签:比自由式CoT速度快3倍,精度更高;
  • 自增强+自反思:单独使用均有增益,组合后效果最优;
  • 地标+方向双信息:缺一不可,共同支撑精准导航推理。

可视化实证

通过决策过程、标签进化、地标提取可视化,直观证明EvolveNav能精准识别关键地标、生成合理推理,从根源避免导航错误。

🎯 研究结论:开启LLM具身导航新世代

本文提出的EvolveNav自进化具身推理框架,从根本上解决了LLM驱动视觉语言导航的三大核心痛点:

✅ 告别决策黑箱,推理过程清晰可解释

✅ 无需海量人工标注,自生成标签降低成本

✅ 根治过拟合,未知场景泛化能力拉满

✅ 推理速度大幅提升,适配实时导航场景

EvolveNav不仅在四大权威基准上实现SOTA,更为大模型具身AI提供了自进化推理的全新研究思路,未来可直接落地于服务机器人、智能巡检、家庭交互等真实场景,推动LLM导航从实验室走向产业应用。

本文系学术转载,如有侵权,请联系CVer小助手删文

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-09,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 CVer 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 🔍 研究背景:LLM导航的三大核心痛点
  • 🚀 核心贡献:四大创新颠覆传统范式
  • 🛠️ 研究方法:两阶段自进化,从“会导航”到“会思考”
    • 阶段1:形式化CoT监督微调——激活推理能力
    • 阶段2:自反思后训练——实现自我进化
    • 推理模式:灵活适配场景
  • 📊 实验验证:全维度吊打基线,性能拉满
    • 实验配置
    • 关键实验结果
    • 消融实验:核心设计全验证
    • 可视化实证
  • 🎯 研究结论:开启LLM具身导航新世代
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档