转载自:视觉语言导航
✨导读:大模型加持的机器人导航,为何总陷入“决策黑箱”、泛化差、易过拟合的困境?传统方案直接输入输出映射无推理、思维链训练缺优质标签,难以落地。本文提出EvolveNav两阶段自进化具身推理框架,兼顾精度、可解释性与速度,在四大权威基准登顶SOTA,重新定义LLM视觉语言导航!
- 作者:Bingqian Lin, Yunshuang Nie, Khun Loun Zai, Ziming Wei, Mingfei Han, Rongtao Xu, Minzhe Niu, Jianhua Han, Hanwang Zhang, Liang Lin, Bokui Chen, Cewu Lu, Xiaodan Liang
- 单位:上海交通大学,中山大学深圳校区,鹏城实验室,广东省大数据分析与处理重点实验室,清华大学深圳国际研究生院,穆罕默德·本·扎耶德人工智能大学, Spatialtemporal AI,引望智能,南洋理工大学,中山大学
- 标题:EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
- 发表期刊:IEEE TPAMI 2026
- 论文链接:https://ieeexplore.ieee.org/abstract/document/11478375
- 项目链接:https://github.com/expectorlin/EvolveNav
🔍 研究背景:LLM导航的三大核心痛点
视觉语言导航(VLN)是具身AI的核心任务,简单说就是让机器人听懂人类自然语言指令,在真实室内环境自主走到目标位置,是服务机器人、智能家居、智能巡检的关键技术。
但当前基于大语言模型(LLM)的VLN方案,始终面临三大致命问题:
- 决策黑箱,无推理可解释性: 主流方法直接把视觉+语言输入映射为导航动作,没有中间推理步骤,机器人“怎么想的”完全未知,出问题无法溯源。
- 思维链(CoT)训练无优质标签: CoT能提升推理与精度,但导航场景复杂多变,不存在唯一正确的推理标签,人工标注成本极高、几乎无法完成。
- 固定标签训练易过拟合: 纯监督微调固定CoT标签,模型只会死记硬背,换到陌生环境立刻“迷路”,泛化能力极差。
为破解这些行业痛点,本文提出EvolveNav自进化具身推理框架,让大模型导航从“被动执行”变成“主动思考、自我优化”。
🚀 核心贡献:四大创新颠覆传统范式
- 首创自进化具身推理框架: 首次将自我优化理念引入LLM-VLN,通过两阶段训练实现自适应、可泛化的导航推理,填补具身大模型自优化技术空白。
- 形式化CoT标签,提速又增效: 摒弃冗余自由式推理,设计极简模板化CoT标签,推理速度提升3倍,同时激活模型导航推理能力。
- 自增强+自反思双机制,根治过拟合: 用模型自身正确推理做自增强标签,搭配正负样本对比的自反思任务,让模型自主学习正确推理模式,彻底摆脱固定标签束缚。
- 全基准SOTA,通用性拉满: 在R2R、CVDN、REVERIE、SOON四大权威VLN数据集上,任务专属训练、跨任务统一训练均超越所有同类方法,落地潜力拉满。
🛠️ 研究方法:两阶段自进化,从“会导航”到“会思考”
EvolveNav基于NaviLLM改进,整体架构包含场景编码器、LLM主干、动作预测头,核心是先激活推理→再自我进化的两阶段训练流程。
阶段1:形式化CoT监督微调——激活推理能力
这一阶段的目标是让模型先学会“有条理地推理”,同时保证推理速度。
- 极简形式化CoT标签构建通过Tag2Text图像描述模型提取视觉地标,结合导航方向信息,填充固定模板生成标签:
I should go to an observation with [地标] to the [方向] of me无冗余信息、格式统一,完美解决自由式CoT的低效问题。 - 训练目标公式总损失由动作决策损失+CoT生成损失加权组成:
- :导航动作预测损失
- :形式化思维链自回归生成损失
- :损失平衡系数,稳定训练
阶段2:自反思后训练——实现自我进化
解决固定标签过拟合问题,让模型边导航边优化自己的推理逻辑。
- 自增强CoT标签更新以动作是否正确为标准,动态替换标签,丰富监督多样性:
动作正确→用模型自身推理做新标签;动作错误→保留原始标签。
- 自反思辅助任务构建正确/错误推理样本对,让模型判别最优推理,强化正确逻辑学习。
- 最终训练目标
新增自反思损失,多目标协同优化,全面提升推理与导航能力。
推理模式:灵活适配场景
支持纯动作输出(追求速度)、推理+动作同步输出(追求可解释)两种模式,结果完全一致,兼顾工业落地与科研可解释性。
📊 实验验证:全维度吊打基线,性能拉满
实验配置
- 测试数据集:R2R、CVDN、REVERIE、SOON
- 训练范式:单任务专属训练、多任务跨数据集统一训练
- 对比基线:NaviLLM、NavGPT、NavCoT、MapGPT等主流LLM-VLN模型
- 核心指标:SR(成功率)、SPL(路径长度加权成功率)、NE(导航误差)、GP(目标进度)
关键实验结果
- R2R数据集: 相较基线NaviLLM,SPL提升3.2% ,导航误差显著降低,轨迹更短更精准。
- CVDN数据集: 目标进度GP达到7.07,大幅超越所有对比方法,对话导航能力领先。
- 跨任务统一训练: 一个模型适配全部4个数据集,全面超越NaviLLM,真正实现通用导航大模型。
消融实验:核心设计全验证
- 形式化CoT标签:比自由式CoT速度快3倍,精度更高;
- 自增强+自反思:单独使用均有增益,组合后效果最优;
- 地标+方向双信息:缺一不可,共同支撑精准导航推理。
可视化实证
通过决策过程、标签进化、地标提取可视化,直观证明EvolveNav能精准识别关键地标、生成合理推理,从根源避免导航错误。
🎯 研究结论:开启LLM具身导航新世代
本文提出的EvolveNav自进化具身推理框架,从根本上解决了LLM驱动视觉语言导航的三大核心痛点:
✅ 告别决策黑箱,推理过程清晰可解释
✅ 无需海量人工标注,自生成标签降低成本
✅ 根治过拟合,未知场景泛化能力拉满
✅ 推理速度大幅提升,适配实时导航场景
EvolveNav不仅在四大权威基准上实现SOTA,更为大模型具身AI提供了自进化推理的全新研究思路,未来可直接落地于服务机器人、智能巡检、家庭交互等真实场景,推动LLM导航从实验室走向产业应用。
本文系学术转载,如有侵权,请联系CVer小助手删文