首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI为机器人构建多样化虚拟训练场

AI为机器人构建多样化虚拟训练场

原创
作者头像
用户11764306
发布2026-01-17 07:19:54
发布2026-01-17 07:19:54
2480
举报

聊天机器人如ChatGPT和Claude在过去三年中经历了使用量的飞速增长,因为它们可以帮助完成广泛的任务。无论是撰写莎士比亚风格的十四行诗、调试代码,还是回答冷门琐事问题,人工智能系统似乎都能满足需求。这种多功能性的来源是什么?是互联网上数十亿甚至数万亿的文本数据点。

然而,这些数据并不足以教会机器人成为有用的家庭或工厂助手。为了理解如何在多样环境中处理、堆叠和放置各种物品排列,机器人需要演示。你可以将机器人训练数据视为一系列“操作指南”视频,引导系统完成任务的每一个动作。在真实机器人上收集这些演示既耗时又无法完美复现,因此工程师们通过用AI生成模拟(通常不能反映真实世界的物理特性)或从零开始费力地手工制作每个数字环境来创建训练数据。

某机构计算机科学与人工智能实验室和某机构的研究人员可能找到了一种方法,可以创建机器人所需的多样化、逼真的训练场。他们的“可引导场景生成”方法创建了厨房、客厅和餐厅等数字场景,工程师可以用这些场景来模拟大量的真实世界交互和情境。该工具在超过4400万个充满桌子、盘子等物体模型的3D房间上进行训练,将现有资产放置在新场景中,然后将每个场景细化为物理精确、逼真的环境。

可引导场景生成通过“引导”扩散模型(一种从随机噪声生成视觉图像的AI系统)走向日常生活场景来创建这些3D世界。研究人员使用这种生成系统来“修补”环境,填充整个场景中的特定元素。你可以想象一个空白画布突然变成一个散落着3D物体的厨房,这些物体逐渐被重新排列成一个模仿真实世界物理的场景。例如,该系统确保叉子不会穿过桌子上的碗——这是3D图形中常见的一种称为“穿透”的故障,即模型重叠或相交。

然而,可引导场景生成究竟如何引导其创作走向真实感,取决于你选择的策略。其主要策略是“蒙特卡洛树搜索”,即模型创建一系列备选场景,以不同的方式填充它们以实现特定目标(例如使场景更加物理真实,或包含尽可能多的可食用物品)。该策略被AI程序AlphaGo用来在围棋(一种类似象棋的游戏)中击败人类对手,因为系统在做出最有利的选择之前会考虑潜在的移动序列。

“我们是第一个通过将场景生成任务构建为顺序决策过程,将MCTS应用于场景生成的人,”某机构电气工程与计算机科学系博士生Nicholas Pfaff说道,他也是CSAIL的研究员和介绍这项工作的论文的主要作者。“我们不断在部分场景的基础上进行构建,以随着时间的推移产生更好或更符合期望的场景。因此,MCTS创造的场景比扩散模型训练时所见的场景更为复杂。”

在一个特别能说明问题的实验中,MCTS将一个简单餐厅场景中的物品数量增加到最大。在平均仅训练了17个物体的场景后,它在一个桌子上摆放了多达34件物品,包括堆积如山的中式点心盘。

可引导场景生成还允许通过强化学习来生成多样化的训练场景——本质上,通过试错教导扩散模型完成目标。在初始数据上训练后,系统会经历第二个训练阶段,在此阶段中,你需要设定一个奖励(基本上是一个期望的结果,附带一个分数来指示你距离该目标的接近程度)。模型自动学习创造得分更高的场景,通常会产生与其训练场景差异很大的情境。

用户也可以通过输入特定的视觉描述(如“一张厨房桌子,上面有四个苹果和一个碗”)直接提示系统。然后,可引导场景生成可以精确地将你的请求变为现实。例如,该工具在构建食品储藏室货架场景时准确遵循用户提示的比例为98%,在构建凌乱的早餐桌场景时为86%。这两项指标都比“MiDiffusion”和“DiffuScene”等类似方法至少提高了10%。

该系统还可以通过提示或简单指令(如“使用相同的物体构思一个不同的场景布局”)来完成特定场景。例如,你可以要求它将苹果放在厨房桌子的几个盘子上,或者将棋盘游戏和书籍放在架子上。它本质上是通过将物品放入空白区域来“填空”,同时保留场景的其余部分。

根据研究人员的说法,他们项目的优势在于能够创建大量机器人专家实际可以使用的场景。“我们研究结果的一个关键见解是,我们预训练的场景不完全像我们实际想要的场景是可以接受的,”Pfaff说。“使用我们的引导方法,我们可以超越那个宽泛的分布,从‘更好’的分布中采样。换句话说,生成我们真正希望用来训练机器人的多样化、真实且与任务对齐的场景。”

这些广阔的场景成为了测试场地,他们可以在其中记录虚拟机器人与不同物品的交互。例如,机器人在各种3D设置中小心翼翼地将叉子和刀放入餐具架,或将面包重新排列到盘子上。每个模拟都显得流畅而逼真,类似于未来可引导场景生成可能帮助训练的现实世界适应性机器人。

虽然该系统可能是为机器人生成大量多样化训练数据的一个有希望的途径,但研究人员表示他们的工作更像是一个概念验证。未来,他们希望使用生成式AI创造全新的物体和场景,而不是使用固定的资产库。他们还计划加入关节物体(机器人可以打开或扭转的物体,如橱柜或装满食物的罐子),使场景更具交互性。

为了使他们的虚拟环境更加真实,Pfaff和他的同事们可能会通过使用从互联网图像中提取的物体和场景库,并利用他们之前关于“可扩展的真实到模拟”的工作,来整合真实世界的物体。通过扩展AI构建的机器人测试场的多样性和逼真度,该团队希望建立一个用户社区,创造大量数据,然后这些数据可以用作一个庞大的数据集,来教授灵巧的机器人各种技能。

“如今,为模拟创建真实场景可能是一项相当具有挑战性的工作;程序化生成可以轻松产生大量场景,但它们可能无法代表机器人在现实世界中会遇到的环境。手动创建定制场景既耗时又昂贵,”未参与论文的某中心机器人部门应用科学家Jeremy Binagia说。“可引导场景生成提供了一种更好的方法:在一个大型现有场景集合上训练生成模型,并使其(使用强化学习等策略)适应特定的下游应用。与之前利用现成的视觉语言模型或仅专注于在2D网格中排列物体相比,这种方法保证了物理可行性,并考虑了完整的3D平移和旋转,从而能够生成更有趣的场景。”

“具有后训练和推理时搜索的可引导场景生成,为大规模自动化场景生成提供了一个新颖而高效的框架,”同样未参与论文的某机构机器人专家Rick Cory SM '08, PhD '10说。“此外,它可以生成被认为对下游任务很重要的‘前所未见’的场景。未来,将该框架与海量互联网数据相结合,可能为实现有效训练机器人以部署在现实世界中解锁一个重要里程碑。”

Pfaff与资深作者Russ Tedrake(某机构电气工程与计算机科学、航空航天与机械工程的某中心教授,某机构的高级副总裁,兼CSAIL首席研究员)共同撰写了论文。其他作者包括某机构机器人研究员Hongkai Dai SM '12, PhD '16;团队负责人兼高级研究科学家Sergey Zakharov;以及卡内基梅隆大学博士生Shun Iwase。他们的工作部分得到了某中心和某机构的研究支持。研究人员于九月在机器人学习会议上展示了他们的工作。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档