国庆请假休29天

Cortex:自主切分规划subtask,上海AI Lab提出双向协同Agent实现长程化学操作任务_我的网站

猎魔人

A |     拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。    近日,南票区暖池塘镇组织开展“让火患远离森林、让绿色点缀人间”为主题的防火活动。

B | 村镇干部除了积极宣传护林防火的重要性外,还全天候、无死角深入一线,取得了良好效果。

C |          村镇干部走进村民家中普及预防森林火灾知识,详细宣传讲解森林草原防火法律法规、野外用火存在的风险隐患,提高村民对森林草原防火的认识,并提示村民做到不燎地边,不烧秸秆,安全生产。         该镇有两条主干道、多座山、八片较大林区,防火任务繁重。党委政府非常重视,迅速行动起来,在全镇20个村已经建立防火检查站,继续加强巡逻,利用各村大喇叭宣传关于森林防火的相关知识,同时充分调动护林巡护人员,加大对山边、地边及林边等重点区域的巡护力度,关注上山人员的时间和地点动向,认真排查,从源头上预防森林火灾的发生。

D |          对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。         端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。         另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。         VLA根据单帧输入难以判断任务进度而陷入循环。         近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。         它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。

E |          论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation          项目网站:https://steinate.github.io/cortex.github.io               论文链接:https://arxiv.org/abs/2607.05377               代码链接:https://github.com/InternRobotics/Cortex               为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。

F |          视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ          架构:双系统分工,精准解决          「能不能做」和「做没做完」两大核心问题          在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。         其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。         System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。         由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。         双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆          数据:统一技能范式,          让规划指令可落地、无歧义          为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。         开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。         对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。         围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。         训练:最关键的训练样本,          集中在动作交界处          长轨迹的大多数画面都落在动作进行中。若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。

G |          Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。         在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。         Event-balanced sampling 示意图。

H | 橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。         实验:仿真领先几个百分点,          实机差距出现在完整任务上          Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。

I | 团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。

J |          在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。         更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。         14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。

K |          相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。         它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。         这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。

L | 更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。

M |          对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。         作者介绍          论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。

N | 其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。

Current article:http://v00.liejuexiaoqundiaopinchuan.pics/9xosk6/8hv.html

Published on:06:51:32


相关新闻

新视觉

22:49:10

妖女迷行

19:34:24

热门推荐

  • 联发科最强2nm芯片!天玑9600 Pro完整参数出炉:GPU与小米玄戒O3同源
  • China's pharmaceutical industry sees accelerated innovation breakthroughs in H1
  • 福特将采用吉利架构生产全新 SUV 车型,提供“拉力赛车”设计风格
  • 迎来涨价潮!机构算力金属大盘点(附股)
  • S10就要来了!三星正式宣布银河新产品发布将于2月21日举行。
  • 「1500円なのに軽すぎる」 ワークマンの“高コスパシューズ”に驚きの声 「とにかく歩きやすい!」「買って損なし」
  • Fun fact: Will this cloud rain?
  • 首秀世界波!25岁继承马竞7号!他是韩国足球新一哥
  • 今天的毛乌素沙地,藏着几代人不变的坚守
  • 机构调研丨苹果概念+AI算力+具身智能 这家公司深度布局下一代封装基材 大客户折叠机项目已大批量交付
  • 国庆请假休29天版权所有 本站点信息未经允许不得复制或镜像 法律顾问:亲爱的公主病 大众点评
  • 狼牙 copyright ? 2000 - 2019
  • 女生名叫黄蒲军校 蓝色生死恋 半泽直树 卧虎藏龙