首页 > 汽车自驾 > 汽车自驾 > 机器人慢半拍难题:南洋理工解决VLA致命短板,动态世界断层领先

机器人慢半拍难题:南洋理工解决VLA致命短板,动态世界断层领先

发布时间:2026-02-10 17:35:55

过去几年中,Vision-Language-Action(VLA)模型迅速成为机器人领域的焦点:机器人可以 “看懂” 画面、“理解” 语言指令,并直接输出连续动作,在静态抓取、摆放、桌面操作等任务中取得了显著进展。

但一个长期被忽视的问题是 ——真实世界几乎从来不是静态的。当物体开始移动、加速、碰撞、改变轨迹,当前主流 VLA 模型往往会出现反应迟缓、动作失配、甚至完全失败的情况。

问题不在于模型不聪明,而在于:它们跟不上时间。

近日,来自 NTU S-Lab 的研究团队提出 DynamicVLA,首次系统性地从模型架构、推理机制和数据体系三个层面,重新审视并解决动态物体操控(Dynamic Object Manipulation)这一长期空缺的问题。

 

想深入了解 DynamicVLA 的技术细节?我们已经为你准备好了完整的论文、项目主页和代码仓库!



 

  • 论文链接:https://arxiv.org/abs/2601.22153
  • 项目链接:https://haozhexie.com/project/dynamic-vla/
  • GitHub 链接:https://github.com/hzxie/DynamicVLA

 

为什么 “动态操控” 对 VLA 来说如此困难?



在静态场景中,VLA 模型通常遵循如下流程:

 

感知 → 推理 → 生成一段动作 → 执行完 → 再次推理

 

当环境基本不发生变化时,这种方式可以正常工作;但一旦物体开始运动,这一流程便迅速失效。

问题并不在于模型能力不足,而在于时间结构本身不适用于动态世界,主要体现在两个方面:

 

  1. 感知 — 执行时间错位(Perception–Execution Gap):由于推理存在不可避免的延迟,当模型完成决策时,物体状态早已发生变化,动作天然 “滞后于现实”。
  2. 动作分块等待(Inter-chunk Waiting):多数 VLA 必须等上一段动作完全执行后才能启动下一次推理,使机器人在动态环境中始终处于被动追赶状态。

 

这两个问题叠加,使得即便在静态任务中表现良好的 VLA,也难以应对真实世界中的动态操控。

DynamicVLA 的核心思路:让机器人 “边想边做”



DynamicVLA 并没有选择通过增大模型来 “预测更远的未来”,而是围绕一个更根本的问题重新设计系统:

 

在推理延迟无法消除的情况下,如何保证机器人执行的动作仍然与当前世界状态时间对齐?

 

为此,DynamicVLA 从推理机制、执行策略和模型结构三个层面提出了对应设计。

1. Continuous Inference:让推理与执行不再相互等待

在传统 VLA 中,推理与执行严格串行;

而 Continuous Inference(连续推理)允许模型在上一段动作尚未执行完时,就启动下一轮推理,从而解决的是 Inter-chunk Waiting 带来的反应迟滞问题:

 

  • 推理与执行形成流水线
  • 不再存在 “动作执行完才能继续思考” 的空窗期
  • 机器人始终保持一个持续更新的动作预测流

 

2. Latent-aware Action Streaming:修复推理延迟造成的时间错位

即使采用连续推理,推理延迟本身仍然存在。这意味着:模型生成动作时所依据的观察,往往已经落后于真实世界。Latent-aware Action Streaming(LAAS)正是针对这一Perception–Execution Gap设计的执行机制:

 

  • 显式丢弃因推理延迟而 “过时” 的动作
  • 只执行在时间上仍与当前环境状态对齐的预测
  • 当新预测到来时,优先采用更新、更接近当前状态的动作

 

3. 为动态而生的轻量化 VLA 架构

上述机制能否成立,还依赖于足够低的推理延迟。因此 DynamicVLA 采用了专为动态操控设计的轻量化架构:

 

  • 卷积式视觉编码器,避免多帧输入下 token 爆炸
  • 截断语言模型层数,在速度与理解能力之间取得平衡
  • 整体模型规模控制在 0.4B 参数量级

 

动态操控数据的核心缺口:从仿真到真实世界

汽车自驾更多>>

ICLR 2026 | SEINT:高效的跨空间刚体不变度量 1700个OpenClaw Skills,我用多邻国的方式学会的! 想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下 2026开年关键词:Self-Distillation,大模型真正走向持续学习 机器人慢半拍难题:南洋理工解决VLA致命短板,动态世界断层领先 蚂蚁投了一家上海具身智能公司 华为发布业界首个扩散语言模型Agent,部分场景提速8倍! 中国信通院:2025年12月国内市场手机出货量2447.3万部 同比下降29.1% 荣耀WIN系列手机全面适配《三角洲行动》游戏原生165超高帧 AYANEO Pocket PLAY游戏手机官宣搭载天玑9300处理器 高通骁龙8 Elite Gen6 Pro特调版偷跑:采用2nm工艺 三星独占 国产开源模型卷赢Gemini 3 Pro、GPT-5.2,最强多模态推理大模型易主? 阿里加入春节档红包大战 千问APP春节期间将向用户推红包福利 “中国上海”门户网站数据出境专区正式上线 谷歌工程师抛出5个残酷问题:未来两年,软件工程还剩下什么? 京东健康发布AI产品“知医” 百万粉丝博主“稚晖君”在账号发介绍公司机器人视频,引发监管问询!公司紧急回应 亚洲最大宜家关门,意味着什么? 国家统计局:CPI低位运行既与国内外宏观经济形势复杂变化有关 也与我国发展阶段相关 北京买房选销冠,招商序跨代好房引爆亦庄 安克与飞书联合发布“安克AI录音豆” :录音可在飞书中被AI调用,售价899元 花旗:上调信义玻璃(00868)汽车玻璃业务估值倍数 目标价升至9.01港元 “活字”盘活长城汽车 “归元”回归造车本源 阿里千问加入“一句话点外卖” 不用等了,丰田GR GT准备“截胡”下一代日产GT-R! 全新小鹏G01谍照,超5m大六座SUV,“广州揽胜”吗? 本田换标 能否换量|汽势观察 黄金、白银双双创历史新高,有金饰品牌较前日上涨29元/克 解码基金“擒牛术”:布局十倍股的三大核心逻辑 人工智能板块,20%批量涨停!920207,连续30%封板!