
TempoFit:面向长程视觉-语言-动作操作的即插即用逐层时序 KV 记忆
IROS 2026 IEEE/RSJ 国际智能机器人与系统会议
一种免训练的改造方法:通过缓存中间层前缀 K/V 状态,让冻结的 VLA 策略获得历史感知能力,既不改动参数也不加长输入。在 LIBERO-Long 上使 π0.5 提升 4.0 个百分点,真机 Realman RM-65B 上整任务成功率最高提升 14.2%。
我的方向是具身操作(embodied manipulation),目前处于 gap year。我在西交利物浦大学,由岳永教授与陈亚冉教授指导,同时与南京大学机器人与自动化学院的吕尚可老师合作;此前曾在西湖机器人实习。
同一个问题的两半——如何表征世界,以及如何依照这一表征去行动。
构建能在开放环境中稳健泛化、完成长程复杂操作任务的具身系统。
我研究具身智能体如何理解并表征世界,并让系统以与这一内部表征相一致的方式行动。
现有 VLA 操作系统在长程、复杂、开放环境任务上失效,根源在于缺乏对任务相关状态、时序依赖与转移条件的稳定表征——鲁棒性、泛化能力与成功率因此被同时压低。我的工作是为 VLA 引入更强的状态建模与决策支持机制。
具身操作与世界表征方向的代表工作。 全部论文 →

IROS 2026 IEEE/RSJ 国际智能机器人与系统会议
一种免训练的改造方法:通过缓存中间层前缀 K/V 状态,让冻结的 VLA 策略获得历史感知能力,既不改动参数也不加长输入。在 LIBERO-Long 上使 π0.5 提升 4.0 个百分点,真机 Realman RM-65B 上整任务成功率最高提升 14.2%。

合作过的课题组与工业团队。 完整简历 →




