JS 孙珺

简历

孙珺 · luciojunsun@gmail.com · github.com/LucioSunj · 微信 qw2667180048 · 下载 PDF

教育背景

信息与计算科学 理学学士

西交利物浦大学 · 中国 苏州

  • GPA 3.94 / 4.00  ·  专业 GPA 4.00 / 4.00(专业第一)
  • 雅思 7.5(听力 8.0,阅读 9.0)
2022.09 – 2026.07

论文

TempoFit:面向长程视觉-语言-动作操作的即插即用逐层时序 KV 记忆

J. Sun, B. Yang, J. Zhang, N. Ma, C. Wu, S. Zhang, Y. Huang, Q. Wang, S. Liang, Y. Chen

IROS 2026 IEEE/RSJ 国际智能机器人与系统会议

一种免训练的改造方法:通过缓存中间层前缀 K/V 状态,让冻结的 VLA 策略获得历史感知能力,既不改动参数也不加长输入。在 LIBERO-Long 上使 π0.5 提升 4.0 个百分点,真机 Realman RM-65B 上整任务成功率最高提升 14.2%。

2026

MiTPose:面向人体姿态估计的多粒度引导视觉 Transformer

Y. Wu, Q. Gao, Y. Liu, J. Sun, Z. Li, Y. Jin, Y. Yue, X. Zhu

INDIN 2025 IEEE 国际工业信息学会议

2025

科研经历

机器人操作中的世界-动作模型与强化学习 进行中

研究助理 · 南京大学 机器人与自动化学院 · 导师:吕尚可 教授

  • 围绕机器人操作的世界-动作模型与强化学习开展研究:策略如何表征未来状态,以及在长程任务中如何分配这类预测能力。
2026.03 – 至今

TempoFit:面向长程视觉-语言-动作操作的免训练时序 KV 记忆

研究助理 · 导师:陈亚冉 教授

无记忆的 VLA 策略在长程任务中会受遮挡、状态混淆与动作后细微变化的困扰,因此需要一种无需重训练、也不改动架构的高效时序推理机制。

  • 时序记忆设计:提出 TempoFit——一种免训练的改造方案,通过缓存中间层前缀 K/V 状态为冻结的 VLA 策略引入历史感知,且不改变参数与输入长度。
  • 检索与融合:设计带帧间隔时序偏置的 K-to-K 检索与保范残差加载,抑制过时上下文并在冻结权重下最小化分布偏移。
  • 基准结果:LIBERO-Long 上 π0.5 从 92.6% 提升至 96.6%,QwenGR00T 从 90.8% 提升至 94.4%,在 CALVIN 上同样稳定提升。
  • 真机验证:在 Realman RM-65B 上完成三个多阶段任务验证,整任务成功率最高提升 14.2%,延迟与显存开销增加有限。
2025.11 – 2026.03

基于 Octo 框架与三维深度感知的多模态具身智能模型训练

研究助理 · 导师:陈亚冉 教授

仅依赖 RGB 的语言引导操作会受几何歧义、遮挡与 Sim-to-Real 偏移的限制;鲁棒的 VLA 需要显式的三维信息来支撑稳定的抓取决策。

  • 深度感知融合:引入单目深度分支提取多尺度几何特征,与 Octo 表征对齐,并通过带 FiLM 调制的门控交叉注意力注入,未改动 Octo VLA 主体架构。
  • 数据集构建:基于 RGB 序列生成单目深度扩展 Bridge,构建 RGB–深度–语言语料,并采集遥操作真机 RGB-D 数据用于微调与 Sim-to-Real 对齐。
  • 训练与评测:行为克隆结合强化学习微调,将未见物体抓取成功率从约 77% 提升至约 89%,并通过对抗遮挡与深度噪声测试验证鲁棒性。
  • 研究贡献:与 OpenVLA 等基线对比以分离深度信息带来的增益;参与撰写技术报告并主持每周评审,推动架构与流水线可靠性改进。
2025.01 – 2025.06

UDF 引导 3DGS 的室内三维重建与新视角合成

研究助理 · 导师:岳永 教授

在弱纹理室内场景中,以外观驱动的三维重建易出现几何歧义与优化不稳定,限制了表面精度与新视角合成质量。

  • 建模:构建 NeRF 式 UDF(无符号距离 + 法向)并与 3DGS 渲染器耦合,采用特征—几何联合损失与法向/深度一致性正则,提升弱纹理下的稳定性。
  • 优化与剪枝:设计多阶段 UDF 引导优化——先粗几何初始化,再细化高斯位置、尺度与不透明度——并用体素分区高效执行克隆/剪枝,使基元集中于零水平集附近。
  • 评测:基于 COLMAP 标定与点云初始化处理 ScanNet++,以 Chamfer Distance 与 PSNR 评估,优于多个强基线。
2024.05 – 2024.12

工作与科研经历

算法研发部 实习生

西湖机器人 · 中国 杭州

可形变物体操作的难点在于:物体状态连续变化、观测局部且易被遮挡,而微小的感知误差会在长程执行中不断累积,放大为不稳定的动作。

  • 任务设计与评测:设计折叠、展开、堆叠等真机实验协议,并建立量化指标衡量感知—动作决策质量。
  • 真机数据与训练:主导真机数据采集与处理,基于真机数据微调模型,并跨任务、跨本体做大规模预训练以提升迁移能力。
  • 端到端流水线:搭建标注、数据转换、模型训练到在线推理的完整链路,并通过分布式训练与推理优化提升可部署性。
  • 系统集成:完成灵巧手叠毛巾 demo,并主导双臂长程叠衣任务;为国内首个(继 Figure 之后)在真实机器人平台上实现灵巧手叠毛巾的团队。
2025.06 – 2025.10

奖励与荣誉

  • 2025/26西交利物浦大学 学业优秀奖(前 5%)
  • 2024/25西交利物浦大学 学业优秀奖(前 5%)
  • 2023/24西交利物浦大学 学业优秀奖(前 5%)

技能

  • 编程与机器学习Python、Java、PyTorch、JAX
  • 具身智能与机器人视觉-语言-动作模型(Octo、OpenVLA、π0)、世界-动作模型、强化学习
  • 数学基础微积分、线性代数、概率论
  • 语言中文(母语)、英语(流利,雅思 7.5)、西班牙语(流利)