arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-08-27 至 2026-08-27 共收录 5
2608.26095 2026-08-27 cs.CV cs.AI 新提交

A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态无监督持续后训练的视觉依赖感知框架

Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对多模态无监督持续后训练中现有方法忽略视觉依赖的问题,提出含VC-OT和VMA组件的VDA框架,可同时维持旧任务稳定性与新任务可塑性,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25872 2026-08-27 cs.RO 新提交

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

VISTA:用于接触丰富操作的视觉推断空间接触注意力机制

Jiayi Chen, Wenlong Dong, Yan Huang, Xianglin Chen, Zijian Lin, Jiaqi Yin, Yushan Liu, Wenbo Ding

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Southern University of Science and Technology(南方科技大学) School of Future Technology, Harbin Institute of Technology(哈尔滨工业大学未来技术学院)

AI总结 针对接触丰富操作的视觉反馈不足问题,提出基于VDF的VISTA-Policy,通过整合物理感知编码引擎等模块,在多任务上优于纯视觉与触觉基准,具分布外泛化及抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00686 2026-08-27 cs.RO 版本更新

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Hongxun Yao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: this https URL (https://weihaotan.github.io/StarDojo)

详情

展开后加载摘要…

URL PDF HTML 收藏