arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-08-24 至 2026-08-24 共收录 2
2608.21247 2026-08-24 cs.CV cs.RO 新提交

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21030 2026-08-24 cs.CV cs.CL cs.LG 新提交

COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET:面向视频多模态大语言模型的对比运动增强时序推理

Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Sun Yat-Sen University(中山大学) Pingan Technology(平安科技)

AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏