arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-05 至 2025-12-05 共收录 9
2512.05111 2025-12-05 cs.CV

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04939 2025-12-05 cs.CV

LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging

LiteVGGT: 通过几何感知的缓存标记合并提升基础VGGT

Zhijian Shu, Cheng Lin, Tao Xie, Wei Yin, Ben Li, Zhiyuan Pu, Weize Li, Yao Yao, Xun Cao, Xiaoyang Guo, Xiao-Xiao Long

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Horizon Robotics Nanjing University(南京大学) Zhejiang University(浙江大学) Macau University of Science and Technology(澳门科技大学) TARS Robotics China Mobile Zijin Innovation Institute(中国移动吉林创新研究院)

AI总结 LiteVGGT通过几何感知的缓存标记合并提升基础VGGT的效率,实现10倍加速和内存减少,适用于大规模3D重建场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04404 2025-12-05 cs.RO

Bridging Probabilistic Inference and Behavior Trees: An Interactive Framework for Adaptive Multi-Robot Cooperation

弥合概率推断与行为树:一种交互框架用于自适应多机器人协作

Chaoran Wang, Jingyuan Sun, Yanhui Zhang, Changju Wu

机构 * School of Aeronautic and Astronautics, Zhejiang University(航空航天学院,浙江大学) Shanghai Huawei Technologies Co., Ltd(上海华为技术有限公司)

AI总结 本文提出IIBT框架,结合概率推断与行为树,实现多机器人自适应协作,实验表明其能显著降低复杂度并保持鲁棒性。

Comments 34 pages, is submitted RAS Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10901 2025-12-05 cs.CV cs.AI cs.LG

A Gray-box Attack against Latent Diffusion Model-based Image Editing by Posterior Collapse

针对基于潜在扩散模型的图像编辑的灰盒攻击

Zhongliang Guo, Chun Tong Lei, Lei Fang, Shuai Zhao, Yifei Qian, Jingyu Lin, Zeyu Wang, Cunjian Chen, Ognjen Arandjelović, Chun Pong Lau

机构 * School of Computer Science, University of St Andrews(圣安德鲁大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Data Science and Artificial Intelligence, Monash University(墨尔本大学数据科学与人工智能系) College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文提出了一种基于后验崩溃现象的灰盒攻击方法,通过调整参数实现两种崩溃类型,有效防止未经授权的图像编辑,且对模型依赖低,计算效率高。

Comments 15 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04496 2025-12-05 cs.CV

Shift-Window Meets Dual Attention: A Multi-Model Architecture for Specular Highlight Removal

移位窗口与双注意力机制:一种多模型架构用于镜面高光去除

Tianci Huo, Lingfeng Qi, Yuhan Chen, Qihong Xue, Jinyuan Shao, Hai Yu, Jie Li, Zhanhua Zhang, Guofa Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Artificial Intelligence Center, Geely Automotive Research Institute(吉利汽车研究院人工智能中心)

AI总结 本文提出多模型架构MM-SHR,结合卷积与注意力机制,有效去除不同尺度的镜面高光,提升视觉任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19035 2025-12-05 cs.CV cs.AI

Changes in Gaza: DINOv3-Powered Multi-Class Change Detection for Damage Assessment in Conflict Zones

加沙的变化:基于DINOv3的多类变化检测用于冲突区损害评估

Kai Zheng, Zhenkai Wu, Fupeng Wei, Miaolan Zhou, Kai Lie, Haitao Guo, Lei Ding, Wei Zhang, Hang-Cheng Dong

机构 * School of Computer Science and Technology(计算机科学与技术学院) Zhejiang University(浙江大学) School of Software Technology(软件学院) School of Information Engineering(信息工程学院) North China University of Water Resources and Electric Power(北方水利电力大学) Polytechnic Institute Institute of Systems Engineering(系统工程院) Academy of Military Sciences(军事科学院) Department of Geo-spatial Information(测绘信息学院) Information Engineering University(信息工程大学) School of Instrumentation Science and Engineering(仪器科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

AI总结 本文提出基于DINOv3的MC-DiSNet模型,用于冲突区多类变化检测,通过多尺度交叉注意力机制和差分孪生结构实现细粒度语义变化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18541 2025-12-05 cs.AI

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏