arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-02-24 至 2026-02-24 共收录 13
2510.23479 2026-02-24 cs.CV

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26518 2026-02-24 cs.RO

Memory-Efficient 2D/3D Shape Assembly of Robot Swarms

记忆高效的机器人群2D/3D形状组装

Shuoyu Yue, Pengpeng Li, Yang Xu, Kunrui Ze, Xingjian Long, Huazi Cao, Guibin Sun

机构 * Cavendish Laboratory, University of Cambridge(剑桥大学卡文迪许实验室) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)

AI总结 本文提出了一种记忆高效的树表示方法和基于行为的分布式控制器,用于实现机器人群在2D和3D中的高效形状组装,显著降低了内存使用并提升了速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19622 2026-02-24 cs.LG cs.AI

VecFormer: Towards Efficient and Generalizable Graph Transformer with Graph Token Attention

VecFormer: 向高效且通用的图变换器迈进:基于图标记注意力的图变换器

Jingbo Zhou, Jun Xia, Siyuan Li, Yunfan Liu, Wenjun Wang, Yufei Huang, Changxi Chi, Mutian Hong, Zhuoli Ouyang, Shu Wang, Zhongqi Wang, Xingyu Wu, Chang Yu, Stan Z. Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tongji University(同济大学) ShanghaiTech University(上海科技大学) Southern University of Science and Technology(南方科技大学) Jilin University(吉林大学)

AI总结 VecFormer通过两阶段训练和图标记注意力机制,提升图变换器在大规模图和分布外场景中的效率与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14512 2026-02-24 cs.CV

MedVAR: Towards Scalable and Efficient Medical Image Generation via Next-scale Autoregressive Prediction

MedVAR:通过下一步尺度自回归预测实现可扩展和高效的医学图像生成

Zhicheng He, Yunpeng Zhao, Junde Wu, Ziwei Niu, Zijun Li, Bohan Li, Lanfen Lin, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 MedVAR通过下一步尺度自回归预测方法,实现了高效且可扩展的医学图像生成,为医学生成基础模型提供了新的方向。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06751 2026-02-24 cs.CV

OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot

OBS-Diff: 高精度扩散模型的一次性剪枝

Junhan Zhu, Hesong Wang, Mingluo Su, Zefang Wang, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 OBS-Diff通过引入时间步感知Hessian构造和高效分组顺序剪枝策略,实现了扩散模型的一次性精准剪枝,提升推理效率并保持视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17596 2026-02-24 cs.CL cs.AI

Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context

评估LLMs在科学想法生成中的发散思维能力:基于最小上下文

Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Bank of China(中国银行) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院) State Key Laboratory of Nonlinear Mechanics, Institute of Mechanics, Chinese Academy of Sciences(中国科学院力学研究所非线性力学重点实验室)

AI总结 本研究提出LiveIdeaBench,通过单关键词提示评估LLMs在科学想法生成中的发散思维能力,揭示通用智能指标无法有效预测该能力,表明需专门的评估基准和不同的训练策略来提升科学想法生成能力。

Comments Updated manuscript and title

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18811 2026-02-24 cs.CV

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

跨域少样本目标检测中的多模态原型学习

Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) The University of Southern Queensland(昆士兰大学)

AI总结 本文提出LMP方法,通过结合文本和视觉信息,提升跨域少样本目标检测的精度和性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18700 2026-02-24 cs.CR cs.CL

Watermarking LLM Agent Trajectories

对LLM代理轨迹进行水印标记

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University, China(浙江大学) University of Virginia, USA(弗吉尼亚大学) Alibaba Qwen, China(阿里巴巴通义实验室) University of Alberta, Canada(阿尔伯塔大学)

AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02240 2026-02-24 cs.CV cs.AI

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。

Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/

详情

展开后加载摘要…

URL PDF HTML 收藏