arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-11-25 至 2025-11-25 共收录 18
2511.19425 2025-11-25 cs.CV

SAM3-Adapter: Efficient Adaptation of Segment Anything 3 for Camouflage Object Segmentation, Shadow Detection, and Medical Image Segmentation

SAM3-Adapter: 高效适应Segment Anything 3用于伪装物分割、阴影检测和医学图像分割

Tianrun Chen, Runlong Cao, Xinda Yu, Lanyun Zhu, Chaotao Ding, Deyi Ji, Cheng Chen, Qi Zhu, Chunyan Xu, Papa Mao, Ying Zang

机构 * KOKONI, Moxin (Huzhou) Tech. Co., LTD(摩西(湖州)科技有限公司) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Information Engineering, Huzhou University(湖州大学信息工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(新加坡南洋理工大学电子与电气工程学院) College of Computing and Data Science, Nanyang Technological University(新加坡南洋理工大学计算与数据科学学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 SAM3-Adapter通过高效适配框架提升SAM3在伪装物分割、阴影检测和医学影像分割等任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19268 2025-11-25 cs.CV

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19168 2025-11-25 cs.LG cs.CL

RAVEN++: Pinpointing Fine-Grained Violations in Advertisement Videos with Active Reinforcement Reasoning

RAVEN++: 通过主动强化推理精准定位广告视频中的细粒度违规

Deyi Ji, Yuekui Yang, Liqun Liu, Peng Shu, Haiyang Wu, Shaogang Tang, Xudong Chen, Shaoping Ma, Tianrun Chen, Lanyun Zhu

机构 * Tencent(腾讯) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 RAVEN++通过主动强化推理提升广告视频中细粒度违规检测的精度与泛化能力

Comments EMNLP 2025 (Oral, Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18900 2025-11-25 cs.GR cs.CV

MatMart: Material Reconstruction of 3D Objects via Diffusion

通过扩散模型进行3D物体的材质重建

Xiuchao Wu, Pengfei Zhu, Jiangjing Lyu, Xinguo Liu, Jie Guo, Yanwen Guo, Weiwei Xu, Chengfei Lyu

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出了一种基于扩散模型的3D物体材质重建框架,通过两阶段重建和视图-材质交叉注意力机制,实现高保真材质预测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03277 2025-11-25 cs.CV

PointAD+: Learning Hierarchical Representations for Zero-shot 3D Anomaly Detection

PointAD+: 学习层次化表示用于零样本3D异常检测

Qihang Zhou, Shibo He, Jiangtao Yan, Wenchao Meng, Jiming Chen

机构 * State Key Laboratory of Industrial Control Technology(工业控制技术国家重点实验室) Zhejiang University(浙江大学)

AI总结 PointAD+通过层次化表示学习,结合隐式和显式异常语义,提升零样本3D异常检测性能。

Comments Submitted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13589 2025-11-25 cs.CV

AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding

AdaVideoRAG:多情境自适应检索增强高效长视频理解

Zhucun Xue, Jiangning Zhang, Xurong Xie, Yuxuan Cai, Yong Liu, Xiangtai Li, Dacheng Tao

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technolog(华中科技大学) Nanyang Technological University(南洋理工大学)

AI总结 AdaVideoRAG通过自适应检索增强框架提升长视频理解效率与准确性,支持多层级知识检索与深度语义分析。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20951 2025-11-25 cs.CV

DSOcc: Leveraging Depth Awareness and Semantic Aid to Boost Camera-Based 3D Semantic Occupancy Prediction

DSOcc: 利用深度感知和语义辅助提升基于相机的3D语义占用预测

Naiyu Fang, Zheyuan Zhou, Kang Wang, Ruibo Li, Lemiao Qiu, Shuyou Zhang, Zhe Wang, Guosheng Lin

机构 * S-Lab & College of Computing and Data Science, Nanyang Technological University(S实验室及计算与数据科学学院,南洋理工大学) MMLab, The Chinese University of Hong Kong(M实验室,香港中文大学) State Key Laboratory of Fluid Power & Mechatronic Systems, Zhejiang University(流体动力与机电系统国家重点实验室,浙江大学) SenseTime Research, Hong Kong(商汤研究,香港)

AI总结 DSOcc通过深度感知和语义辅助提升基于相机的3D语义占用预测,实现高效且鲁棒的占用状态和类别推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18025 2025-11-25 cs.CR cs.IT cs.LG math.IT

Correlated-Sequence Differential Privacy

关联序列差分隐私

Yifan Luo, Meng Zhang, Jin Xu, Junting Chen, Jianwei Huang

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Science and Engineering(科学与工程学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ZJU-UIUC Institute(浙大-伊利诺伊大学联合学院) Zhejiang University(浙江大学) School of Management(管理学院) Huazhong University of Science and Technology(华中科技大学) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院(FNii-Shenzhen)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Key Laboratory of Crowd Intelligence Empowered Low-Carbon Energy Network(深圳群智赋能低碳能源网络重点实验室) CSIJRI Joint Research Centre on Smart Energy Storage(CSIJRI联合智能储能研究中心)

AI总结 本文提出CSDP框架,通过关联序列差分隐私方法,在保持数据有用性的同时提升隐私保护效果。

Comments 11 pages, 5 figures. Published in 2025 34th International Conference on Computer Communications and Networks (ICCCN), IEEE, August 2025

Journal ref Proceedings of the 34th International Conference on Computer Communications and Networks (ICCCN 2025), IEEE, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17943 2025-11-25 cs.CV

SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育

Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan

机构 * Jinan University(济南大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Guangming Laboratory(光明实验室) Zhejiang University(浙江大学)

AI总结 SciEducator通过Deming循环多智能体系统实现科学视频的自演化理解与教育,生成多模态教学内容并超越现有大语言模型和视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17923 2025-11-25 cs.CL cs.AI

Towards Efficient LLM-aware Heterogeneous Graph Learning

面向高效LLM-aware异构图学习

Wenda Li, Tongya Zheng, Shunyu Liu, Yu Wang, Kaixuan Chen, Hanyang Yuan, Bingde Hu, Zujie Ren, Mingli Song, Gang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Zhejiang Lab(浙江实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, School of Computer and Computing Science, Hangzhou City University(浙江省实时智能城市安全治理工程技术研究中心,杭州城市大学计算机与计算科学学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, Zhejiang, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,浙江,中国) Nanyang Technological University(南洋理工大学) Bangsun Technology(邦sun科技)

AI总结 本文提出ELLA框架,通过LLM-aware关系分词器和层次关系图变压器,高效解决异构图中复杂关系语义建模和任务间语义间隙问题,实现性能与效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17904 2025-11-25 cs.CV cs.RO

CUS-GS: A Compact Unified Structured Gaussian Splatting Framework for Multimodal Scene Representation

CUS-GS: 一种紧凑的统一结构高斯点扩散框架用于多模态场景表示

Yuhang Ming, Chenxin Fang, Xingyuan Yu, Fan Zhang, Weichen Dai, Wanzeng Kong, Guofeng Zhang

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学研究所) School of Computer Science, University of Bristol(布里斯托大学计算机科学学院)

AI总结 CUS-GS通过统一结构化高斯点扩散框架,实现多模态场景表示的高效建模与语义一致性。

Comments 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17898 2025-11-25 cs.RO

L1 Sample Flow for Efficient Visuomotor Learning

L1样本流用于高效视觉-运动学习

Weixi Song, Zhetao Chen, Tao Xu, Xianchao Zeng, Xinyu Zhou, Lixin Yang, Donglin Wang, Cewu Lu, Yong-Lu Li

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 L1流通过结合去噪模型的多模分布捕捉能力与L1回归的高效性,实现高效的视觉-运动学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17622 2025-11-25 cs.LG cs.AI

Neurocircuitry-Inspired Hierarchical Graph Causal Attention Networks for Explainable Depression Identification

受神经回路启发的分层图因果注意网络用于可解释的抑郁症识别

Weidao Chen, Yuxiao Yang, Yueming Wang

机构 * MOE Frontier Science Center for Brain Science and Brain-machine Integration(脑科学与脑机融合前沿科学中心) Nanhu Brain-computer Interface Institute(南湖脑机接口研究院) School of Computer Science and Technology(计算机科学与技术学院) Qiushi Academy for Advanced Studies(启硕高级研究院) State Key Laboratory of Brain-machine Intelligence(脑机智能国家重点实验室) The Department of Neurosurgery, Second Affiliated Hospital, School of Medicine, Zhejiang University Hangzhou, China(浙江大学医学院附属第二医院神经外科)

AI总结 本文提出NH-GCAT网络,通过分层图因果注意机制,结合神经科学知识,实现对抑郁症的可解释识别。

Comments Under review for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22633 2025-11-25 cs.CL cs.AI cs.CV cs.LG cs.MM

Spatial Knowledge Graph-Guided Multimodal Synthesis

基于空间知识图的多模态合成

Yida Xue, Zhen Bi, Jinnan Yang, Jungang Lou, Kehai Chen, Min Zhang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Science and Technology(南京理工大学) Huzhou University(湖州大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01119 2025-11-25 cs.CV cs.RO

Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction

利用交叉注意力实现端到端的开放词汇全景重建

Xuan Yu, Yuxuan Xie, Yili Liu, Haojian Lu, Rong Xiong, Yiyi Liao, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

AI总结 本文提出PanopticRecon++,通过新颖的交叉注意力机制实现端到端开放词汇全景重建,结合可学习3D高斯和最优线性分配,提升3D和2D分割重建性能。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏