arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-01 至 2025-12-01 共收录 13
2511.23475 2025-12-01 cs.CV

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01528 2025-12-01 cs.CL cs.AI q-bio.BM

Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey

利用生物分子和自然语言通过多模态学习:一篇综述

Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。

Comments 2025.11.28 Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22659 2025-12-01 cs.AI cs.CV

Geometrically-Constrained Agent for Spatial Reasoning

几何约束代理用于空间推理

Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室)

AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22456 2025-12-01 cs.CV

ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models

ITS3D: 推理时缩放用于文本引导的3D扩散模型

Zhenglin Zhou, Fan Ma, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * ReLER, Zhejiang University(浙江大学ReLER实验室) National University of Singapore(新加坡国立大学)

AI总结 ITS3D通过优化问题和验证器引导搜索算法,提升文本引导的3D扩散模型生成质量。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22357 2025-12-01 cs.CV

AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows

AnchorFlow: 基于潜在锚点对齐流的无训练3D编辑

Zhenglin Zhou, Fan Ma, Chengzhuo Gui, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 AnchorFlow通过潜在锚点对齐流实现无训练3D编辑,确保编辑过程中的稳定性和语义一致性,提升编辑效果和几何保真度。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22146 2025-12-01 cs.CL

C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models

C$^2$DLM: 基于因果概念的扩散大语言模型

Kairong Han, Nuanqiao Shan, Ziyu Zhao, Zijing Hu, Xinpeng Dong, Junjian Ye, Lujia Pan, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Noah’s Ark Lab, Huawei Technologies(华为技术有限公司诺亚实验室)

AI总结 C$^2$DLM通过引入因果概念引导机制,提升大语言模型在推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21977 2025-12-01 cs.CV

Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition

动作至关重要:用于基于骨骼的微动作识别的运动引导调制网络

Jihao Gu, Kun Li, Fei Wang, Yanyan Wei, Zhiliang Wu, Hehe Fan, Meng Wang

机构 * University College London(伦敦大学学院) ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院、合肥综合性国家科学中心) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)

AI总结 本文提出运动引导调制网络MMN,通过骨骼和帧级运动线索调制提升微动作识别的准确性。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02961 2025-12-01 cs.CL

FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models

FlowerTune: 一个跨领域用于联邦微调大型语言模型的基准测试

Yan Gao, Massimo Roberto Scamarcia, Javier Fernandez-Marques, Mohammad Naseri, Chong Shen Ng, Dimitris Stripelis, Zexi Li, Tao Shen, Jiamu Bai, Daoyuan Chen, Zikai Zhang, Rui Hu, InSeo Song, Lee KangYoon, Hong Jia, Ting Dang, Junyan Wang, Zheyuan Liu, Daniel Janes Beutel, Lingjuan Lyu, Nicholas D. Lane

机构 * Flower Labs(Flower实验室) University of Cambridge(剑桥大学) Zhejiang University(浙江大学) Penn State University(宾夕法尼亚州立大学) Alibaba Group(阿里巴巴集团) University of Nevada, Reno(内华达大学拉斯维加斯分校) Gachon University(加荣大学) The University of Auckland(奥克兰大学) The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学) Sony AI(索尼人工智能)

AI总结 FlowerTune提出一个跨领域联邦微调LLM的基准测试,评估26种模型在四个领域中的性能,提供隐私保护和领域适应的见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20270 2025-12-01 cs.CV

ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation

ParticleGS: 从视频中学习神经高斯粒子动力学以实现无先验的物理运动外推

Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) North China University of Technology(华北理工大学) University of Science and Technology of China(中国科学技术大学)

AI总结 ParticleGS通过学习神经高斯粒子动力学,实现无先验的物理运动外推,提升动态3D场景的预测准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14684 2025-12-01 cs.CL cs.AI

Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning

注意间隔:为改进链式推理微调而弥合思维跳跃

Haolei Xu, Yuchen Yan, Yongliang Shen, Wenqi Zhang, Guiyang Hou, Shengpei Jiang, Kaitao Song, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) SF Technology(SF技术) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出CoT思维跳跃桥任务,通过生成缺失的中间推理步骤提升数学推理任务的性能,实验表明在NuminaMath上改进达+5.87%。

Comments Accepted to NeurIPS 2025. Camera ready version. Code: https://github.com/ZJU-REAL/Mind-the-Gap Project: https://zju-real.github.io/CoT-Bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏