arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-10 至 2025-12-10 共收录 9
2512.08820 2025-12-10 cs.CV cs.AI

Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning

无需训练的双双曲适配器用于更高效的跨模态推理

Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)

AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。

Comments Accepted in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08406 2025-12-10 cs.CV

SAM-Body4D: Training-Free 4D Human Body Mesh Recovery from Videos

SAM-Body4D: 从视频中无需训练的4D人体网格恢复

Mingqi Gao, Yunqi Miao, Jungong Han

机构 * Department of Automation, Tsinghua University, Beijing, China(自动化系,清华大学,北京,中国) University of Warwick, Coventry, UK(沃里克大学,英国) University of Sheffield, Sheffield, UK(谢菲尔德大学,英国)

AI总结 SAM-Body4D通过无需训练的框架实现从视频中鲁棒且时间一致的人体网格恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15129 2025-12-10 cs.RO cs.AI cs.CV cs.LG

Towards Task-Oriented Flying: Framework, Infrastructure, and Principles

面向任务的飞行:框架、基础设施与原则

Kangyao Huang, Hao Wang, Jingyu Chen, Jintao Chen, Yu Luo, Di Guo, Xiangkui Zhang, Xiangyang Ji, Huaping Liu

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出面向任务的四旋翼端到端DRL框架,整合复杂任务规范的设计原则,揭示模拟任务定义、训练设计原则和物理部署间的相互依赖关系,为动态无结构环境下的自主飞行提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17506 2025-12-10 cs.LG cs.AI

Score-based Conditional Out-of-Distribution Augmentation for Graph Covariate Shift

基于分数的条件图协变量移位增强

Bohan Wang, Yurui Chang, Wei Jin, Lu Lin

机构 * Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴堡研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出基于分数的条件图生成策略,用于增强图学习中对分布外泛化的鲁棒性,通过合成未见环境来提升模型性能。

Comments 12 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07855 2025-12-10 cs.LG cs.CV

LAPA: Log-Domain Prediction-Driven Dynamic Sparsity Accelerator for Transformer Model

LAPA: 一种基于对数域的预测驱动型动态稀疏加速器用于Transformer模型

Huizheng Wang, Hongbin Wang, Shaojun Wei, Yang Hu, Shouyi Yin

机构 * School of Integrated Circuits Tsinghua University Beijing, China(集成电路学院清华大学北京中国) School of Integrated Circuits Tsinghua University Beijing, China Shanghai Artificial Intelligence Laboratory Shanghai, China(集成电路学院清华大学北京中国上海人工智能实验室上海中国)

AI总结 LAPA通过设计不对称领先一计算方案和混合精度多轮位移累积机制,提升Transformer模型的计算效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏