arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-01 至 2025-12-01 共收录 23
2511.23476 2025-12-01 cs.AI

Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction

通过多轮交互构建高效的LLM世界模型推理:WMAct

Bao Shu, Yan Cai, Jianjian Sun, Chunrui Han, En Yu, Liang Zhao, Jingcheng Hu, Yinmin Zhang, Haoran Lv, Yuang Peng, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学MMLab) Peking University(北京大学) StepFun Tsinghua University(清华大学)

AI总结 WMAct通过高效交互和主动推理机制,使LLM在复杂环境中实现高效世界模型推理,提升任务解决能力和迁移性能。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23386 2025-12-01 cs.CV

VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

VQRAE:用于多模态理解、生成和重建的表示量化自编码器

Sinan Du, Jiahao Guo, Bo Li, Shuhao Cui, Zhengzhuo Xu, Yifu Luo, Yongxian Wei, Kun Gai, Xinggang Wang, Kai Wu, Chun Yuan

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

AI总结 VQRAE通过统一的分词器生成连续语义特征和离散标记,提升多模态理解、生成和重建的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23262 2025-12-01 cs.AI

Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning

像人类一样适应:具有测试时推理的元认知代理

Yang Li, Zhiyuan He, Yuxuan Huang, Zhuhanling Xiao, Chao Yu, Meng Fang, Kun Shao, Jun Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Oxford(牛津大学) Tsinghua University(清华大学) University of Liverpool(利物浦大学) University College London(伦敦大学学院)

AI总结 本文提出元认知测试时推理框架,通过元认知自我更新实现模型在测试时的高效适应,实验表明其在Atari游戏中表现出优于基线的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23193 2025-12-01 cs.RO cs.LG cs.SY eess.SY

Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging

面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法

Yuchen Shi, Huaxin Pei, Yi Zhang, Danya Yao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

AI总结 本文提出了一种面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法,通过对抗性扰动生成和故障容忍智能体设计,提升协同驾驶系统的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23124 2025-12-01 cs.CV

DNA-Prior: Unsupervised Denoise Anything via Dual-Domain Prior

DNA-Prior:通过双域先验实现无监督去噪

Yanqi Cheng, Chun-Wun Cheng, Jim Denholm, Thiago Lima, Javier A. Montoya-Zegarra, Richard Goodwin, Carola-Bibiane Schönlieb, Angelica I Aviles-Rivero

机构 * University of Cambridge(剑桥大学) Lucerne University Teaching and Research Hospital(卢塞恩教学与研究医院) Zurich University of Applied Sciences(苏黎世应用科学大学) YMSC, Tsinghua University(清华大学数学科学中心)

AI总结 DNA-Prior通过双域先验实现无监督去噪,无需外部数据即可在多种医学影像模态中有效抑制噪声并保留结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23122 2025-12-01 cs.AI

Evolutionary Discovery of Heuristic Policies for Traffic Signal Control

进化发现交通信号控制的启发式策略

Ruibing Wang, Shuhan Guo, Zeen Li, Zhen Wang, Quanming Yao

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安) Tsinghua University, Beijing, China(清华大学,北京)

AI总结 本文提出了一种基于大语言模型的交通信号控制策略进化方法,通过结构化状态抽象和信用分配反馈模块,生成针对特定交通环境的高效启发式策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23113 2025-12-01 cs.CV cs.LG

db-SP: Accelerating Sparse Attention for Visual Generative Models with Dual-Balanced Sequence Parallelism

db-SP: 通过双平衡序列并行加速视觉生成模型的稀疏注意力

Siqi Chen, Ke Hong, Tianchen Zhao, Ruiqi Xie, Zhenhua Zhu, Xudong Zhang, Yu Wang

机构 * Tsinghua University(清华大学)

AI总结 db-SP通过双平衡序列并行技术提升视觉生成模型的稀疏注意力效率,实现端到端加速1.25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23112 2025-12-01 cs.CV cs.LG

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?

MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准

Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Tsinghua University(清华大学)

AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。

Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22928 2025-12-01 cs.RO

Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models

在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理

Jiaxin Liu, Xiangyu Yan, Liang Peng, Lei Yang, Lingjun Zhang, Yuechen Luo, Yueming Tao, Ashton Yu Xuan Tan, Mu Li, Lei Zhang, Ziqi Zhan, Sai Guo, Hong Wang, Jun Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22883 2025-12-01 cs.CL

FEANEL: A Benchmark for Fine-Grained Error Analysis in K-12 English Writing

FEANEL:K-12英语写作中细粒度错误分析的基准

Jingheng Ye, Shen Wang, Jiaqi Chen, Hebin Wang, Deqing Zou, Yanyu Zhu, Jiwei Tang, Hai-Tao Zheng, Ruitong Liu, Haoyang Li, Yanfeng Wang, Qingsong Wen

机构 * Squirrel Ai Learning Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 FEANEL基准旨在评估LLMs在K-12英语写作中细粒度错误分析的能力,通过1000篇学生作文和自定义分类体系,揭示当前模型在教育反馈方面的不足。

Comments 19 pages, 7 figures, and 4 tables. The dataset is available at https://huggingface.co/datasets/Feanel/FEANEL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22863 2025-12-01 cs.CV

CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

CoordSpeaker: 利用手势描述生成协调的 caption-驱动的语音同步手势生成

Fengyi Fang, Sicheng Yang, Wenming Yang

机构 * Tsinghua University(清华大学)

AI总结 CoordSpeaker通过引入手势描述框架和条件潜在扩散模型,实现了协调的caption驱动的语音同步手势生成,解决了手势生成中的语义先验间隙和多模态控制难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22704 2025-12-01 cs.CV

Splat-SAP: Feed-Forward Gaussian Splatting for Human-Centered Scene with Scale-Aware Point Map Reconstruction

Splat-SAP:基于双目相机的大稀疏场景的人为中心场景的前馈高斯点扩散

Boyao Zhou, Shunyuan Zheng, Zhanfeng Liao, Zihan Ma, Hanzhang Tu, Boning Liu, Yebin Liu

机构 * Tsinghua University(清华大学)

AI总结 Splat-SAP通过前馈高斯点扩散方法,利用像素级点图重建和两阶段学习策略,提升大稀疏场景的人为中心渲染稳定性与视觉质量。

Comments Accepted by AAAI 2026. Project page: https://yaourtb.github.io/Splat-SAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20460 2025-12-01 cs.CV

Look Where It Matters: Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search

关注关键区域:通过自适应缩放搜索实现无需训练的超高清遥感视觉问答

Yunqi Zhou, Chengjie Jiang, Chun Yuan, Jing Li

机构 * Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学) East China Normal University(华东师范大学)

AI总结 ZoomSearch通过自适应缩放搜索实现无需训练的超高清遥感视觉问答,提升准确性和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02863 2025-12-01 cs.CV cs.AI cs.LG

Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory

Point3R: 基于显式空间指针记忆的流式3D重建

Yuqi Wu, Wenzhao Zheng, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 Point3R通过显式空间指针记忆实现高效的流式3D重建,提升密集重建的精度与效率。

Comments Code is available at: https://github.com/YkiWu/Point3R

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00802 2025-12-01 cs.CV

TRACE: Temporally Reliable Anatomically-Conditioned 3D CT Generation with Enhanced Efficiency

TRACE: 基于时间可靠性的解剖条件3D CT生成与增强效率

Minye Shao, Xingyu Miao, Haoran Duan, Zeyu Wang, Jingkun Chen, Yawen Huang, Xian Wu, Jingjing Deng, Yang Long, Yefeng Zheng

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) College of Computer Science and Engineering, Dalian Minzu University(大连民族大学计算机科学与工程学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Jarvis Research Center, Tencent YouTu Lab(腾讯YouTu实验室 Jarvis 研究中心) School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院) Medical Artificial Intelligence Laboratory, School of Engineering, Westlake University(西湖大学工程学院医学人工智能实验室)

AI总结 TRACE通过2D多模态条件扩散方法生成具有时空对齐的3D CT图像,提升生成效率和解剖保真度。

Comments Accepted to MICCAI 2025 (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09134 2025-12-01 cs.RO

Steady-State Drifting Equilibrium Analysis of Single-Track Two-Wheeled Robots for Controller Design

单轨两轮机器人稳态漂移平衡分析用于控制器设计

Feilong Jing, Yang Deng, Boyi Wang, Xudong Zheng, Yifan Sun, Zhang Chen, Bin Liang

机构 * The Department of Automation, Tsinghua University(自动化系,清华大学) Qiyuan Lab(启元实验室)

AI总结 本文提出了一种用于单轨两轮机器人稳态漂移控制的分析方法,通过理论扩展和算法优化,实现了高机动性和稳定性。

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22355 2025-12-01 cs.LG

AutoTailor: Automatic and Efficient Adaptive Model Deployment for Diverse Edge Devices

AutoTailor: 为异构边缘设备实现自动且高效的自适应模型部署

Mengyang Liu, Chenyu Lu, Haodong Tian, Fang Dong, Ruiting Zhou, Wei Wang, Dian Shen, Guangtong Li, Ye Wan, Li Li

机构 * Southeast University(东南大学) Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 AutoTailor通过自动化端到端SuperNet自适应模型部署,显著提升边缘设备的推理效率和模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22107 2025-12-01 cs.CV

HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Prediction

HyperST:面向空间转录组预测的分层双曲学习

Chen Zhang, Yilu An, Ying Chen, Hao Li, Xitong Ling, Lihao Liu, Junjun He, Yuxiang Lin, Zihui Wang, Rongshan Yu

机构 * Xiamen University(厦门大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 HyperST通过在双曲空间中建模数据的层次结构,实现空间转录组预测的多级图像-基因表示学习,提升跨模态预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22069 2025-12-01 cs.LG

Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian

过参数化分数匹配的收敛动力学:单个高斯分布

Yiran Zhang, Weihang Xu, Mo Zhou, Maryam Fazel, Simon Shaolei Du

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究所) Tsinghua University(清华大学) University of Washington(华盛顿大学)

AI总结 本文研究了过参数化分数匹配在学习单个高斯分布时的收敛动力学,证明了在特定初始化条件下梯度下降的收敛性,并建立了收敛率的下界。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21887 2025-12-01 cs.CV

UniArt: Unified 3D Representation for Generating 3D Articulated Objects with Open-Set Articulation

UniArt: 一种统一的3D表示方法,用于从单张图像生成具有开集关节的3D可动物体

Bu Jin, Weize Li, Songen Gu, Yupeng Zheng, Yuhang Zheng, Zhengyi Zhou, Yao Yao

机构 * Hong Kong University of Science and Technology(香港理工大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 UniArt通过统一的潜在表示和开集关节预测方法,实现了从单张图像生成高质量可动3D物体的端到端合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00303 2025-12-01 cs.CV cs.GR

Neural Octahedral Field: Octahedral prior for simultaneous smoothing and sharp edge regularization

神经八面体场:用于同时平滑和锐边正则化的八面体先验

Ruichen Zheng, Tao Yu, Ruizhen Hu

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学)

AI总结 本文提出神经八面体场,通过八面体空间的平滑性实现同时平滑和锐边正则化,提升点云表面重建效果。

Comments project page: https://github.com/Ankbzpx/frame-field

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.06228 2025-12-01 cs.AI cs.LG

One-shot Transfer Learning for Population Mapping

单样本迁移学习用于人口映射

Erzhuo Shao, Jie Feng, Yingheng Wang, Tong Xia, Yong Li

机构 * Beijing National Research Center for Information Science and Technology (BNRist)(北京国家信息科学与技术研究中心(BNRist)) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出PSRNet框架,通过单样本迁移学习方法从数据充足城市向数据稀缺城市转移空间-时间知识,提升细粒度人口分布映射的准确性。

Comments Published in Proceedings of the 30th ACM International Conference on Information and Knowledge Management (CIKM '21)

详情

展开后加载摘要…

URL PDF HTML 收藏