arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-02 至 2026-03-02 共收录 17
2602.24286 2026-03-02 cs.LG cs.AI

CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation

CUDA Agent: 大规模代理强化学习用于高性能CUDA内核生成

Weinan Dai, Hanlin Wu, Qiying Yu, Huan-ang Gao, Jiahao Li, Chengquan Jiang, Weiqiang Lou, Yufan Song, Hongli Yu, Jiaze Chen, Wei-Ying Ma, Ya-Qin Zhang, Jingjing Liu, Mingxuan Wang, Xin Liu, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) SIA-Lab of Tsinghua AIR(清华大学AIR SIA实验室)

AI总结 CUDA Agent通过大规模代理强化学习系统,实现高性能CUDA内核生成,优于现有编译器和大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24240 2026-03-02 cs.CV

Joint Geometric and Trajectory Consistency Learning for One-Step Real-World Super-Resolution

联合几何与轨迹一致性学习用于一步现实世界超分辨率

Chengyan Deng, Zhangquan Chen, Li Yu, Kai Zhang, Xue Zhou, Wang Zhang

机构 * University of Electronic Science(电子科学大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 GTASR通过引入轨迹对齐和双参考结构校正,解决现实世界超分辨率中的几何解耦和一致性漂移问题,实现高效且高质量的一步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23945 2026-03-02 cs.CV cs.AI cs.MM

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23864 2026-03-02 cs.AI

RUMAD: Reinforcement-Unifying Multi-Agent Debate

RUMAD:强化统一多智能体辩论

Chao Wang, Han Lin, Huaze Tang, Huijing Lin, Wenbo Ding

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 RUMAD通过强化学习动态控制通信拓扑,提升多智能体辩论的效率和准确性,实现80%以上的token成本降低和跨域泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23739 2026-03-02 cs.CV

U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation

U-Mind:一种实时光学交互的统一框架

Xiang Deng, Feng Gao, Yong Zhang, Youxin Pang, Xu Xiaoming, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 U-Mind 提出了一种统一框架,通过实时生成和多模态联合建模,实现高效且连贯的多模态交互,推动智能对话代理的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23732 2026-03-02 cs.CV

A Difference-in-Difference Approach to Detecting AI-Generated Images

一种差分-in-差分方法用于检测AI生成图像

Xinyi Qi, Kai Ye, Chengchun Shi, Ying Yang, Hongyi Zhou, Jin Zhu

机构 * Tsinghua University(清华大学) The London School of Economics and Political Science(伦敦政治经济学院) University of Birmingham(伯明翰大学)

AI总结 本文提出一种基于二阶差分的检测方法,通过减少方差提高AI生成图像的检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21644 2026-03-02 cs.RO

DAGS-SLAM: Dynamic-Aware 3DGS SLAM via Spatiotemporal Motion Probability and Uncertainty-Aware Scheduling

DAGS-SLAM:通过时空运动概率和不确定性感知调度实现动态感知的3DGS SLAM

Li Zhang, Yu-An Liu, Xijia Jiang, Conghao Huang, Danyang Li, Yanyong Zhang

机构 * School of Mathematics, Hefei University of Technology(合肥工业大学数学学院) School of Software, Tsinghua University(清华大学软件学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

AI总结 DAGS-SLAM通过时空运动概率和不确定性感知调度实现动态感知的3DGS SLAM,提升实时定位与密集重建的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07588 2026-03-02 cs.LG

Unified Biomolecular Trajectory Generation via Pretrained Variational Bridge

通过预训练变分桥统一生物分子轨迹生成

Ziyang Yu, Wenbing Huang, Yang Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Gaoling School of Artificial intelligence, Renmin University of China(中国人民大学北京学院人工智能学院)

AI总结 本文提出预训练变分桥模型,通过统一训练单结构和配对轨迹数据,提升生物分子轨迹生成的效率和保真度。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01840 2026-03-02 cs.CL

Read As Human: Compressing Context via Parallelizable Close Reading and Skimming

读作人类:通过可并行的近读与略读压缩上下文

Jiwei Tang, Shilei Liu, Zhicheng Zhang, Qingsong Lv, Runsong Zhao, Tingwei Lu, Langming Liu, Haibin Chen, Yujin Yuan, Hai-Tao Zheng, Wenbo Su, Bo Zheng

机构 * Tsinghua University(清华大学) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Northeastern University, China(中国东北大学)

AI总结 RAM通过可并行的近读与略读策略,有效压缩上下文,提升长输入处理效率,实现性能与可解释性的双重优化。

Comments 13 pages,5 figures (Compared with v1, the author affiliations have been corrected.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24159 2026-03-02 cs.AI

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架

Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu

机构 * IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院) EE, Tsinghua University(电子工程系,清华大学) Li Auto Inc.(力汽车公司) SIGS, Tsinghua University(系统工程系,清华大学)

AI总结 RE-PO是一种用于大语言模型对齐的鲁棒增强策略优化通用框架,通过期望最大化程序推断标签正确性并自适应加权数据点以减轻噪声,提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16622 2026-03-02 eess.AS cs.AI cs.SD

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

基于扩散的大型语言模型用于语音识别与 deliberation 处理

Mengqi Wang, Zhan Liu, Zengrui Jin, Guangzhi Sun, Chao Zhang, Philip C. Woodland

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Cambridge(剑桥大学)

AI总结 本文提出基于扩散的LLaDA模型用于ASR,通过改进解码策略降低WER,展示其在语音识别中的有效性。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06269 2026-03-02 cs.LG cs.AI

OM2P: Offline Multi-Agent Mean-Flow Policy

OM2P:离线多智能体均流策略

Zhuoran Li, Xun Wang, Hai Zhong, Qingxin Xia, Lihua Zhang, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(交叉信息研究院,清华大学) ByteDance Inc.(字节跳动公司)

AI总结 OM2P提出了一种离线多智能体强化学习算法,通过均流匹配损失和奖励感知优化,实现高效动作采样和内存优化,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11730 2026-03-02 math.OC cs.LG

Quantum Learning and Estimation for Coordinated Operation between Distribution Networks and Energy Communities

分布式网络与能源社区协调运行中的量子学习与估计

Yingrui Zhuang, Lin Cheng, Yuji Cao, Tongxin Li, Ning Qi, Yan Xu, Yue Chen

机构 * Department of Electrical Engineering, Tsinghua University(清华大学电子工程系) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区数据科学学院) Department of Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 本文提出量子学习与估计方法,用于提升分布式网络与能源社区间的协调运行,通过量子特性提升映射精度并减少计算资源消耗。

Comments This is a manuscript published by CSEE Journal of Power and Energy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01469 2026-03-02 cs.SD cs.AI eess.AS

TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation

TIGER:用于高效语音分离的时间-频率交织增益提取与重建

Mohan Xu, Kai Li, Guo Chen, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系、人工智能研究院、BNRist、清华大学) Tsinghua Laboratory of Brain and Intelligence (THBI), IDG/McGovern Institute for Brain Research, Tsinghua University(脑智能实验室(THBI)、IDG/麦克戈文脑科学研究院、清华大学) Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院)

AI总结 TIGER通过时间-频率交织增益提取与重建技术,在降低参数和计算成本的同时,实现了超越SOTA模型的语音分离性能。

Comments Accepted by ICLR 2025, demo page: https://cslikai.cn/TIGER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22939 2026-03-02 cs.CV

ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

ColaVLA: 借助认知潜在推理实现自动驾驶中的分层并行轨迹规划

Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li

机构 * Tsinghua University(清华大学) CUHK MMLab(香港中文大学MMLab) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

AI总结 ColaVLA通过统一视觉-语言-动作框架,解决自动驾驶中轨迹规划的效率与准确性问题,实现高效、安全的多尺度轨迹生成。

Comments CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏