arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-03 至 2026-03-03 共收录 58
2603.00676 2026-03-03 cs.AI

K^2-Agent: Co-Evolving Know-What and Know-How for Hierarchical Mobile Device Control

K^2-Agent: 为分层移动设备控制共进化知什么和知如何

Zhe Wu, Donglin Mo, Hongjin Lu, Junliang Xing, Jianheng Liu, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Yuanchun Shi

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 K2-Agent通过分层框架共进化声明性与程序性知识,提升复杂移动设备任务的规划与执行能力,实现76.1%的成功率和跨任务的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00629 2026-03-03 cs.LG

Adapt Data to Model: Adaptive Transformation Optimization for Domain-shared Time Series Foundation Models

适应数据到模型:面向领域共享时间序列基础模型的自适应转换优化

Yunzhong Qiu, Zhiyao Cen, Zhongyi Pei, Chen Wang, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

AI总结 TATO通过自适应转换优化提升领域适应的预测性能,显著降低MSE并提高效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00623 2026-03-03 cs.AI cs.CL

TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces

TraceSIR: 一个用于结构化分析和报告代理执行轨迹的多代理框架

Shu-Xun Yang, Cunxiang Wang, Haoke Zhang, Wenbo Yu, Lindong Wu, Jiayi Gui, Dayong Yang, Yukuo Cen, Zhuoer Feng, Bosi Wen, Yidong Wang, Lucen Zhong, Jiamin Ren, Linfeng Zhang, Jie Tang

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI(智谱AI) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 TraceSIR通过多代理框架结构化分析和报告代理执行轨迹,提升故障诊断和根本原因分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00615 2026-03-03 cs.RO

TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation

TGM-VLA:基于任务的混合学习用于高效且鲁棒的机器人操作

Fanqi Pu, Lei Jiang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) The National and Local Co-Build Humanoid Robotics Innovation Center(国家级与地方共建人形机器人创新中心)

AI总结 TGM-VLA通过优化关键帧采样策略和引入颜色反转投影模块,提升机器人操作任务的效率和鲁棒性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00540 2026-03-03 cs.AI

LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks

LOGIGEN: 逻辑驱动的可验证代理任务生成

Yucheng Zeng, Weipeng Lu, Linyun Liu, Shupeng Li, Zitian Qu, Chenghao Zhu, Shaofei Li, Zhengdong Tan, Mengyue Liu, Haotian Zhao, Zhe Zhou, Jianmin Wu

机构 * Baidu Inc.(百度公司) Tsinghua University(清华大学)

AI总结 LOGIGEN通过逻辑驱动和验证训练生成可验证的复杂任务,提升代理在复杂环境中的任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00532 2026-03-03 cs.AI

DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows

DenoiseFlow:面向可靠LLM代理工作流的不确定性感知去噪

Yandong Yan, Junwei Peng, Shijie Li, Chenxi Li, Yifei Shang, Can Deng, Ruiting Dai, Yongqiang Zhao, Jiaqi Zhu, Yu Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Key Laboratory of High Confidence Software Technologies(PKU), MOE(北京大学高可信软件技术重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心)

AI总结 DenoiseFlow通过闭环框架实现多步推理的不确定性感知去噪,提升LLM代理工作流的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00519 2026-03-03 cs.CV

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

Jano:具有早期阶段收敛意识的自适应扩散生成

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00397 2026-03-03 cs.LG

TENG-BC: Unified Time-Evolving Natural Gradient for Neural PDE Solvers with General Boundary Conditions

TENG-BC:用于具有通用边界条件的神经PDE求解器的统一时间演进自然梯度

Hongjie Jiang, Di Luo

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) Institute of Advanced Study, Tsinghua University, Beijing, China(清华大学advanced study研究所)

AI总结 TENG-BC通过统一时间演进自然梯度方法,实现对具有通用边界条件的神经PDE求解器的高精度求解,优于传统方法和PINN基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19691 2026-03-03 stat.ML cs.LG cs.NA math.NA

Smoothness Adaptivity in Constant-Depth Neural Networks: Optimal Rates via Smooth Activations

常深神经网络中的平滑适应性:通过平滑激活函数实现最优速率

Yuhao Liu, Zilin Wang, Lei Wu, Shaobo Zhang

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) AI for Science Institute, Beijing(北京人工智能科学研究院)

AI总结 本研究证明,使用平滑激活函数的常深神经网络能够通过增加宽度实现最优的平滑适应性,而非平滑激活函数如ReLU则受限于深度增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11909 2026-03-03 cs.SD cs.LG

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Echo:通过音频交错推理实现高级音频理解

Daiqing Wu, Xuan Zhang, Dongbao Yang, Jiashu Yao, Longfei Chen, Qingsong Liu, Sicheng Zhao, Can Ma, Yangyang Kang, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Zhejiang University(浙江大学) ByteDance China(字节跳动中国) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06267 2026-03-03 cs.RO

Robust Differentiable Collision Detection for General Objects

鲁棒可微碰撞检测用于通用物体

Jiayi Chen, Wei Zhao, Liangwang Ruan, Baoquan Chen, He Wang

机构 * Peking University(北京大学) Galbot Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出了一种鲁棒且高效的可微碰撞检测框架,支持凸和凹物体,通过基于距离的随机平滑、自适应采样和等价梯度传输提升梯度计算的鲁棒性和信息性,并在复杂网格上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10125 2026-03-03 cs.RO cs.AI

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

Ctrl-World: 一个可控制的生成世界模型用于机器人操作

Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 本文提出了一种可控的多视图世界模型,用于评估和改进通用机器人策略的指令遵循能力,通过姿态条件化记忆检索和帧级动作条件化实现长时一致性和精确动作控制,提升策略成功率44.7%。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04284 2026-03-03 cs.AI

Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning

Doctor-R1:通过经验代理强化学习掌握临床探究

Yunghwei Lai, Kaiming Liu, Ziyue Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) College of AI, Tsinghua University(人工智能学院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

AI总结 Doctor-R1通过经验代理强化学习提升临床决策与患者咨询能力,实现更高效的医疗咨询和决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04080 2026-03-03 cs.CL

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

PoLi-RL: 一种用于条件语义文本相似度的点到列表强化学习框架

Zixin Song, Bowen Zhang, Qian-Wen Zhang, Di Yin, Xing Sun, Chunping Li

机构 * Tsinghua University(清华大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 PoLi-RL通过点到列表强化学习框架,解决条件语义文本相似度中的优化难题,实现Spearman相关系数达48.18,为复杂条件判断任务提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04067 2026-03-03 cs.LG cs.AI cs.CL

What Scales in Cross-Entropy Scaling Law?

交叉熵缩放定律中什么因素具有可扩展性?

Junxi Yan, Zixi Wei, Qingyao Ai, Yiqun Liu, Jingtao Zhan

机构 * Tsinghua University(清华大学)

AI总结 本文通过分解交叉熵为误差熵、自我对齐和置信度三个部分,揭示了误差熵是唯一遵循幂律缩放的因素,从而解释了交叉熵缩放定律在小规模有效但在大尺度失效的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24393 2026-03-03 cs.AI cs.CL

Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention

通过纠正干预实现大推理模型的安全推理

Yichi Zhang, Yue Ding, Jingwen Yang, Tianwei Luo, Dongbai Li, Ranjie Duan, Qiang Liu, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) RealAI

AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11617 2026-03-03 cs.RO

AssemMate: Graph-Based LLM for Robotic Assembly Assistance

AssemMate:基于图的LLM用于机器人装配辅助

Qi Zheng, Chaoran Zhang, Zijian Liang, EnTe Lin, Shubo Cui, Qinghongbing Xie, Zhaobo Xu, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)

AI总结 AssemMate是一种基于图的LLM,通过知识图谱问答和视觉增强策略提升机器人装配任务的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04070 2026-03-03 cs.CL

XISM: an eXploratory and Interactive Graph Tool to Visualize and Evaluate Semantic Map Models

XISM:一种探索性和交互式的图工具,用于可视化和评估语义图模型

Zhu Liu, Zhen Hu, Lei Dai, Yu Xuan, Ying Liu

机构 * School of Humanities Tsinghua University(人文学院 清华大学) School of Environment and Society Institute of Science(环境与社会学院 科学研究院)

AI总结 XISM是一种结合数据驱动推断与专家知识的交互式工具,用于提升语义图模型的可扩展性和可解释性。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00523 2026-03-03 cs.CV

SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

SenseFlow: 为基于流的文本到图像蒸馏扩展分布匹配

Xingtong Ge, Xin Zhang, Tongda Xu, Yi Zhang, Xinjie Zhang, Yan Wang, Jun Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) SenseTime Research(商汤科技研究院) Vivix AI(维维克斯人工智能) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究所)

AI总结 SenseFlow通过引入隐式分布对齐和段内指导,解决大规模基于流的文本到图像模型蒸馏中的收敛问题,提升蒸馏效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01519 2026-03-03 cs.CL eess.AS

Chain of Correction for Full-text Speech Recognition with Large Language Models

基于大语言模型的全文语音识别纠错链

Zhiyuan Tang, Dong Wang, Zhikai Zhou, Yong Liu, Shen Huang, Shidong Shang

机构 * Tencent Ethereal Audio Lab, Tencent, China Center for Speech Language Technologies, BNRist, Tsinghua University, China

AI总结 本文提出纠错链(CoC)方法,利用大语言模型逐段纠正全文语音识别错误,通过多轮对话和上下文引导提升纠错效果,实验表明其在纠错性能上优于现有系统。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03292 2026-03-03 cs.SE cs.AI cs.HC

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-03-03 cs.CV cs.AI cs.LG

Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00155 2026-03-03 cs.CV cs.AI cs.IR

EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection

EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成

Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan University(武汉大学) Beijing University of Posts and Telecommunications(北京邮电大学) Dalian Maritime University(大连海事大学) Renmin University of China(中国人民大学)

AI总结 EfficientPosterGen通过语义感知检索、视觉上下文压缩和无代理布局检测技术,实现高效且可靠的学术海报自动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00058 2026-03-03 cs.CY cs.AI

PaperRepro: Automated Computational Reproducibility Assessment for Social Science Papers

PaperRepro: 社会科学论文的自动化计算可重复性评估

Linhao Zhang, Tong Xia, Jinghua Piao, Lizhen Cui, Yong Li

机构 * Shandong University, Zhongguancun Academy, China(山东大学中关村学院) Tsinghua University Beijing China(清华大学北京) Shandong University Jinan China(山东大学济南) Tsinghua University(清华大学) Shandong University(山东大学) Tsinghua University, Zhongguancun Academy, China(清华大学中关村学院)

AI总结 PaperRepro通过多代理方法提升社会科学论文的自动化可重复性评估,实现性能提升21.9%并推出分层基准

详情

展开后加载摘要…

URL PDF HTML 收藏