arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-10 至 2026-03-10 共收录 46
2603.07244 2026-03-10 cs.CV

PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation

PresentBench: 一种基于评分标准的细粒度幻灯片生成基准

Xin-Sheng Chen, Jiayu Zhu, Pei-lin Li, Hanzheng Wang, Shuojin Yang, Meng-Hao Guo

机构 * Tsinghua University(清华大学)

AI总结 PresentBench提出了一种细粒度、基于评分标准的幻灯片生成评估基准,通过238个实例和54.1个检查清单项目,实现更精确的评估,展示了NotebookLM在该领域的显著优势。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07169 2026-03-10 cs.LG stat.ML

Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts

使LLMs像专家一样优化多场景CUDA内核

Yuxuan Han, Meng-Hao Guo, Zhengning Liu, Wenguang Chen, Shi-Min Hu

机构 * Tsinghua University(清华大学)

AI总结 本文提出CUDAMaster系统,通过多代理和硬件感知方法,实现对多场景CUDA内核的高效优化,显著提升性能并超越现有闭源库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07116 2026-03-10 cs.CR cs.AI

aCAPTCHA: Verifying That an Entity Is a Capable Agent via Asymmetric Hardness

aCAPTCHA:通过非对称难度验证实体是否为有能力的代理

Zuyao Xu, Xiang Li, Fubin Wu, Yuqi Qiu, Lu Sun, FaSheng Miao

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

AI总结 aCAPTCHA通过非对称难度验证机制,为需要实体类型验证的服务提供一个无需基础设施的准入解决方案。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07048 2026-03-10 cs.CV cs.AI

Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation

回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习

Xiaochen Yang, Hao Fang, Jiawei Kong, Yaoxin Mao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06993 2026-03-10 cs.CV

AdaGen: Learning Adaptive Policy for Image Synthesis

AdaGen: 为图像合成学习自适应策略

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学)

AI总结 AdaGen通过学习自适应策略提升图像合成性能,采用强化学习优化调度过程,实现更高效的生成效果和可控的保真度-多样性权衡。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06726 2026-03-10 cs.LG cs.AI

Regression Models Meet Foundation Models: A Hybrid-AI Approach to Practical Electricity Price Forecasting

回归模型与基础模型相遇:一种混合AI方法用于实际电价预测

Yunzhong Qiu, Binzhu Li, Hao Wei, Shenglin Weng, Chen Wang, Zhongyi Pei, Mingsheng Long, Jianmin Wang

机构 * School of Software, BNRist Tsinghua University(软件学院,北京理工大学) Suzhou Industrial Park Xingzhixun CS Co., Ltd.(苏州工业园区星讯CS公司)

AI总结 本文提出FutureBoosting方法,通过整合时间序列基础模型生成的预测特征,提升回归模型在电价预测中的性能,实现MAE降低超过30%。

Comments 15 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02426 2026-03-10 cs.LG

Personalized Multi-Agent Average Reward TD-Learning via Joint Linear Approximation

个性化多智能体平均回报TD学习 via 联合线性近似

Leo Muxing Wang, Pengkun Yang, Lili Su

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 本文提出通过联合线性近似实现个性化多智能体平均回报TD学习,通过共享子空间和局部头部的分解,有效缓解信号冲突并实现线性加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10851 2026-03-10 cs.RO

Preference-Conditioned Multi-Objective RL for Integrated Command Tracking and Force Compliance in Humanoid Locomotion

基于偏好条件的多目标强化学习用于人形机器人集成指令跟踪与力合规

Tingxuan Leng, Yushi Wang, Tinglong Zheng, Changsheng Luo, Mingguo Zhao

机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) Beijing Jiaotong University, Beijing 100044, China(北京交通大学,北京100044,中国)

AI总结 本文提出基于偏好的多目标强化学习框架,用于实现人形机器人在指令跟踪与力顺应性之间的平衡,通过用户指定偏好输入实现稳定训练和可部署的运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02937 2026-03-10 math.OC cs.LG stat.ML

Faster Gradient Methods for Highly-Smooth Stochastic Bilevel Optimization

更高效的梯度方法用于高光滑随机双层优化

Lesi Chen, Junru Li, El Mahdi Chayti, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institude(上海启智研究所) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

AI总结 本文提出F²SA-p方法,通过高阶有限差分提升随机双层优化的收敛速度,达到近最优的复杂度界。

Comments ICLR 2026; Add one additional author compared to v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06710 2026-03-10 cs.LG cs.AI stat.ML

Variational Learning of Gaussian Process Latent Variable Models through Stochastic Gradient Annealed Importance Sampling

通过随机梯度退火重要性采样学习高斯过程潜在变量模型

Jian Xu, Shian Du, Junmei Yang, Qianli Ma, Delu Zeng, John Paisley

机构 * South China University of Technology(华南理工大学) Tsinghua University(清华大学) Columbia University(哥伦比亚大学)

AI总结 本研究提出了一种基于退火重要性采样的方法,用于改进高斯过程潜在变量模型的变分推断,通过重新参数化ELBO提升效率,并在多个数据集上验证了其优越的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19931 2026-03-10 cs.CV cs.AI cs.LG

Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks

探索扩散模型在少样本微调中的腐蚀阶段并利用贝叶斯神经网络缓解

Xiaoyu Wu, Jiaru Zhang, Yang Hua, Bohan Lyu, Hao Wang, Tao Song, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen’s University Belfast(女王学院 Belfast) Tsinghua University(清华大学) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本研究通过贝叶斯神经网络缓解扩散模型在少样本微调中的腐蚀阶段问题,提升生成图像质量。

Comments Accepted by KDD' 26

详情

展开后加载摘要…

URL PDF HTML 收藏