arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-02-17 至 2026-02-17 共收录 28
2509.16117 2026-02-17 cs.LG cs.AI cs.CV

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04641 2026-02-17 cs.CV cs.AI cs.LG

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟现实世界:多模态生成模型的统一综述

Yuqi Hu, Longguang Wang, Xian Liu, Ling-Hao Chen, Yuwei Guo, Yukai Shi, Ce Liu, Anyi Rao, Zeyu Wang, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术研究所,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR(计算机科学与工程系,香港科学与技术大学香港特别行政区) MMLab, The Hong Kong University of Science and Technology(多模态实验室,香港科学与技术大学) School of Electronics and Communication Engineering, Shenzhen Campus of Sun Yat-sen University(电子与通信工程学院,中山大学深圳校区) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) Tsinghua University, Guangdong, China(清华大学,广东,中国) Bosch (China) Investment Co., Ltd., Shanghai, China(博世(中国)投资有限公司,上海,中国)

AI总结 本文首次系统性地统一研究了2D、视频、3D和4D生成,为多模态生成模型和现实世界模拟提供了统一框架的综述。

Comments Repository for the related papers at https://github.com/ALEEEHU/World-Simulator

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14577 2026-02-17 cs.CV

DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving

DriveFine: 通过细化增强的掩码扩散VLA实现精确且鲁棒的驾驶

Chenxu Dang, Sining Ang, Yongkang Li, Haochen Tian, Jie Wang, Guang Li, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

AI总结 DriveFine提出一种结合灵活解码与自我纠正能力的掩码扩散VLA模型,通过插件式块MoE和混合强化学习策略提升自动驾驶规划的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14470 2026-02-17 cs.CL

HyperRAG: Reasoning N-ary Facts over Hypergraphs for Retrieval Augmented Generation

HyperRAG:基于超图的n元事实推理用于检索增强生成

Wen-Sheng Lien, Yu-Kai Chan, Hao-Lung Hsiao, Bo-Kai Ruan, Meng-Fen Chiang, Chien-An Chen, Yi-Ren Yeh, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Kaohsiung Normal University(国立高雄师范大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-勒克努尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 HyperRAG通过n元超图推理提升检索增强生成的准确性与效率

Comments Accepted by The ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14452 2026-02-17 cs.LG cs.AI

WiSparse: Boosting LLM Inference Efficiency with Weight-Aware Mixed Activation Sparsity

WiSparse: 通过权重感知混合激活稀疏性提升大语言模型推理效率

Lei Chen, Yuan Meng, Xiaoyu Zhan, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 WiSparse通过结合激活和权重信息,实现高效的大语言模型推理,以50%稀疏率保持97%性能并提升21.4%推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14225 2026-02-17 cs.AI

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14214 2026-02-17 cs.CV

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

HiVid: 基于大语言模型的视频显著性识别用于内容感知点播与直播

Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

机构 * Tsinghua University(清华大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

AI总结 HiVid利用大语言模型生成内容感知的视频显著性权重,提升点播和直播的QoE性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13993 2026-02-17 cs.CV

Elastic Diffusion Transformer

弹性扩散变换器

Jiangshan Wang, Zeqiang Lai, Jiarui Chen, Jiayi Guo, Hang Guo, Xiu Li, Xiangyu Yue, Chunchao Guo

机构 * Tsinghua University(清华大学) MMLab, CUHK(CUHK实验室) Tencent Hunyuan(腾讯文言)

AI总结 E-DiT通过自适应加速框架提升扩散变换器效率,保持生成质量,实现约2倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13832 2026-02-17 cs.CL

Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind

超越词语:通过心灵理论评估和弥合用户代理交互中的认知分歧

Minyuan Ruan, Ziyue Wang, Kaiming Liu, Yunghwei Lai, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China

AI总结 本文提出通过心灵理论评估和弥合用户代理交互中的认知分歧,通过强化学习提升模型对用户心理状态的推理能力,从而增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13738 2026-02-17 cs.AI

OneLatent: Single-Token Compression for Visual Latent Reasoning

OneLatent:视觉潜在推理中的单令牌压缩

Bo Lv, Yasheng Sun, Junjie Wang, Haoxiang Shi

机构 * Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所) Waseda University(早稻田大学)

AI总结 OneLatent通过将中间推理压缩为单个潜在令牌,提升了视觉推理效率,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13103 2026-02-17 cs.LG

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

R-Diverse: 缓解自博弈LLM训练中的多样性幻觉

Gengsheng Li, Jinghan He, Shijie Wang, Dan Zhang, Ruiqi Liu, Renrui Zhang, Zijun Yao, Junfeng Fang, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12063 2026-02-17 cs.RO

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-02-17 cs.LG cs.AI

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11087 2026-02-17 cs.LG cs.AI cs.CL

Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization

通过基于SVD的量化误差最小化增强LLM中的delta压缩

Boya Xiong, Shuo Wang, Weifeng Ge, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance(上海财经大学) Tsinghua University(清华大学) Fudan University(复旦大学) Southern University of Science(南方科技大学)

AI总结 PrinMix通过基于SVD的量化误差最小化方法,提升LLM中delta压缩的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19645 2026-02-17 cs.LG cs.AI

MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE

MoESD: 解开投机解码在加速稀疏MoE中的潜力

Zongle Huang, Lei Zhu, Zongyuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu, Tianyu Zhang

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 MoESD研究揭示了投机解码在加速稀疏MoE模型中的潜力,提出目标效率指标以更全面理解SD加速效果。

Comments Accepted as spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-02-17 cs.MA cs.AI

MAS-on-the-Fly: Dynamic Adaptation of LLM-based Multi-Agent Systems at Test Time

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13641 2026-02-17 cs.RO cs.SY eess.SY

SPLIT: Sparse Incremental Learning of Error Dynamics for Control-Oriented Modeling in Autonomous Vehicles

SPLIT: 基于误差动态的稀疏增量学习用于自动驾驶车辆的控制导向建模

Yaoyu Li, Chaosheng Huang, Jun Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

AI总结 SPLIT通过稀疏增量学习框架提升自动驾驶车辆的控制导向建模精度与适应性。

Comments 21 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13515 2026-02-17 cs.CV cs.LG

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

SpargeAttention2: 通过混合Top-k+Top-p掩码和蒸馏微调实现可训练稀疏注意力

Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学)

AI总结 SpargeAttention2通过混合Top-k+Top-p掩码和蒸馏微调,实现高稀疏性且不降低生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13315 2026-02-17 cs.CV cs.AI

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner: 在视觉令牌修剪中协调重要性与多样性

Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

机构 * School of Software, Tsinghua University(清华大学软件学院) Tencent(腾讯)

AI总结 IDPruner通过协调重要性与多样性,提出了一种高效的视觉令牌修剪方法,实现最优平衡并提升多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13262 2026-02-17 cs.AI cs.CL

General learned delegation by clones

通过克隆实现通用学习委托

Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)

AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。

Comments Code available at https://github.com/SuffixAutomata/SELFCEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03796 2026-02-17 cs.CV

3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

面向视图自适应的人体视频生成的3D感知隐式运动控制

Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学) CASIA

AI总结 3DiMo通过隐式运动表示和视图丰富监督,提升视频生成中的人体运动保真度和视觉质量。

Comments Project Page: https://hjrphoebus.github.io/3DiMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23232 2026-02-17 cs.CV cs.AI

ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search

ShotFinder: 通过网络搜索驱动的开放域视频镜头检索

Tao Yu, Haopeng Jin, Hao Wang, Shenghua Chai, Yujia Yang, Junhao Gong, Jiaming Guo, Minghui Zhang, Xinlong Chen, Zhenghao Zhang, Yuxuan Zhou, Yufei Xiong, Shanbin Zhang, Jiabing Yang, Hongzhu Yi, Xinming Wang, Cheng Zhong, Xiao Ma, Zhang Zhang, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) Lenovo(联想集团) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ShotFinder通过网络搜索驱动开放域视频镜头检索,提出三阶段检索流程并揭示多模态大模型在开放域视频检索中的性能差距。

Comments 28 pages, 7 figures, Project website: https://github.com/yutao1024/ShotFinder

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00787 2026-02-17 cs.CV

Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models

基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long

机构 * Jinan University, Guangzhou, China Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China Western University, Ontario, Canada Guangdong University of Technology, Guangzhou, China Tsinghua University, Beijing, China

AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。

详情

展开后加载摘要…

URL PDF HTML 收藏