arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-27 至 2026-01-27 共收录 22
2601.18771 2026-01-27 cs.CL cs.AI cs.IR

Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory

Dep-Search: 基于持久记忆的学习依赖意识推理轨迹

Yanming Liu, Xinyue Peng, Zixuan Yan, Yanxin Shen, Wenjie Xu, Yuefeng Huang, Xinyi Wang, Jiannan Cao, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Intel Corporation(英特尔公司) Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。

Comments Dep-Search 1st version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18255 2026-01-27 cs.LG cs.AI

Beyond Retention: Orchestrating Structural Safety and Plasticity in Continual Learning for LLMs

超越保留:在连续学习中协调结构安全与可塑性

Fei Meng

机构 * Yangtze Delta Region Institute of Tsinghua University(清华大学 Yangtze Delta 区研究所)

AI总结 本文提出OSW方法,通过正交子空间唤醒协调连续学习中的结构安全与可塑性,有效保留脆弱任务能力并维持新任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18222 2026-01-27 cs.CV

HomoFM: Deep Homography Estimation with Flow Matching

HomoFM:基于流匹配的深度视角估计

Mengfan He, Liangzheng Sun, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学航空航天工程学院)

AI总结 HomoFM通过引入流匹配技术,首次将生成建模中的速度场学习应用于视角估计,提升估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10977 2026-01-27 cs.AI cs.CL

Revisiting Model Interpolation for Efficient Reasoning

重新审视模型插值以实现高效推理

Taiqiang Wu, Runming Yang, Tao Liu, Jiahao Wang, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 本文重新审视模型插值方法,发现其遵循三阶段进化范式,并通过实验验证了其在高效推理中的优越性。

Comments 14 pages, 6 figures, 7 tables. Working in progress (Llama results added)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10203 2026-01-27 cs.CV

A Style-Based Profiling Framework for Quantifying the Synthetic-to-Real Gap in Autonomous Driving Datasets

基于风格的 profiling 框架用于量化自动驾驶数据集的合成到现实差距

Dingyi Yao, Xinyao Han, Ruibo Ming, Zhihang Song, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 本文提出基于风格的 profiling 框架,通过 SEDD 度量标准量化合成与现实数据集的差距,提升自动驾驶数据集的质量控制。

Comments Accepted for publication at the 2026 IEEE Intelligent Vehicles Symposium (IEEE IV 2026)

Journal ref 2026 IEEE Intelligent Vehicles Symposium (IEEE IV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17507 2026-01-27 cs.RO

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17275 2026-01-27 cs.LG cs.AI

Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning

潜在空间对比强化学习用于稳定高效的LLM推理

Lianlei Shan, Han Chen, Yixuan Wang, Zhenjie Liu, Wei Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) EvolutionLeap(进化跃迁) Tsinghua University(清华大学)

AI总结 本研究提出深度潜在推理(DLR),通过潜在空间对比强化学习提升LLM在复杂推理任务中的稳定性与效率。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23077 2026-01-27 cs.RO

Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models

具身学习奖励以实现肌肉骨骼控制与视觉语言模型

Saraswati Soedarmadji, Yunyue Wei, Chen Zhang, Yisong Yue, Yanan Sui

机构 * Tsinghua University(清华大学) California Institute of Technology(加州理工学院)

AI总结 本文提出MoVLR框架,利用视觉语言模型实现高维肌肉骨骼系统的具身学习,通过迭代交互发现和改进奖励函数。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17570 2026-01-27 cs.LG cs.AI cs.PF

GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping

GreedySnake: 通过高效调度和优化器步长重叠加速SSD卸载的LLM训练

Yishu Yin, Xuehai Qian

机构 * Tsinghua University(清华大学)

AI总结 GreedySnake通过高效调度和优化器步长重叠,显著提升了SSD卸载LLM训练的吞吐量,实验显示在不同规模的GPU上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13185 2026-01-27 physics.ao-ph cs.AI cs.LG

CondensNet: Enabling stable long-term climate simulations via hybrid deep learning models with adaptive physical constraints

CondensNet:通过混合深度学习模型与自适应物理约束实现稳定的长期气候模拟

Xin Wang, Jianda Chen, Juntao Yang, Jeff Adie, Simon See, Kalli Furtado, Chen Chen, Troy Arcomano, Romit Maulik, Wei Xue, Gianmarco Mengaldo

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) NVIDIA AI Technology Centre(NVIDIA人工智能技术中心) Centre for Climate Research Singapore(新加坡气候研究中心) Environmental Science Division, Argonne National Laboratory(阿贡国家实验室环境科学部) Information Sciences and Technology Department, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术系)

AI总结 CondensNet通过引入自适应物理约束,解决了混合模型中凝结过程的不稳定性问题,提升了长期气候模拟的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03167 2026-01-27 cs.CV cs.GR

CloSET: Modeling Clothed Humans on Continuous Surface with Explicit Template Decomposition

CloSET: 基于连续表面建模的着装人类建模

Hongwen Zhang, Siyou Lin, Ruizhi Shao, Yuxiang Zhang, Zerong Zheng, Han Huang, Yandong Guo, Yebin Liu

机构 * Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

AI总结 CloSET通过分解显式服装模板并学习姿态依赖的褶皱,提升服装变形建模的精度和泛化能力。

Comments CVPR 2023 Paper, Update project page: https://zhanghongwen.cn/closet

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06400 2026-01-27 cs.CV

PyMAF-X: Towards Well-aligned Full-body Model Regression from Monocular Images

PyMAF-X:迈向从单目图像中恢复对齐的完整身体模型

Hongwen Zhang, Yating Tian, Yuxiang Zhang, Mengcheng Li, Liang An, Zhenan Sun, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Computer Science and Technology, Nanjing University(计算机科学与技术系,南京大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

AI总结 PyMAF-X通过改进的回归方法实现从单目图像中准确恢复对齐的完整身体模型,提升了网格与图像的对齐性能。

Comments Article in IEEE TPAMI 2023, Update project page: https://zhanghongwen.cn/pymaf-x, An eXpressive extension of PyMAF [arXiv:2103.16507] for monocular human/hand/face/whole-body motion capture

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17058 2026-01-27 cs.DB cs.AI cs.CL cs.LG

Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs

大模型能帮你清理数据吗?基于大模型的应用级数据准备综述

Wei Zhou, Jun Zhou, Haoyu Wang, Zhenghao Li, Qikang He, Shaokun Han, Guoliang Li, Xuanhe Zhou, Yeye He, Chunwei Liu, Zirui Tang, Bin Wang, Shen Tang, Kai Zuo, Yuyu Luo, Zhenzhe Zheng, Conghui He, Jingren Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团)

AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。

Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17047 2026-01-27 cs.CV cs.LG eess.IV

A Contrastive Pre-trained Foundation Model for Deciphering Imaging Noisomics across Modalities

一种用于跨模态解码成像噪声组学的对比预训练基础模型

Yuanjie Gu, Yiqun Wang, Chaohui Yu, Ang Xuan, Fan Wang, Zhi Lu, Biqin Dong

机构 * College of Biomedical Engineering, Yiwu Research Institute, Fudan University, Shanghai, China(复旦大学生物医学工程学院) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(清华大学心理学与认知科学系) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) DAMO Academy, Alibaba Group, Beijing, China(阿里云达摩院) Hupan Laboratory, Hangzhou, Zhejiang, China(华平实验室)

AI总结 本文提出CoP基础模型,通过对比学习解码成像噪声,实现无需大量数据的高性能噪声分析,提升跨模态成像诊断的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17021 2026-01-27 q-fin.PM cs.LG cs.MA

Regret-Driven Portfolios: LLM-Guided Smart Clustering for Optimal Allocation

后悔驱动的组合:LLM引导的智能聚类用于最优分配

Muhammad Abro, Hassan Jaleel

机构 * Lahore University of Management Sciences(拉合尔管理科学大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quant研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 本文提出一种LLM引导的智能聚类方法,通过整合在线学习动态和市场情绪指标,构建高夏普比率的投资组合,实现优于传统基准的收益和风险控制。

详情

展开后加载摘要…

URL PDF HTML 收藏