arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-30 至 2025-12-30 共收录 15
2512.23705 2025-12-30 cs.CV

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23422 2025-12-30 cs.CL

Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data

熵引导的标记丢弃:在有限领域数据下训练自回归语言模型

Jiapeng Wang, Yiwen Hu, Yanzipeng Gao, Haoyu Wang, Shuo Wang, Hongyu Lu, Jiaxin Mao, Wayne Xin Zhao, Junyi Li, Xiao Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

AI总结 本文提出熵引导的标记丢弃方法,通过正则化优化解决有限领域数据下自回归模型的性能退化问题,实验表明其在多轮训练中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22830 2025-12-30 cs.CV

3D Scene Change Modeling With Consistent Multi-View Aggregation

基于一致多视角聚合的3D场景变化建模

Zirui Zhou, Junfeng Ni, Shujie Zhang, Yixin Chen, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 SCaR-3D通过一致多视角聚合实现3D场景变化检测,结合2D差分与投票修剪模块,提升变化前后的状态分离能力,并引入CCS3D数据集和持续重建策略,实现高精度高效的变化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21003 2025-12-30 cs.CV

MVInverse: Feed-forward Multi-view Inverse Rendering in Seconds

MVInverse: 秒级多视角反向渲染

Xiangzuo Wu, Chengwei Ren, Jun Zhou, Xiu Li, Yuan Liu

机构 * Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 MVInverse提出一种高效的多视角反向渲染方法,通过前馈框架和一致性微调策略,在秒级内实现高精度的多视角一致性与真实场景泛化能力。

Comments 21 pages, 17 figures, 5 tables, project page: https://maddog241.github.io/mvinverse-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15965 2025-12-30 cs.LG cs.AI cs.DC

RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

RLinf: 通过宏到微流转换实现灵活高效的大型强化学习

Chao Yu, Yuanqing Wang, Zhen Guo, Hao Lin, Si Xu, Hongzhi Zang, Quanlu Zhang, Yongji Wu, Chunyang Zhu, Junhao Hu, Zixiao Huang, Mingjie Wei, Yuqing Xie, Ke Yang, Bo Dai, Zhexuan Xu, Jiakun Du, Xiangyuan Wang, Xu Fu, Letong Shi, Zhihao Liu, Kang Chen, Weilin Liu, Gang Liu, Boxun Li, Jianlei Yang, Zhi Yang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

AI总结 RLinf通过宏到微流转换范式,实现了高效灵活的大型强化学习训练系统,显著提升了训练吞吐量。

Comments GitHub Repo: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05822 2025-12-30 cs.CV

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06694 2025-12-30 cs.LG cs.CR

Breaking Data Silos: Towards Open and Scalable Mobility Foundation Models via Generative Continual Learning

打破数据孤岛:通过生成持续学习实现开放和可扩展的移动基础模型

Yuan Yuan, Yukun Liu, Chonghua Han, Jie Feng, Yong Li

机构 * Center for Urban Science and Computation(城市科学与计算中心) Tsinghua University(清华大学)

AI总结 MoveGCL通过生成持续学习实现开放和可扩展的移动基础模型,解决数据孤岛问题,实现跨机构协作与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14894 2025-12-30 cs.RO cs.SY eess.SY

Never too Cocky to Cooperate: An FIM and RL-based USV-AUV Collaborative System for Underwater Tasks in Extreme Sea Conditions

从不自大合作:一种基于FIM和强化学习的USV-AUV协作系统用于极端海况下的水下任务

Jingzehua Xu, Guanwen Xie, Jiwei Tang, Yimian Ding, Weiyi Liu, Junhao Huang, Shuai Zhang, Yi Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Data and Systems Engineering, The University of Hong Kong(数据与系统工程系,香港大学) School of Engineering Science, University of Chinese Academy of Sciences(工程科学学院,中国科学院大学) Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院)

AI总结 本文提出一种基于FIM和强化学习的USV-AUV协作系统,用于提升极端海况下水下任务的性能。

Comments This paper has been accepted by IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22737 2025-12-30 cs.CL

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

WeDLM:弥合扩散语言模型与标准因果注意力以实现快速推理

Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 WeDLM通过使用标准因果注意力实现高效并行解码,显著提升推理速度,优于优化的AR引擎。

Comments 23 pages, 8 figures, project page: https://wedlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22288 2025-12-30 cs.LG cs.AI cs.CV

Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

Co-GRPO:针对掩码扩散模型的协同优化组相对策略优化

Renping Zhou, Zanlin Ni, Tianyi Chen, Zeyu Liu, Yang Yue, Yulin Wang, Yuxuan Wang, Jingshu Liu, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 leap 实验室) Anyverse Dynamics

AI总结 Co-GRPO通过协同优化模型和调度参数提升掩码扩散模型的生成质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22188 2025-12-30 cs.CV cs.AI

HookMIL: Revisiting Context Modeling in Multiple Instance Learning for Computational Pathology

HookMIL: 重新审视多实例学习中的上下文建模以用于计算病理学

Xitong Ling, Minxi Ouyang, Xiaoxiao Li, Jiawen Li, Ying Chen, Yuxuan Sun, Xinrui Chen, Tian Guan, Xiaoping Liu, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Informatics, Xiamen University(厦门大学信息学院) School of Engineering, Westlake University(西湖大学工程学院) Zhongnan Hospital, Wuhan University(武汉大学中南医院)

AI总结 HookMIL通过引入可学习的钩子标记和多样性损失,提升多实例学习在计算病理学中的效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03332 2025-12-30 cs.LG cs.AI

Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models

探索分层信息有效性以实现小语言模型的后训练量化

He Xiao, Qingyao Yang, Dirui Xie, Wendong Xu, Zunhai Su, Runming yang, Wenyong Zhou, Haobo Liu, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 LieQ通过分层信息有效性量化方法,在亚8B模型中实现高效低比特压缩,减少精度损失并提升边缘设备部署可行性。

Comments low-bit quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11143 2025-12-30 cs.MA cs.AI cs.LG

Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework

在合作多智能体强化学习中实现全局最优的转换与蒸馏框架

Jianing Ye, Chenghao Li, Yongqiang Dou, Jianhao Wang, Guangwen Yang, Chongjie Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出TAD框架,通过将多智能体MDP转换为单智能体MDP并蒸馏策略,解决合作MARL中的优化问题,实现全局最优并提升执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏