arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-27 至 2026-08-27 共收录 19
2608.26101 2026-08-27 cs.CV 新提交

RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing

RefVideo-6M:一个用于教学视频编辑的可靠基于参考的数据集

Bojia Zi, Xiaoyan Yang, Yu Zhou, Ruijie Sun, Lihan Zhang, Bin Liang, Kam-Fai Wong, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) The Chinese University of Hong Kong (CUHK)(香港中文大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文针对现有视频编辑数据集的局限,构建含600万样本的RefVideo-6M参考引导编辑数据集,训练Ref-MoT模型,实验证明其监督更可靠,可提升编辑模型的视觉质量、可控性与参考一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25990 2026-08-27 cs.LG 新提交

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon

频谱分配:为何Muon优于Adam,以及如何改进Muon

Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学)

AI总结 本文通过频谱分析揭示Muon优于Adam的机制,提出SAMuon及其简化版SAMuon-lite,在多规模modded-nanogpt模型上,二者均优于AdamW和Muon,且SAMuon可减少13.3%-24.0%训练令牌。

Comments 34 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25872 2026-08-27 cs.RO 新提交

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

VISTA:用于接触丰富操作的视觉推断空间接触注意力机制

Jiayi Chen, Wenlong Dong, Yan Huang, Xianglin Chen, Zijian Lin, Jiaqi Yin, Yushan Liu, Wenbo Ding

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Southern University of Science and Technology(南方科技大学) School of Future Technology, Harbin Institute of Technology(哈尔滨工业大学未来技术学院)

AI总结 针对接触丰富操作的视觉反馈不足问题,提出基于VDF的VISTA-Policy,通过整合物理感知编码引擎等模块,在多任务上优于纯视觉与触觉基准,具分布外泛化及抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25823 2026-08-27 cs.LG cs.MM 新提交

Learning Continuous Regional Temperature Fields with Lead-Time and Resolution Queries

基于提前期与分辨率查询的连续区域温度场学习

Chunlei Shi, Jiong Wang, Yi-Lin Wei, Junming Hou, Jinjin Liu, Yecheng Zhang, Dan Niu

机构 * Southeast University(东南大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

AI总结 该研究针对现有区域温度预报器输出固定的问题,提出CSTF模型,通过引入提前期、分辨率等查询实现灵活的温度预报,在基准测试中降低了17.0%的偏差,表现出更优性能。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25618 2026-08-27 cs.CL 新提交

AWM: Answerable Working Memory for Long-Document VQA Agents

AWM:面向长文档VLM智能体的可回答工作记忆

Dongzhuoran Zhou, Yuqicheng Zhu, Yule Liu, Zhen Yang, Rui Lu, Yuxiao Dong, Jie Tang, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 针对长文档VQA智能体的记忆质量盲区,提出AWM方法,通过融入仅记忆可回答性的GRPO奖励机制,提升了最终答案准确率并降低记忆缺失正确的比例。

Comments EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25572 2026-08-27 cs.RO cs.AI 新提交

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models

ConfAL-WM:用于动作条件世界模型的置信度引导主动学习

Xiang Liu, Sen Cui, Changshui Zhang

机构 * Tsinghua University(清华大学)

AI总结 针对动作条件世界模型在新场景下的局部错误问题,提出ConfAL-WM框架,基于EVAC和UNet实现置信度引导的高效数据选择与局部训练增强,在RoboTwin2.0上验证了其提升训练效率与预测质量的效果。

Comments Project page: this https URL (https://ConfAL-WM.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25417 2026-08-27 cs.AI 新提交

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24945 2026-08-27 cs.LG cs.AI cs.DC 新提交

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

FAMPWQ:基于费舍尔信息的自适应混合精度权重量化方法,用于高效的大语言模型推理

Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Hithink Research(海思睿研究中心) Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 针对LLM部署的资源瓶颈,该研究提出FAMPWQ方法,通过费舍尔信息度量层敏感度结合强化学习分配位宽,在7个模型和5个基准上优于7种基线方法,提升了量化性能。

Comments 21 pages, to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24886 2026-08-27 cs.AI 新提交

VLM-based automatic multi-granularity graph representation of building layouts for design informatics

基于视觉语言模型的建筑布局多粒度图自动表示方法,用于设计信息学

Song Guo, Zhuoshi Chen, Maosu Li, Weimin Zhuang

机构 * Massachusetts Institute of Technology(麻省理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 本研究提出基于VLM的多粒度图自动构建方法,以147份高校图书馆平面图为案例,验证其生成的图与人工标注图一致性良好,可用于设计信息学相关任务,提升建筑全生命周期设计信息利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-27 cs.CV cs.AI 版本更新

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17648 2026-08-27 cs.AI 版本更新

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-08-27 cs.AI 版本更新

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03361 2026-08-27 cs.LG 版本更新

Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

缓解虚假信用传播:基于概率图奖励聚合的准则强化学习

Can Lv, Mingju Chen, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

AI总结 针对准则奖励中因忽略准则间依赖关系导致的虚假信用传播问题,提出概率图框架Graphical Event Aggregation for Rubric rewards (GEAR),通过建模潜在伯努利事件和软抑制传播实现依赖感知的奖励聚合,在多个基准上提升性能并减少信用泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06228 2026-08-27 cs.CV 版本更新

Low-Latency Event-Based Object Detection with Spatially-Sparse Linear Attention

低延迟基于事件的对象检测与空间稀疏线性注意力

Haiqing Hao, Zhipeng Sui, Rong Zou, Zijia Dai, Nikola Zubić, Davide Scaramuzza, Wenhui Wang

机构 * Tsinghua University(清华大学) University of Zurich(苏黎世大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出SSLA,一种空间稀疏线性注意力机制,用于提升基于事件的目标检测效率与精度,实现低延迟性能。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-27 cs.CV cs.AI cs.LG 版本更新

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-08-27 cs.LG cs.AI 版本更新

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏