arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-09 至 2025-12-09 共收录 22
2512.07831 2025-12-09 cs.CV

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07590 2025-12-09 cs.CV

Robust Variational Model Based Tailored UNet: Leveraging Edge Detector and Mean Curvature for Improved Image Segmentation

鲁棒变分模型基于定制UNet:利用边缘检测器和均值曲率以提高图像分割

Kaili Qi, Zhongyi Huang, Wenli Yang

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Mathematics, China University of Mining and Technology(中国矿业大学(北京)数学学院)

AI总结 本文提出了一种结合变分方法和深度学习的鲁棒UNet模型,通过引入边缘检测器和均值曲率项,提升图像分割的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07503 2025-12-09 cs.CV

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07381 2025-12-09 cs.CV

Tessellation GS: Neural Mesh Gaussians for Robust Monocular Reconstruction of Dynamic Objects

Tessellation GS:基于神经网格高斯的鲁棒单目动态物体重建

Shuohan Tao, Boyao Zhou, Hanzhang Tu, Yuwang Wang, Yebin Liu

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学)

AI总结 Tessellation GS通过基于网格面的神经高斯方法实现单目动态物体的鲁棒重建,显著提升了稀疏视角和动态场景下的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07289 2025-12-09 cond-mat.mtrl-sci cs.LG

Equivariant Diffusion for Crystal Structure Prediction

等价扩散用于晶体结构预测

Peijia Lin, Pin Chen, Rui Jiao, Qing Mo, Jianhuan Cen, Wenbing Huang, Yang Liu, Dan Huang, Yutong Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University, Guangzhou, China National Supercomputer Center in Guangzhou, China Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Institute for AIR, Tsinghua University, Beijing, China Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China Beijing Key Laboratory of Big Data Management Analysis Methods, Beijing, China

AI总结 EquiCSP通过等价扩散模型解决晶体结构预测中的对称性问题,提升生成结构的准确性并加快训练收敛速度。

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07253 2025-12-09 cs.CV cs.AI

DGGAN: Degradation Guided Generative Adversarial Network for Real-time Endoscopic Video Enhancement

DGGAN:退化引导的生成对抗网络用于实时内窥镜视频增强

Handing Xu, Zhenguo Nie, Tairan Peng, Huimin Pan, Xin-Jun Liu

机构 * Department of Mechanical Engineering(机械工程系) State Key Laboratory of Tribology in Advanced Equipment(先进设备摩擦学国家重点实验室) Beijing Key Laboratory of Transformative High-end Manufacturing Equipment and Technology(北京 transformative 高端制造装备与技术重点实验室) Tsinghua University(清华大学)

AI总结 DGGAN通过退化感知建模实现内窥镜视频的实时高质量增强,采用对比学习提取退化表示并融合至单帧增强模型中,提升鲁棒性和泛化能力。

Comments 18 pages, 8 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07170 2025-12-09 cs.CV cs.AI

Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach

迈向统一的语义和可控图像融合:一种扩散变换器方法

Jiayang Li, Chengjie Jiang, Junjun Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electronic Information School, Wuhan University(武汉大学电子信息学院)

AI总结 DiTFuse通过融合图像与自然语言指令,实现端到端、语义感知的图像融合,统一了多种融合任务并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07005 2025-12-09 cs.SD cs.AI

Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition

多语调普通话干声唱Dataset:歌唱语调识别基准

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学) Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学)

AI总结 本文提出多语调普通话干声唱语料库,用于评估语音模型在歌唱场景中的表现,并探讨方言和元音对语调变化的影响。

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12714-12721, October 27, 2025. Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04952 2025-12-09 cs.CV cs.RO

FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization

FASTer:通过神经动作分词实现高效的自回归视觉语言动作建模

Yicheng Liu, Shiduo Zhang, Zibin Dong, Baijun Ye, Tianyuan Yuan, Xiaopeng Yu, Linqi Yin, Chenhao Lu, Junhao Shi, Luca Jiang-Tao Yu, Liangtao Zheng, Tao Jiang, Jingjing Gong, Xipeng Qiu, Hang Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Galaxea AI Tianjin University(天津大学) Hong Kong University(香港大学) UCSD(加州大学圣地亚哥分校)

AI总结 FASTer通过神经动作分词实现高效自回归视觉语言动作建模,提升机器人学习的推理效率和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01485 2025-12-09 cs.AI cs.LG

Multi-Path Collaborative Reasoning via Reinforcement Learning

基于强化学习的多路径协作推理

Jindi Lv, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Guan Huang, Jiancheng Lv

机构 * Sichuan University(四川大学) GigaAI Tsinghua University(清华大学)

AI总结 本文提出M3PO框架,通过多路径协作机制提升大语言模型的推理能力,实现更可靠和高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06449 2025-12-09 cs.LG cs.AI

FLEX: Continuous Agent Evolution via Forward Learning from Experience

FLEX: 通过经验向前学习实现连续智能体进化

Zhicheng Cai, Xinyuan Guo, Yu Pei, Jiangtao Feng, Jinsong Su, Jiangjie Chen, Ya-Qin Zhang, Wei-Ying Ma, Mingxuan Wang, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) ByteDance Seed(字节跳动种子) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Informatics, Xiamen University(厦门大学信息学院) SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR实验室和字节跳动种子)

AI总结 FLEX通过经验向前学习实现LLM智能体的持续进化,提升数学推理、化学逆合成和蛋白质预测性能,并揭示经验增长的扩展规律和跨智能体的经验继承现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19397 2025-12-09 cs.LG

Are Time-Series Foundation Models Deployment-Ready? A Systematic Study of Adversarial Robustness Across Domains

时间序列基础模型是否已准备好部署?跨领域的对抗鲁棒性系统研究

Jiawen Zhang, Zhenwei Zhang, Shun Zheng, Xumeng Wen, Jia Li, Jiang Bian

机构 * HKUST (GZ)(香港科技大学) Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本研究系统分析了时间序列基础模型在跨领域对抗攻击下的鲁棒性,揭示了模型脆弱性及改进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16401 2025-12-09 cs.LG

Exploring the Hidden Reasoning Process of Large Language Models by Misleading Them

通过误导性训练探索大型语言模型的隐藏推理过程

Guanyu Chen, Peiyang Wang, Yizhou Jiang, Yuqian Liu, Chujie Zhao, Ying Fang, Tianren Zhang, Feng Chen

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) College of Computer and Cyber Security, Fujian Normal University(计算机与网络安全学院,福建师范大学)

AI总结 本文通过误导性训练方法探索LLMs的隐藏推理过程,发现其具备在任务抽象前进行推理的内部机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09620 2025-12-09 cs.CV cs.AI cs.CL

Exploring the Potential of Encoder-free Architectures in 3D LMMs

探索无编码器架构在3D大语言模型中的潜力

Yiwen Tang, Zoey Guo, Zhuhao Wang, Ray Zhang, Qizhi Chen, Junli Liu, Delin Qu, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Tele AI

AI总结 本文提出首个无编码器3D大语言模型ENEL,通过嵌入语义编码和分层几何聚合策略,在3D理解任务中达到与SOTA模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06506 2025-12-09 econ.GN cs.AI q-fin.EC stat.AP

AI as "Co-founder": GenAI for Entrepreneurship

AI作为'联合创始人':生成式人工智能与创业

Junhui Jeff Cai, Xian Gu, Liugang Sheng, Mengjia Xia, Linda Zhao, Wu Zhu

机构 * Mendoza College of Business, University of Notre Dame(诺丁汉大学梅森商学院) Department of Finance, Durham University Business School(杜伦大学商学院金融系) Department of Economics, The Chinese University of Hong Kong(香港中文大学经济系) Department of Economics, The University of Pennsylvania(宾夕法尼亚大学经济系) Wharton School, The University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Department of Finance, SEM, Tsinghua University(清华大学经济管理学院金融系)

AI总结 本文研究生成式人工智能对创业的影响,发现其通过促进小企业创立,增强了市场竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06457 2025-12-09 cs.LG eess.SP

BitStopper: An Efficient Transformer Attention Accelerator via Stage-fusion and Early Termination

BitStopper: 一种通过阶段融合和提前终止的高效Transformer注意力加速器

Huizheng Wang, Hongbin Wang, Shaojun Wei, Yang Hu, Shouyi Yin

机构 * School of Integrated Circuits Tsinghua University Beijing, China(集成电路学院清华大学北京中国) School of Integrated Circuits Tsinghua University Beijing, China Shanghai Artificial Intelligence Laboratory Shanghai, China(集成电路学院清华大学北京中国上海人工智能实验室上海中国)

AI总结 BitStopper通过阶段融合和提前终止技术,提升Transformer注意力加速器的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06373 2025-12-09 cs.CV

VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning

VG-Refiner: 通过代理强化学习实现工具精细化的指称 grounded 推理

Yuji Wang, Wenlong Liu, Jingxuan Niu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

AI总结 VG-Refiner通过代理强化学习实现工具精细化的指称 grounded 推理,引入两阶段思考-重新思考机制和细化奖励,提升指称和推理接地任务的准确性和修正能力。

Comments The project page is [this url](https://github.com/VoyageWang/VG-Refiner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06353 2025-12-09 cs.CV

TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search

TreeQ: 通过树结构混合精度搜索推动扩散变换器的量化边界

Kaicheng Yang, Kaisen Yang, Baiting Wu, Xun Zhang, Qianrui Yang, Haotong Qin, He Zhang, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) Adobe Research(Adobe研究院)

AI总结 TreeQ通过树结构混合精度搜索方法,首次在DiT模型上实现接近无损的4位PTQ性能,解决了DiT量化中的关键挑战。

Comments Code and Supplementary Material could be found at https://github.com/racoonykc/TreeQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06275 2025-12-09 cs.CV

FacePhys: State of the Heart Learning

FacePhys: 心脏状态学习的现状

Kegang Wang, Jiankai Tang, Yuntao Wang, Xin Liu, Yuxuan Fan, Jiatong Ji, Yuanchun Shi, Daniel McDuff

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学)

AI总结 FacePhys通过时-空状态空间对偶性实现高效的rPPG算法,显著降低错误率,支持低延迟实时推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16329 2025-12-09 cs.CR cs.AI cs.CV

DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling

通过分布建模实现文本到图像生成系统可扩展的红队测试

Boheng Li, Junjie Wang, Yiming Li, Zhiyang Hu, Leyi Qi, Jianshuo Dong, Run Wang, Han Qiu, Zhan Qin, Tianwei Zhang

机构 * School of Cyber Science(网络安全学院) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DREAM通过分布建模实现文本到图像生成系统的可扩展红队测试,有效发现多样化的有害提示,提升安全性和多样性。

Comments To appear in the IEEE Symposium on Security & Privacy, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21027 2025-12-09 cs.LG cs.AI

TabAttackBench: A Benchmark for Adversarial Attacks on Tabular Data

TabAttackBench: 一种针对表格数据对抗攻击的基准测试

Zhipeng He, Chun Ouyang, Lijie Wen, Cong Liu, Catarina Moreira

机构 * School of Information Systems, Queensland University of Technology(昆士兰理工大学信息系统学院) Center for Data Science, Queensland University of Technology(昆士兰理工大学数据科学中心) School of Software, Tsinghua University(清华大学软件学院) NOVA Information Management School, NOVA University of Lisbon(里斯本大学NOVA信息管理学院) Data Science Institute, University of Technology Sydney(悉尼科技大学数据科学研究院) INESC-ID/Instituto Superior Técnico, University of Lisboa(里斯本大学INESC-ID/技术高等学院)

AI总结 TabAttackBench通过评估五种白盒攻击算法在不同模型和数据集上的表现,揭示了基于ℓ∞和ℓ2攻击在有效性与隐蔽性之间的权衡,为设计更隐蔽的对抗攻击提供了新思路。

Comments 71 pages, 21 figures, 11 tables

Journal ref Expert Systems with Applications 301 (2026) 130491

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17507 2025-12-09 cs.LG physics.chem-ph

Ensemble Learning of Machine Learning Force Fields

机器学习力场的集成学习

Bangchen Yin, Yue Yin, Yuda W. Tang, Hai Xiao

机构 * Department of Chemistry, Tsinghua University(清华大学化学系)

AI总结 EL-MLFFs通过集成学习框架整合多种机器学习力场,提升分子和材料模拟的预测精度与稳定性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏