arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-04 至 2025-12-04 共收录 15
2512.03918 2025-12-04 cs.CV

UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework

UniMo:基于自回归框架统一2D视频与3D人体运动

Youxin Pang, Yong Zhang, Ruizhi Shao, Xiang Deng, Feng Gao, Xu Xiaoming, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。

Comments https://carlyx.github.io/UniMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03759 2025-12-04 cs.CL cs.AI cs.LG

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

从序列层面视角出发的扩散大语言模型原理化强化学习

Jingyang Ou, Jiaqi Han, Minkai Xu, Shaoxuan Xu, Jianwen Xie, Stefano Ermon, Yi Wu, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) Stanford University(斯坦福大学) Lambda, Inc(Lambda公司) Tsinghua University(清华大学)

AI总结 本文提出ESPO,一种基于序列级优化的原理化强化学习框架,用于提升扩散大语言模型的生成能力,通过ELBO作为似然代理,显著优于token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03755 2025-12-04 cs.LG

Origin-Conditional Trajectory Encoding: Measuring Urban Configurational Asymmetries through Neural Decomposition

轨迹编码的起源条件:通过神经分解测量城市配置的不对称性

Stephen Law, Tao Yang, Nanjiang Chen, Xuhui Lin

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) University of Sydney(悉尼大学)

AI总结 本文提出一种条件轨迹编码器,通过神经分解测量城市配置的不对称性,解决轨迹学习与空间嵌入方法的碎片化问题,揭示城市形态对认知不平等的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03673 2025-12-04 cs.CV

ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers

ConvRot:基于旋转的插拔式4位量化用于扩散变换器

Feice Huang, Zuliang Han, Xing Zhou, Yihuang Chen, Lifei Zhu, Haoqian Wang

机构 * SIGS, Tsinghua University(清华大学信号与信息系) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

AI总结 ConvRot提出基于旋转的4位量化方法,通过正则Hadamard变换抑制异常值,实现扩散变换器的插拔式W4A4推理,提升速度和内存效率同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03577 2025-12-04 cs.CV

Cross-Stain Contrastive Learning for Paired Immunohistochemistry and Histopathology Slide Representation Learning

跨染色对比学习用于配对免疫组化和病理切片的表示学习

Yizhi Zhang, Lei Fan, Zhulin Tao, Donglin Di, Yang Song, Sidong Liu, Cong Cong

机构 * Communication University of China(通信大学) Tsinghua University(清华大学) Macquarie University(麦考瑞大学)

AI总结 本文提出CSCL方法,通过跨染色对比学习提升H&E与IHC特征的兼容性,实现高质量的切片级表示学习。

Comments 6 pages, 2 figures. Camera-ready version accepted for IEEE BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03556 2025-12-04 cs.RO cs.CV

RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL

RoboScape-R: 通用机器人训练的统一奖励-观测世界模型

Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

AI总结 RoboScape-R通过统一奖励-观测世界模型提升机器人训练的泛化能力,实现37.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03428 2025-12-04 cs.LG stat.ML

GaussDetect-LiNGAM:Causal Direction Identification without Gaussianity test

GaussDetect-LiNGAM:无需高斯性检验的因果方向识别

Ziyi Ding, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)

AI总结 GaussDetect-LiNGAM通过利用噪声高斯性与残差独立性的等价性,无需高斯性检验即可实现因果方向识别,提升因果推断的效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03418 2025-12-04 cs.CV cs.HC

YOLOA: Real-Time Affordance Detection via LLM Adapter

YOLOA:通过LLM适配器实现实时的可及性检测

Yuqi Ji, Junjie Ke, Lihuo He, Jun Liu, Kaifan Zhang, Yu-Kun Lai, Guiguang Ding, Xinbo Gao

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) School of Software, Tsinghua University(软件学院,清华大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。

Comments 13 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03369 2025-12-04 cs.CV cs.AI

FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting

FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测

Nan Zhou, Huandong Wang, Jiahao Li, Han Li, Yali Song, Qiuhua Wang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院) College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)

AI总结 FireSentry提出了一种多模态野火数据集和FiReDiff双模态范式,用于细粒度野火预测和动态灾害模拟,显著提升了视频和火斑掩膜的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02933 2025-12-04 cs.CV

LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization

LoVoRA: 基于文本引导和无掩码的视频对象移除与添加方法

Zhihan Xiao, Lin Liu, Yixin Gao, Xiaopeng Zhang, Haoxuan Che, Songping Mai, Qi Tian

机构 * Tsinghua University(清华大学) Huawei Inc.(华为公司) University of Science and Technology of China(中国科学技术大学)

AI总结 LoVoRA通过可学习的对象感知定位机制实现无掩码的视频对象移除与添加,结合图像到视频转换和光流传播,实现端到端视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00451 2025-12-04 cs.SD cs.MM

STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition

STCTS: 通过显式文本-语调-音色分解实现超低比特率语音的生成语义压缩

Siyu Wang, Haitao Li, Donglai Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 STCTS通过显式分解语音为语言内容、语调和音色,实现80bps下的高质量超低比特率语音压缩,兼顾效率与质量。

Comments The complete source code and online speech reconstruction demo is publicly available at https://github.com/dywsy21/STCTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17478 2025-12-04 cs.LG cs.AI physics.bio-ph q-bio.BM q-bio.QM

ConfRover: Simultaneous Modeling of Protein Conformation and Dynamics via Autoregression

ConfRover:通过自回归方法同时建模蛋白质构象与动力学

Yuning Shen, Lihao Wang, Huizhuo Yuan, Yan Wang, Bangji Yang, Quanquan Gu

机构 * ByteDance Seed(字节跳动种子基金) School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 ConfRover通过自回归方法同时建模蛋白质构象与动力学,支持时间依赖和时间无关的采样,首次在单一框架内实现蛋白质构象和轨迹的生成。

Comments 35 pages, 17 figures; Camera ready for NeurIPS 2025; Website: https://bytedance-seed.github.io/ConfRover

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18980 2025-12-04 cs.CL cs.AI cs.CV

IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web

IW-Bench: 评估大规模多模态模型的图像到网页转换能力

Hongcheng Guo, Wei Zhang, Junhao Chen, Yaonan Gu, Jian Yang, Junjia Du, Shaosheng Cao, Binyuan Hui, Tianyu Liu, Jianxin Ma, Chang Zhou, Zhoujun Li

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

AI总结 IW-Bench提出了一种新的基准,用于评估大规模多模态模型在图像到网页转换中的性能,通过元素准确率和布局准确率以及五跳提示方法来提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏