arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-05 至 2025-12-05 共收录 15
2512.04793 2025-12-05 cs.SD cs.AI

YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases

YingMusic-SVC: 实现现实场景下鲁棒的零样本歌声转换的Flow-GRPO与歌唱特定归纳偏置

Gongyu Chen, Xiaoyu Zhang, Zhenqiang Weng, Junjie Zheng, Da Shen, Chaofan Ding, Wei-Qiang Zhang, Zihao Chen

机构 * AI Lab, GiantNetwork(GiantNetwork人工智能实验室) University College London (UCL)(伦敦大学学院) East China University of Science and Technology(东华大学) SATLab, Tsinghua University(清华大学SAT实验室)

AI总结 YingMusic-SVC通过融合连续预训练、鲁棒监督微调和Flow-GRPO强化学习,实现了在现实场景下鲁棒的零样本歌声转换。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04786 2025-12-05 cs.CV

LaFiTe: A Generative Latent Field for 3D Native Texturing

LaFiTe:一种用于3D原生纹理生成的生成性潜在场

Chia-Hao Chen, Zi-Xin Zou, Yan-Pei Cao, Ze Yuan, Guan Luo, Xiaojuan Qi, Ding Liang, Song-Hai Zhang, Yuan-Chen Guo

机构 * Tsinghua University(清华大学) VAST The University of Hong Kong(香港大学)

AI总结 LaFiTe通过生成3D稀疏潜在颜色场,实现了高保真3D原生纹理生成,并支持材料合成与纹理超分辨率等下游应用。

Comments Project page: https://vast-ai-research.github.io/LaFiTe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04711 2025-12-05 cs.SD cs.AI

Large Speech Model Enabled Semantic Communication

基于大语音模型的语义通信

Yun Tian, Zhijin Qin, Guocheng Lv, Ye Jin, Kaibin Huang, Zhu Han

机构 * School of Electronics, Peking University(北京大学电子学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science and Engineering, Kyung Hee University(庆熙大学计算机科学与工程系)

AI总结 本文提出基于大语音模型的语义通信系统,利用Mimi编解码器和LoRA微调技术,实现适应性压缩与鲁棒传输,支持低带宽下的高质量语音传输。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04550 2025-12-05 cs.CL cs.AI

AdmTree: Compressing Lengthy Context with Adaptive Semantic Trees

AdmTree: 通过自适应语义树压缩长上下文

Yangning Li, Shaoshen Chen, Yinghui Li, Yankai Chen, Hai-Tao Zheng, Hui Wang, Wenhao Jiang, Philip S. Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 AdmTree通过自适应语义树实现高效上下文压缩,保留高语义保真度并减少计算开销。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04513 2025-12-05 cs.AI

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04504 2025-12-05 cs.CV

UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers

UltraImage: 重新思考图像扩散变换器中的分辨率外推

Min Zhao, Bokai Yan, Xue Yang, Hongzhou Zhu, Jintao Zhang, Shilong Liu, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, Tsinghua University(计算机科学与技术系,北京理工大学中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(光明人工智能学院,中国人民大学) Princeton University(普林斯顿大学)

AI总结 UltraImage通过修正主导频率和自适应注意力集中,解决了图像扩散变换器在高分辨率外推中的内容重复和质量下降问题,实现了高达6K*6K的生成能力。

Comments Project page: https://thu-ml.github.io/ultraimage.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04385 2025-12-05 cs.LG cs.AI cs.CV

STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting

STeP-Diff:用于移动细粒污染预报的时空物理指导扩散模型

Nan Zhou, Weijie Hong, Huandong Wang, Jianfeng Zheng, Qiuhua Wang, Yali Song, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Tech- nology (BNRist), Tsinghua University, China(电子工程系,北京信息科学与技术国家研究中心(BNRist),清华大学) Shenzhen Smartcity Communication, Shenzhen, China(深圳智慧城市通信) College of Soil and Water Conservation, Southwest Forestry University, China(水土保持学院,西南林业大学) College of Civil Engineering, Southwest Forestry University, China(土木工程学院,西南林业大学)

AI总结 STeP-Diff通过结合DeepONet和PDE指导的扩散模型,有效提升移动细粒污染预报的精度与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23256 2025-12-05 eess.SP cs.AI

Robust HRRP Recognition under Interrupted Sampling Repeater Jamming using a Prior Jamming Information-Guided Network

在中断采样重复干扰下利用先验干扰信息引导网络的鲁棒HRRP识别

Guozheng Sun, Lei Wang, Yanhao Wang, Jie Wang, Yimin Liu

机构 * Department of Electronic Engineering, Tsinghua University Beijing, China(电子工程系,清华大学北京,中国)

AI总结 本文提出了一种基于先验干扰信息引导的鲁棒HRRP识别方法,通过点扩散函数建模干扰失真并设计混合损失函数,提升模型在不同干扰参数下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01903 2025-12-05 cs.SD eess.AS

MelTok: 2D Tokenization for Single-Codebook Audio Compression

MelTok:单代码本音频压缩的2D分token化

Jingyi Li, Zhiyuan Zhao, Zhisheng Zhang, Yunfei Liu, Lijian Lin, Ye Zhu, Jiahao Wu, Qiuqiang Kong, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) Chinese University of Hong Kong(香港中文大学) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 MelTok通过二维分token化和基于分token的vocoder,实现单代码本下的高效音频压缩与高质量重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11273 2025-12-05 cs.CV

Synthetic Dataset Evaluation Based on Generalized Cross Validation

基于广义交叉验证的合成数据集评估

Zhihang Song, Dingyi Yao, Ruibo Ming, Lihui Peng, Danya Yao, Yi Zhang

机构 * Department of Automation Tsinghua University Beijing(自动化系清华大学北京)

AI总结 本文提出基于广义交叉验证的合成数据集评估框架,通过量化领域迁移性和模拟质量,提升合成数据评估的可比性和可推广性。

Comments Accepted for publication in IST 2025. Official IEEE Xplore entry will be available once published

Journal ref 2025 IEEE International Conference on Imaging Systems and Techniques (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05901 2025-12-05 cs.CL cs.AI

Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router

路由与推理:通过强化模型路由扩展大语言模型推理

Chenyang Shao, Xinyang Liu, Yutang Lin, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

AI总结 R2-Reasoner通过强化模型路由器实现高效的大语言模型推理扩展,减少API成本并保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11678 2025-12-05 cs.CY cs.CL

Which Type of Students can LLMs Act? Investigating Authentic Simulation with Graph-based Human-AI Collaborative System

哪些类型的学生可以被LLMs模拟?基于图-based人机协作系统的认证模拟研究

Haoxuan Li, Jifan Yu, Xin Cong, Yang Dang, Daniel Zhang-li, Lu Mi, Yisi Zhan, Huiqin Liu, Zhiyuan Liu

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) School of Education, Tsinghua University(教育学院,清华大学) Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出一种基于图的LLM-人协作系统,通过自动化评分和图传播技术生成高质量学生代理,验证其在模拟学生行为方面的有效性。

Comments This work has been submitted to AI Open for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16848 2025-12-05 cs.CV

A re-calibration method for object detection with multi-modal alignment bias in autonomous driving

面向自动驾驶的多模态对齐偏差校准方法

Zhihang Song, Dingyi Yao, Ruibo Ming, Lihui Peng, Danya Yao, Yi Zhang

机构 * Department of Automation Tsinghua University Beijing(自动化系清华大学北京)

AI总结 本文提出一种重新校准模型,通过语义分割和定制损失函数提升自动驾驶中多模态检测的鲁棒性和性能,应对校准偏差带来的影响。

Comments Accepted for publication in IST 2025. Official IEEE Xplore entry will be available once published

Journal ref 2025 IEEE International Conference on Imaging Systems and Techniques (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏