arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-09 至 2026-01-09 共收录 9
2601.05241 2026-01-09 cs.CV cs.AI cs.RO

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04542 2026-01-09 cs.LG cs.DC

Timeliness-Oriented Scheduling and Resource Allocation in Multi-Region Collaborative Perception

多区域协作感知中的时效导向调度与资源分配

Mengmeng Zhu, Yuxuan Sun, Yukuan Jia, Wei Chen, Bo Ai, Sheng Zhou

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院) Beijing National Research Center for Information Science and Technology, Department of Electronic Engineering, Tsinghua University(北京信息科学与技术国家研究中心,清华大学电子工程系)

AI总结 本文提出TAMP算法,通过平衡感知精度与通信资源使用,在多区域协作感知中实现时效导向的调度优化。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04519 2026-01-09 cs.CV

TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression

TokenSeg: 通过层次视觉令牌压缩实现高效的3D医学图像分割

Sen Zeng, Hong Zhou, Zheng Zhu, Yang Liu

机构 * Tsinghua University(清华大学) Southwest Forestry University(西南林业大学) GigaAI KCL

AI总结 TokenSeg通过层次视觉令牌压缩实现高效的3D医学图像分割,采用多尺度编码器、边界感知令牌化器和稀疏到密集解码器,在乳腺MRI数据集上取得94.49% Dice系数和89.61% IoU,同时降低64%的GPU内存和68%的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04282 2026-01-09 cs.LG

LEGATO: Good Identity Unlearning Is Continuous

LEGATO: 优良的身份遗忘是连续的

Qiang Chen, Chun-Wun Cheng, Xiu Su, Hongyan Xu, Xi Lin, Shan You, Angelica I. Aviles-Rivero, Yi Chen

机构 * HKUST(香港科技大学) University of Cambridge(剑桥大学) Central South University(中南大学) Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

AI总结 LEGATO通过连续轨迹建模实现生成模型的身份遗忘,采用轻量级神经ODE适配器实现可控且稳定的遗忘过程,避免灾难性崩溃并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04236 2026-01-09 cs.SD cs.AI cs.RO eess.AS

SmoothSync: Dual-Stream Diffusion Transformers for Jitter-Robust Beat-Synchronized Gesture Generation from Quantized Audio

SmoothSync: 双流扩散变换器用于抗抖动的语音同步手势生成

Yujiao Jiang, Qingmin Liao, Zongqing Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 SmoothSync通过双流扩散变换器和抖动抑制损失,实现抗抖动的语音同步手势生成,提升同步精度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02967 2026-01-09 cs.SD cs.AI eess.AS

MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free

用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突

Yishu Lei, Shuwei He, Jing Hu, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13408 2026-01-09 quant-ph cs.CC cs.IT cs.LG math.IT

Taming Barren Plateaus in Arbitrary Parameterized Quantum Circuits without Sacrificing Expressibility

在任意参数化量子电路中消除 barren plateaus 而不牺牲表达性

Zhenyu Chen, Yuguo Shao, Zhengwei Liu, Zhaohui Wei

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Yau Mathematical Sciences Center, Tsinghua University, Beijing 100084, China(叶阳数学科学中心,清华大学,北京,中国) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications, Beijing 100407, China(燕琦湖北京数学科学与应用研究所,北京,中国) Department of Mathematics, Tsinghua University, Beijing 100084, China(数学系,清华大学,北京,中国)

AI总结 本文提出了一种消除任意参数化量子电路中barren plateaus现象的方法,通过插入易于实现的量子通道层,保证了表达性的同时避免了训练中的梯度消失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏