arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-29 至 2026-01-29 共收录 9
2601.20499 2026-01-29 cs.CV

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20383 2026-01-29 cs.CV

HINT: Hierarchical Interaction Modeling for Autoregressive Multi-Human Motion Generation

HINT: 用于自回归多人体运动生成的分层交互建模

Mengge Liu, Yan Di, Gu Wang, Yun Qu, Dekai Zhu, Yanyan Li, Xiangyang Ji

机构 * Tsinghua University(清华大学)

AI总结 HINT通过分层交互建模提出了一种自回归框架,实现多人体运动生成,提升了交互建模的精度和长序列的连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20330 2026-01-29 cs.CL cs.LG

PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments

PsychePass:通过轨迹锚定竞赛校准LLM的治疗能力

Zhuang Chen, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Lingxin AI(灵心AI) South China Normal University(华南师范大学) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华人工智能研究院)

AI总结 PsychePass通过轨迹锚定竞赛校准LLM的治疗能力,利用动态比赛生成稳定评分并提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20162 2026-01-29 cs.CL

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian

机构 * Yunnan University(云南大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Southeast University(东南大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05305 2026-01-29 eess.AS cs.CL eess.SP

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

WaveSP-Net: 基于小波域可学习稀疏提示微调的语音深度伪造检测

Xi Xuan, Xuechen Liu, Wenxin Zhang, Yi-Cheng Lin, Xiaojian Lin, Tomi Kinnunen

机构 * University of Eastern Finland(东芬兰大学) National Institute of Informatics(日本信息处理学会) University of Chinese Academy of Sciences(中国科学院大学) National Taiwan University(台湾大学) University of Toronto(多伦多大学) Tsinghua University(清华大学)

AI总结 WaveSP-Net通过结合小波域稀疏提示微调与Mamba架构,提升语音深度伪造检测的性能与效率。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21789 2026-01-29 cs.MA cs.CV

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

视觉多智能体系统:通过视觉流缓解幻觉雪球效应

Xinlei Yu, Chengming Xu, Guibin Zhang, Yongbo He, Zhangquan Chen, Zhucun Xue, Jiangning Zhang, Yue Liao, Xiaobin Hu, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出ViF方法,通过视觉流和注意力重新分配缓解多智能体系统中的视觉幻觉雪球效应,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16324 2026-01-29 cs.CV

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

从预测到完美:引入精修到自回归图像生成

Cheng Cheng, Lin Song, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14174 2026-01-29 cs.LG cs.AI

Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science

物理引导的多模态Transformer是下一代气象科学的必要基础

Jing Han, Hanting Chen, Kai Han, Xiaomeng Huang, Wenjun Xu, Dacheng Tao, Ping Zhang

机构 * School of Artificial Intelligence, Beijing University of Posts Huawei Noah's Ark Lab Department of Earth System Science, Tsinghua University College of Computing \& Data Science, Nanyang Technological University State Key Laboratory of Networking Switching Technology, Beijing University of Posts

AI总结 本文提出通过物理引导的多模态Transformer构建下一代气象科学的统一范式,以提升模型的科学一致性和物理约束能力。

Comments Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏