arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-09 至 2026-03-09 共收录 14
2603.06542 2026-03-09 cs.SD cs.AI

RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering

RAMoEA-QA:面向呼吸音频问答的分层专业化

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University of Calabria(卡拉布里亚大学)

AI总结 RAMoEA-QA通过分层专业化机制,统一处理多种呼吸音频问答任务,提升在不同领域和任务转换下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06530 2026-03-09 cs.CV

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

AV-Unified: 一个用于音频-视觉场景理解的统一框架

Guangyao Li, Xin Wang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 AV-Unified提出一个统一框架,通过多尺度时空感知网络和跨模态指导模块,实现音频-视觉场景理解任务的联合学习和高效处理。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06280 2026-03-09 cs.RO

SuperSuit: An Isomorphic Bimodal Interface for Scalable Mobile Manipulation

SuperSuit:一种用于可扩展移动操作的同构双模接口

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Zhu Jin, Lu Fang

机构 * Tsinghua University(清华大学) TARS Robotics(TARS机器人)

AI总结 SuperSuit 提出了一种双模数据采集框架,通过同构运动学接口实现移动机械臂的高效长周期演示和策略训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06049 2026-03-09 cs.CV cs.RO

Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

魔鬼在窄政策中:解锁驾驶VLA模型的探索

Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang

机构 * National Superior College for Engineers, Beihang University(北京航空航天大学工程师学院) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Lenovo Group Limited(联想集团有限公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)

AI总结 Curious-VLA通过双阶段设计缓解探索-利用困境,提升驾驶VLA模型的探索潜力,实现Navsim基准的最优性能。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05804 2026-03-09 cs.RO

CDF-Glove: A Cable-Driven Force Feedback Glove for Dexterous Teleoperation

CDF-Glove: 一种用于灵巧遥控操作的电缆驱动力反馈手套

Huayue Liang, Ruochong Li, Yaodong Yang, Long Zeng, Yuanpei Chen, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学) PKU-Psibot Joint Lab(北京大学-PsiBot联合实验室) Department of Advanced Manufacturing, Shenzhen International Graduate School, Tsinghua University(先进制造系,深圳国际研究生院,清华大学)

AI总结 CDF-Glove是一种低成本的电缆驱动力反馈手套,通过实时力反馈提升灵巧遥控操作的演示质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05567 2026-03-09 cs.LG

FuseDiff: Symmetry-Preserving Joint Diffusion for Dual-Target Structure-Based Drug Design

FuseDiff: 保留对称性的双目标结构导向药物设计联合扩散

Jianliang Wu, Anjie Qiao, Zhen Wang, Zhewei Wei, Sheng Chen

机构 * Sun Yat-sen University(中山大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 FuseDiff通过端到端扩散模型联合生成双目标结合姿态,保留对称性并实现高精度药物设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05355 2026-03-09 cs.RO

OmniDP: Beyond-FOV Large-Workspace Humanoid Manipulation with Omnidirectional 3D Perception

OmniDP: 在超广角大工作空间中实现人形机器人的全方位3D感知

Pei Qu, Zheng Li, Yufei Jia, Ziyun Liu, Liang Zhu, Haoang Li, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 OmniDP通过360度全景点云感知和时间感知注意力池化机制,实现人形机器人在大工作空间中的稳健操作,优于传统深度相机方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05078 2026-03-09 cs.CV

MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer

MoRe:面向运动的前馈4D重建Transformer

Juntong Fang, Zequn Chen, Weiqi Zhang, Donglin Di, Xuancheng Zhang, Chengmin Yang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(软件学院,清华大学)

AI总结 MoRe通过注意力强制策略和分组因果注意力,高效重建动态3D场景,适用于实时应用。

Comments Accepted by CVPR 2026. Project page:https://hellexf.github.io/MoRe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04992 2026-03-09 cs.CL

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

机构 * SCB DataX(SCB数据X) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) SCBX R&D(SCBX研发部) SCB 10X

AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10704 2026-03-09 cs.CV cs.RO

(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization

(MGS)$^2$-Net:融合微几何尺度与宏几何结构的跨视角地理定位

Minglei Li, Mengfan He, Chunyu Li, Chao Chen, Xingyu Shao, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University, Beijing 100084, China(精密仪器系,清华大学,北京100084,中国)

AI总结 (MGS)$^2$-Net通过融合微几何尺度与宏几何结构,解决跨视角地理定位中的几何错位问题,实现高精度和鲁棒性的定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01719 2026-03-09 cs.CL

COMI: Coarse-to-fine Context Compression via Marginal Information Gain

COMI:通过边际信息增益的粗到细上下文压缩

Jiwei Tang, Shilei Liu, Zhicheng Zhang, Yujin Yuan, Libin Zheng, Wenbo Su, Bo Zheng

机构 * Tsinghua University(清华大学) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Sun Yat-sen University(中山大学)

AI总结 COMI通过边际信息增益实现粗到细的上下文压缩,在长上下文任务中提升压缩效率和语义保留能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16538 2026-03-09 cs.CV

OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding

OnlineSI: 通过大规模语言模型实现在线3D理解和定位

Zixian Liu, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 OnlineSI通过整合3D点云与语义信息,提升大规模语言模型在动态环境中的空间理解和物体识别能力。

Comments Project Page: https://onlinesi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11165 2026-03-09 cs.LG cs.AI cs.CL cs.CV

Maximizing Asynchronicity in Event-based Neural Networks

在事件驱动神经网络中最大化异步性

Haiqing Hao, Nikola Zubić, Weihua He, Zhipeng Sui, Davide Scaramuzza, Wenhui Wang

机构 * State Key Laboratory of Precision Measurement Technology and Instrument, Department of Precision Instrument, Tsinghua University(精密测量技术与仪器国家重点实验室,精密仪器系,清华大学) Robotics and Perception Group, University of Zurich(机器人与感知组,苏黎世大学)

AI总结 EVA通过借鉴语言建模技术,提出一种新的A2S框架,生成高表达性和通用性的事件特征,在识别和检测任务中表现出色。

Comments 22 pages, 7 figures, 15 tables, ICLR 2026 Camera Ready paper

Journal ref International Conference on Learning Representations (ICLR), Brazil, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09242 2026-03-09 cs.CV

NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

NAMI: 通过桥接渐进修正流变压器实现高效的图像生成

Yuhang Ma, Bo Cheng, Shanyuan Liu, Hongyi Zhou, Liebucha Wu, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院) Tsinghua University(清华大学)

AI总结 NAMI通过桥接渐进修正流变压器实现高效图像生成,减少推理时间64%,并提升多分辨率训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏