arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-03 至 2025-12-03 共收录 15
2512.03004 2025-12-03 cs.CV

DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images

DGGT:利用未定位图像实现动态驾驶场景的前馈4D重建

Xiaoxue Chen, Ziyi Xiong, Yuantao Chen, Gen Li, Nan Wang, Hongcheng Luo, Long Chen, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Hongyang Li, Ya-Qin Zhang, Hao Zhao

机构 * AIR, Tsinghua University(清华人工智能研究院) Xiaomi EV(小米电动车) The University of Hong Kong(香港大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 DGGT通过前馈方法实现无姿态动态驾驶场景的4D重建,结合3D高斯地图和轻量级动态头,提升重建速度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02834 2025-12-03 cs.RO cs.AI

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02777 2025-12-03 cs.RO cs.MA

CogDrive: Cognition-Driven Multimodal Prediction-Planning Fusion for Safe Autonomy

CogDrive: 基于认知的多模态预测-规划融合用于安全自主性

Heye Huang, Yibin Yang, Mingfeng Fan, Haoran Wang, Xiaocong Zhao, Jianqiang Wang

机构 * Singapore-MIT Alliance for Research and Technology (SMART), Singapore(新加坡-麻省理工联合研究技术联盟) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院) Department of Mechanical Engineering, National University of Singapore, Singapore(新加坡国立大学机械工程系) Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University, China(同济大学交通工程重点实验室)

AI总结 CogDrive通过结合认知多模态预测与安全导向规划,实现了在复杂交通中的安全自主性,提升了轨迹预测和适应性行为。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02772 2025-12-03 cs.CL cs.IR

Towards Unification of Hallucination Detection and Fact Verification for Large Language Models

迈向大型语言模型中幻觉检测与事实验证的统一

Weihang Su, Jianming Long, Changyue Wang, Shiyu Lin, Jingyan Xu, Ziyi Ye, Qingyao Ai, Yiqun Liu

机构 * DCST, Tsinghua University(清华大学数据科学研究院) Fudan University(复旦大学)

AI总结 本文提出UniFact框架,通过统一评估方法揭示幻觉检测与事实验证的互补性,并证明混合方法在LLM中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02715 2025-12-03 cs.CV

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02497 2025-12-03 cs.CV

A Large Scale Benchmark for Test Time Adaptation Methods in Medical Image Segmentation

一种大规模基准用于医学图像分割中的测试时间适应方法

Wenjing Yu, Shuo Jiang, Yifei Chen, Shuo Chang, Yuanhan Wang, Beining Wu, Jie Dong, Mingxuan Liu, Shenghao Zhu, Feiwei Qin, Changmiao Wang, Qiyuan Tian

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 MedSeg-TTA提出一个大规模基准,评估医学图像分割中测试时间适应方法的跨模态性能,揭示不同方法在不同偏移条件下的优劣。

Comments 45 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02417 2025-12-03 cs.RO cs.AI

Vehicle Dynamics Embedded World Models for Autonomous Driving

用于自动驾驶的车辆动力学嵌入世界模型

Huiqian Li, Wei Pan, Haodong Zhang, Jin Huang, Zhihua Zhong

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Tsinghua University, Chinese Academy of Engineering(清华大学、中国工程院)

AI总结 本文提出VDD方法,通过分离车辆动力学与环境动力学建模,提升自动驾驶中对车辆参数变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02400 2025-12-03 cs.CV

Nav-$R^2$ Dual-Relation Reasoning for Generalizable Open-Vocabulary Object-Goal Navigation

Nav-$R^2$双关系推理用于通用开放词汇目标导航

Wentao Xiang, Haokang Zhang, Tianhang Yang, Zedong Chu, Ruihang Chu, Shichao Xie, Yujian Yuan, Jian Sun, Zhining Gu, Junjie Wang, Xiaolong Wu, Mu Xu, Yujiu Yang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团的阿里的地图)

AI总结 Nav-R2通过双关系推理和相似性感知记忆,在开放词汇环境下实现高效目标导航,提升未见对象定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02350 2025-12-03 cs.LG cs.AI

FOVA: Offline Federated Reinforcement Learning with Mixed-Quality Data

FOVA: 混合质量数据下的离线联邦强化学习

Nan Qiao, Sheng Yue, Ju Ren, Yaoxue Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络科学与技术学院) Department of Computer Science and Technology, BNRist, Tsinghua University(清华大学计算机科学与技术系) Zhongguancun Laboratory(中关村实验室)

AI总结 FOVA通过引入投票机制和优势加权回归,有效提升离线联邦强化学习在混合质量数据下的性能和稳定性。

Comments Accepted by IEEE/ACM ToN

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01797 2025-12-03 cs.AI cs.CL cs.CY

H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMs

H-Neurons: 关于大语言模型中与幻觉相关的神经元的存在、影响及其起源

Cheng Gao, Huimin Chen, Chaojun Xiao, Zhiyi Chen, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学)

AI总结 本文研究了大语言模型中与幻觉相关的神经元的存在、影响及起源,揭示了这些神经元在预测幻觉和因果行为中的作用,为提升模型可靠性提供新视角。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05858 2025-12-03 cs.RO

ViTaMIn-B: A Reliable and Efficient Visuo-Tactile Bimanual Manipulation Interface

ViTaMIn-B: 一种可靠且高效的视觉-触觉双臂操作接口

Chuanyu Li, Chaoyi Liu, Daotan Wang, Shuyu Zhang, Lusong Li, Zecui Zeng, Fangchen Liu, Jing Xu, Rui Chen

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) JD Explore Academy(JD探索学院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 ViTaMIn-B通过DuoTact传感器和6自由度双臂位姿采集技术,实现了高效可靠的双臂操作任务数据采集。

Comments Project page: https://chuanyune.github.io/ViTaMIn-B_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07958 2025-12-03 cs.CV

Detect Anything 3D in the Wild

在野外检测任意3D对象

Hanxue Zhang, Haoran Jiang, Qingsong Yao, Yanan Sun, Renrui Zhang, Hao Zhao, Hongyang Li, Hongzi Zhu, Zetong Yang

机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Stanford University(斯坦福大学) CUHK MMLab(香港大学多模态实验室) Tsinghua University(清华大学) GAC R&D Center(广汽研发中心)

AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05814 2025-12-03 cs.CR cs.CV cs.LG

Rank Matters: Understanding and Defending Model Inversion Attacks via Low-Rank Feature Filtering

秩至关重要:通过低秩特征过滤理解并防御模型反向攻击

Hongyao Yu, Yixiang Qiu, Hao Fang, Tianqu Zhuang, Bin Chen, Sijin Yu, Bin Wang, Shu-Tao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出了一种基于低秩特征过滤的防御策略,通过减少中间表示的维度来有效防御模型反向攻击,实现了对多种攻击的有效防护。

Comments KDD 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏