arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 253 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 253 篇

2608.07750 2026-08-11 cs.CV cs.AI 新提交 62%

Multi-Task Consistency-based Detection of Adversarial Attacks

基于多任务一致性的对抗攻击检测

Cong Chen, Jean-Philippe Monteuuis, Jonathan Petit

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶中DNNs易受对抗攻击且现有防御成本高的问题,提出基于多任务视觉任务输出一致性的高效检测方案,在BDD100k数据集上对PGD攻击的ROC-AUC达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07579 2026-08-11 cs.CV cs.AI 新提交 62%

Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real

几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪

Abdullah Naeem, Anav Katwal, Ayon Dey, Noman Khan, Md Tamjidul Hoque

机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) PinPark, Inc.(PinPark公司)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07154 2026-08-10 cs.RO cs.AI 新提交 62%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26651 2026-07-30 cs.CV cs.AI 新提交 62%

Physically Real-time Infrared Attack against Optical Flow Estimation Networks

面向光流估计网络的物理实时红外攻击

Shen You, Wei Jiang, Jiarui Liu, Yijian Ye, Qiuzhen Lin, Xiangtao Li, Ka-Chun Wong

机构 * City University of Hong Kong(香港城市大学) University of Electronic Science and Technology(电子科技大学) Shenzhen University(深圳大学) Jilin University(吉林大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种利用红外光的物理实时攻击方法,通过动态显示对抗样本破坏光流估计网络,在多种场景下均能有效削弱网络的光流估计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26121 2026-07-30 cs.RO cs.AI cs.CY 新提交 62%

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

面向可信赖的具身智能:一个系统框架与分级可信赖性水平

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

机构 * THU(清华大学) PKU(北京大学) HKUST (GZ)(香港科技大学(广州))

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。

Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17724 2026-07-21 cs.RO cs.AI cs.MA 新提交 62%

Lifelong Multi-Subsystem Pickup and Delivery with Buffer-Limited Handover Stations

具有缓冲区受限交接站的终身多子系统取货与送货

Chuanlong Zang, Isabelle Barz, Anna Mannucci, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Technical University of Berlin(柏林工业大学) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 研究终身多子系统取货与送货中协调子系统载荷转移的问题,提出交接感知预留与路由(HARR)方法,通过共享日历和缓冲区预测协调行动,模拟显示该方法能显著提高吞吐量、减少积压并降低规划时间,提升运输稳定性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17351 2026-07-21 cs.AI cs.RO 新提交 62%

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception

深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合

Eli Goldenshluger, Barak Pinkovich, Chaim Baskin

机构 * Technion–Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI

AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15620 2026-07-20 cs.RO cs.AI 新提交 62%

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测

Priyanka V. Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.AI

AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14248 2026-07-17 cs.CV eess.IV 新提交 62%

3D Lane Detection with Odometry for High-Speed Vehicle Racing

用于高速赛车的带里程计的3D车道检测

Omoruyi Atekha, John Subosits, Marcus Greiff

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV

AI总结 研究高速赛车场景下的3D车道检测问题,通过新数据集比较多种方法,提出改进措施,利用多摄像头集成及里程计等提升性能,相比其他方法提高了F1分数并降低误差,在车辆部署中取得良好指标。

Comments 14 pages, IROS paper, includes extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14005 2026-07-16 cs.CV cs.RO 新提交 62%

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07370 2026-07-10 cs.RO cs.AI cs.HC cs.LG 新提交 62%

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

四足机器人的行为基础:ABot-C0技术报告

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Congyang Zhao, Tianxiong Lv, Menglin Yang, Minqi Gu, Yaru Zhao, Wenyu Liu, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI

AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。

Comments Abot-C0 project page will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 62%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05955 2026-07-08 cs.CV cs.AI 新提交 62%

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

NegROI:基于场景条件负提示的以点击为中心的不确定性引导细化用于稳健交互式3D分割

Shuheng Zhang, Feng Wu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 研究针对交互式3D分割中粗体素分辨率及背景误报问题,提出NegROI框架,结合点击中心多分辨率细化与场景条件负提示,通过不确定性驱动选择性细化、负提示建模及边界感知硬负挖掘,提升点击效率、减少误报并增强跨数据集鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31834 2026-07-01 cs.CV cs.AI 新提交 62%

Real-Time Source-Free Object Detection

实时无源目标检测

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 62%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24096 2026-06-24 cs.CV cs.AI 新提交 62%

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation

超越拜耳:面向鲁棒自动驾驶分割的任务最优传感器协同设计

Reeshad Khan, John Gauch

机构 * University Of Arkansas(阿肯色大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出可微RAW到任务流水线,学习光谱滤色器阵列权重提升分割mIoU,发现光学点扩散函数协同设计为负收益,噪声优化效果微弱,增大CFA块反而有害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 62%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18112 2026-06-19 cs.RO cs.CV 新提交 62%

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav 技术报告:为智能体导航系统设计的可扩展导航模型

Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Haoyang Li, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(通义实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出 Qwen-RobotNav 可扩展导航模型,通过参数化接口支持多种任务模式和可调观测参数,在15.6M样本上训练,联合视觉语言数据防止行为坍缩,在多个导航基准上取得新最优结果,并展示零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 62%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16558 2026-06-16 cs.AI cs.RO cs.SY eess.SY 新提交 62%

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。

Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13222 2026-06-12 cs.RO cs.AI 新提交 62%

Proprioceptive-visual correspondence enables self-other distinction in humanoid robots

本体感觉-视觉对应使能人形机器人的自我-他人区分

Yurun Chen, Tianyuan Gao, Yizhong Ge, Shikun Ban, Yizhou Wang, Hongkai Xiong, Wenjun Zeng, Wentao Zhu

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) East China Normal University(华东师范大学) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 提出通过本体感觉与视觉的对应学习自我-他人区分,无需身份标签或运动学模型,并建立预测性自我模型,支持目标到达、碰撞感知运动规划和运动重定向。

Comments 23 pages, 9 figures, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 62%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 62%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 62%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06721 2026-06-08 cs.RO cs.AI 新提交 62%

SCOUT: Semantic scene COverage via Uncertainty-guided Traversal

SCOUT: 基于不确定性引导遍历的语义场景覆盖

Junyu Mao, Sara Ayoubi, Vishnu D. Sharma, Ilija Hadžić, Matthew Andrews

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国) Nokia Bell Labs, Murray Hill, NJ, USA(诺基亚贝尔实验室,美国,新泽西州 Murray Hill) Imperial College London(帝国理工学院伦敦分校) Locus Robotics(Locus机器人技术公司)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 提出SCOUT框架,通过不确定性引导的遍历规划与概率场景图构建的闭环,使机器人主动探索并逐步理解环境,实现语义场景完整性作为操作目标。

Comments 2026 ICRA Workshop on Uncertainty in Open World Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19804 2026-08-21 cs.AI 新提交 57%

ADAPT: Physics-Aware Diffusion-based World Models for Adaptive Predictive Transferable HVAC Control

ADAPT:面向自适应可迁移HVAC控制的物理感知扩散式世界模型

Xu Yang, Kailai Sun, Dianyu Zhong, Qianchuan Zhao

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 本文针对现有HVAC控制方法泛化性差的问题,提出物理感知扩散世界模型ADAPT,在IID控制下可降HVAC能耗7.3%、不适度30.2%,OOD场景下迁移鲁棒性显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 57%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19298 2026-08-21 cs.CV 新提交 57%

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

Yongliang Zhang, Feng Song, Ji Chen, Lishuai Guo, Yong Deng, Yue Zheng, Tianyi Liu, Zhixiong Chen, Qixin Zhang

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19188 2026-08-20 cs.RO 新提交 57%

PartialBiGrasp: Inferring Hidden Local Geometry for Bimanual Grasping from Partial Views

PartialBiGrasp:从部分视角推断隐藏局部几何以实现双臂抓取

Ayush Kaura, Vignesh Vembar, Md Faizal Karim, Keshab Patra, K Madhava Krishna

机构 * Robotics Research Center IIIT Hyderabad(印度信息技术研究所海得拉巴分校机器人研究中心)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 PartialBiGrasp是基于部分点云的双臂抓取生成框架,通过卷积占用网络学习几何特征生成抓取对并优化,经实验验证可实现鲁棒稳定的抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏