arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 85 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 85 篇

2605.07412 2026-06-25 cs.LG cs.AI 版本更新 70%

Tracking Large-scale Shared Bikes with Inertial Motion Learning in GNSS Blocked Environments

通过惯性运动学习在GNSS阻塞环境中跟踪大规模共享自行车

Feng Liu, Kejia Li, Zhiwei Yang, Chunwei Yang, Qun Li, Guobin Wu, Qiang Ni, Ruipeng Gao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) DiDi, Beijing(滴滴(北京))

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种结合自行车机械约束与混合专家模型的惯性跟踪框架,通过多专家模块捕捉共享表示并改进多任务学习性能,实现不确定性感知的轨迹估计,并通过动态校准提升跟踪精度。

Comments This paper has been accepted by IEEE Transactions on Intelligent Transportation Systems (T-ITS) on June 23, 2026. Journal article. 15 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19982 2026-07-17 cs.DB 版本更新 67%

3DPipe: A Pipelined GPU Framework for Scalable Generalized Spatial Join over Polyhedral Objects

3DPipe:一种用于可扩展多面体对象通用空间连接的流水线GPU框架

Lyuheng Yuan, Da Yan, Saugat Adhikari, Akhlaque Ahmad, Fusheng Wang

专题命中 感知 :LiDAR(abstract,abstract_cn)

AI总结 本文提出3DPipe,一种利用GPU并行性处理多面体对象空间连接的流水线框架,通过多级剪枝策略和分块流式处理提升效率,实验显示其比现有最佳GPU方案TDBase快9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17984 2026-07-03 eess.IV cs.CV cs.RO 版本更新 67%

See Silhouettes in Motion with Neuromorphic Vision

用神经形态视觉感知运动中的轮廓

Pei Zhang, Shijie Lin, Zhou Ge, Jinpeng Chen, Wei Pu

机构 * School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) SHU General Intelligent Robotics Research Institute(SHU通用智能机器人研究院) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家试点软件学院)) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文提出了一种双模方法,利用帧和事件的协同作用,在仅CPU的设备上实现实时高帧率二值化,有效减少运动模糊并提升在恶劣光照下的性能,为资源受限边缘平台的轻量感知和交互铺平道路。

Comments 13 pages, 15 figures, and 5 tables. This work is under review. Project page: https://github.com/pz-even/event_binarization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 67%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14603 2026-08-19 cs.NI cs.AI cs.CV cs.IT math.IT 版本更新 62%

HMS-SCP: Task-Oriented Multi-Scale Semantic Communication for V2X Cooperative Perception

通过语义感知协同感知扩展智能交通系统的安全 horizon

Chun-Yeow Yeoh, Chee Keong Tan, Joanne Mun-Yee Lim, Heng-Siong Lim

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 HMS-SCP 框架,通过多尺度语义冗余与 JSCC 编码实现带宽效率与鲁棒性的平衡,在 V2X 环境中保障安全关键型协同感知的性能。

Comments 15 pages, 7 figures, 6 tables, Submitted to IEEE Transactions on Vehicular Technology (TVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 62%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12826 2026-08-12 cs.CV cs.AI 版本更新 62%

DIMOS: Disentangling Instance-level Moving Object Segmentation

DIMOS: 解耦实例级运动目标分割

Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11554 2026-08-11 cs.RO cs.CV cs.LG 版本更新 62%

HyperDet: 3D Object Detection with Hyper 4D Radar Point Clouds

HyperDet: 基于超4D雷达点云的3D目标检测

Yichun Xiao, Runwei Guan, Jin Jin, Fangqiang Ding

机构 * University of Edinburgh(爱丁堡大学) HKUST (GZ)(香港科技大学(广州)) University of Oxford(牛津大学) MIT(麻省理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07254 2026-07-02 cs.CV cs.RO 版本更新 62%

Towards Accurate State Estimation: Motion Dynamics Kalman Filter for 3D Multi-Object Tracking

迈向精确状态估计:用于3D多目标跟踪的运动动力学卡尔曼滤波器

Mohamed Nagy, Naoufel Werghi, Bilal Hassan, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学) New York University of Abu Dhabi(纽约大学阿布扎比分校)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV

AI总结 提出运动动力学卡尔曼滤波器(MD-KF),通过将连续测量间运动变化建模为高斯分布并自适应调整加权运动模型,克服恒定运动假设,在保持模型单一性的同时提升遮挡和静止目标的状态估计精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03694 2026-06-24 cs.RO cs.CV cs.HC 版本更新 62%

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset

面向人机交互的面部与身体跟踪:一个自我中心数据集

Jessica Wenninger, Gabriel Skantze

机构 * Furhat Robotics University of Naples Federico II(那不勒斯费德里科二世大学) Division of Speech, Music and Hearing, KTH Royal Institute of Technology(语音、音乐和听觉研究所,皇家理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 针对社交机器人自我中心视角下频繁身份切换问题,提出一个自定义标注的自我中心数据集,通过系统评估检测误差、对比面部与身体跟踪,并分析扩展空间记忆和外观重识别的影响,最终优化管道将身份切换减少49%。

Comments 8 pages, 5 figures, 3 tables. Camera-ready version. Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15493 2026-06-23 cs.RO cs.CV 版本更新 62%

Build Once, Monitor Continuously: Persistent Semantic Mapping via Autonomous Exploration and Open-Vocabulary Object Updates

一次构建,持续监控:通过自主探索和开放词汇对象更新的持久语义地图

Sai Haneesh Allu, Itay Kadosh, Tyler Summers, Yu Xiang

机构 * Department of Mechanical Engineering, University of Texas at Dallas(德克萨斯大学达拉斯分校机械工程系)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 提出两阶段系统,先通过前沿探索构建几何地图,再通过开放词汇检测和分割模型更新语义对象图,实现仅重复轻量语义阶段的高效持久监控。

Comments 10 pages, 8 figures, 5 tables. Project page is available at https://irvlutd.github.io/SemanticMapping/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 62%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24058 2026-06-16 cs.CV cs.AI 版本更新 62%

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

通过注意力不平衡修正减轻LVLM中的对象幻觉

Han Sun, Qin Li, Peixin Wang, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University(上海可信计算实验室,东华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 发现多模态和token间注意力不平衡是对象幻觉的因果因素,提出轻量级解码干预方法AIR,通过重新分配注意力权重修正不平衡,在多个基准上减少幻觉达35.1%,并提升通用能力。

Comments CVPR 2026 Findings Track, code is available at https://github.com/Ice-wave/AIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 62%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15048 2026-08-20 cs.CV 版本更新 57%

RoGS: Adaptive Meshgrid Gaussian for Large-Scale Road Surface Mapping

RoGS:用于大规模路面映射的自适应网格高斯方法

Tianchen Deng, Zhiheng Feng, Wenhua Wu, Ziming Li, Chang Nie, Siting Zhu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong university(上海交通大学自动化与智能感知学院) State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis(航空电子集成与航空系统-of-系统综合国家重点实验室) Shanghai Key Laboratory of Navigation and Location Based Services(上海基于位置服务重点实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对大规模路面映射中传统方法的局限,提出ROADGS-T框架,基于自适应网格高斯表示,通过放置二维高斯面片建模路面,减少冗余,并引入自适应网格和姿态稳健细化策略,提升表示效率和结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12122 2026-08-17 cs.RO 版本更新 57%

OctoSplat: Hybrid OctoMap-Gaussian Splatting for Active Semantic Mapping and Phenotyping with Horticultural Robots

利用高斯点云进行园艺环境的主动语义映射

Jose Cuaran, Naveen K. Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications at University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算中心)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出利用移动机械臂和高斯点云进行园艺环境主动3D重建,提升重建精度与效率,实现水果计数和体积估算。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12608 2026-08-14 cs.CV 版本更新 57%

A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline

使用Clear2Fog管道研究合成雾的数据效率

Mohamed Ahmed Mohamed, Xiaowei Huang

机构 * Waymo Open Dataset(Waymo开放数据集)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。

Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog

Journal ref Neurocomputing, Vol. 703, 134798, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 57%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-12 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01656 2026-08-12 cs.CV 版本更新 57%

WaveInst: A Frequency-Domain Enhanced Network for Fine-Grained Thin Tree Trunk Extraction in Forest Scenes

WaveInst:面向森林场景中细粒度细树干提取的频域增强网络

Chenyang Fan, Xujie Zhu, Taige Luo, Zhulin Chen, Sheng Xu

机构 * College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与人工智能学院) Department of Geography, College of Natural Resources and Environment, Virginia Tech(维吉尼亚理工大学地理系) Institute of Forest Resource Information Techniques, Chinese Academy of Forestry(中国林业科学研究院森林资源信息技术研究所) State Forestry and Grassland Administration, Key Laboratory of Forest Management and Growth Modelling(国家林业和草原局森林管理与生长建模重点实验室) School of Geospatial Artificial Intelligence, East China Normal University(华东师范大学地理空间人工智能学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 针对现有方法在森林场景细树干提取中易误判、受数据与直径差异限制的问题,提出WaveInst频域增强实例分割网络,在多数据集上实现了更优的细树干提取性能,尤其在幼龄树干上优势显著。

Comments 18 pages, 16 figures, published in IEEE Transactions on Geoscience and Remote Sensing

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 4409718-4409718, 2026, Art no. 4409718

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00854 2026-08-11 cs.RO 版本更新 57%

Minute-Scale Training for Microrobot Navigation

微型机器人导航的分钟级训练

Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文针对微型机器人DRL导航训练耗时久的问题,提出含全向量化模拟器与TSR奖励框架的学习框架,将训练缩至10分钟内,支持零样本部署,可缩短设计周期、加速部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09245 2026-08-11 cs.CV 版本更新 57%

Bridging Object Detection and Segmentation with Polygon Detection Transformers

面向多实例分割的多边形检测变换器

Jiacheng Sun, Jiaqi Lin, Wenlong Hu, Haoyang Li, Xinghong Zhou, Chenghai Mao, Xinliang Zhang, Jianya Guo, Yuqiang Zhai, Yan Peng, Xiaomao Li

机构 * Shanghai University(上海大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 Poly-DETR通过极坐标表示将实例分割转化为稀疏顶点回归,实现更轻量的高分辨率分割,优于现有极坐标方法并在特定领域表现更优。

Comments Substantially revised and extended version with a new title, additional co-authors, new methodology, expanded experiments and analyses, and supplementary material in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09062 2026-08-11 cs.CV cs.LG 版本更新 57%

SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding

SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解

Seongyong Kim, Yong Kwon Cho

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21638 2026-08-10 cs.CV 版本更新 57%

SparseVoxelDet: Fully Sparse Voxel Networks for Efficient Event-Based Drone Detection

无需密集张量:在事件相机体素网格上实现完全稀疏目标检测

Mohamad Yazan Sadoun, Sarah Sharif, Yaser Mike Banad

机构 * University of Oklahoma(俄克拉荷马大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出SparseVoxelDet,首个基于事件相机的完全稀疏目标检测器,通过稀疏体素卷积在占用体素上进行特征提取和检测,显著降低内存和存储开销,验证了稀疏处理在事件相机目标检测中的可行性。

Comments 38 Pages, 9 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30239 2026-08-04 cs.CV 版本更新 57%

CA-World: Multi-Object Counterfactual Alignment for Efficient Interactive-Ready Reconstruction

SAM3D-Phys:迈向真实世界中的多物体交互仿真

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29471 2026-08-04 cs.CV 版本更新 57%

V2VCrafter: Consistent Street-View Image Generation Across Vehicles

V2XCrafter:学习生成跨智能体的驾驶场景

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) Lingnan University(岭南大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出V2XCrafter框架,通过渐进式多智能体扩散模型和跨智能体注意力模块,生成跨智能体相机视角的一致可控协作驾驶场景,以增强数据并提升下游协作3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08163 2026-08-04 cs.CV 版本更新 57%

Accuracy Does Not Guarantee Human-Likeness: Cross-Domain Human-Centered Benchmark in Monocular Depth Estimation

单目深度估计器中准确性并不保证人类化

Yuki Kubota, Taiki Fukiage

机构 * Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究发现单目深度估计器的准确性与人类相似性之间存在复杂权衡,提升准确性不一定增强人类化行为。

Comments 21 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10167 2026-08-03 cs.CV 版本更新 57%

FlexPath: Adapting Learned Connectivity Guidance to Path Preferences

FlexPath: 基于图像规划的学习语义路径先验

Taehyoung Kim, Tim Schoenbrod, David Eckel, Henri Meeß

机构 * Fraunhofer IVI(弗劳恩霍夫研究所) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出FlexPath两阶段框架,将可行性先验与偏好解耦,通过可微路径形状目标实现任务自适应,在最短路径规划中搜索代价降低14.3%,并支持零样本泛化与多目标适配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21831 2026-07-29 cs.CV 版本更新 57%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏