arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11874
2604.00383 2026-04-02 cs.CV

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

Mine-JEPA: 针对侧扫声呐中矿类物体分类的领域自监督学习

Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

机构 * Maum AI Inc.(Maum AI公司) Seoul National University(首尔大学) KAIST(韩国科学技术院) Yonsei University(延世大学)

AI总结 本文提出Mine-JEPA,首个针对侧扫声呐矿类物体分类的领域自监督学习框架,通过SIGReg损失在1170张未标记声呐图像上预训练,实现二分类F1得分0.935,优于DINOv3。

Comments 9 pages, 3 figures, 6 tables. Accepted at CVPR 2026 MACVi Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25527 2026-04-02 cs.CV

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境

Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25267 2026-04-02 cs.CV

EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

EagleNet:面向文本-视频检索的能耗感知细粒度关系学习网络

Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳市对抗性人工智能重点实验室) Beijing Jiaotong University(北京交通大学) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

AI总结 本文提出EagleNet,通过细粒度关系学习机制和能耗感知匹配,提升文本-视频检索中文本与视频帧间关系的表达,增强语义匹配能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24327 2026-04-02 cs.CV

Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens

Le MuMo JEPA:多模态自监督表示学习中的可学习融合标记

Ciem Cornelissen, Sam Leroux, Pieter Simoens

机构 * IDLab, Department of Information Technology, Ghent University - imec(根特大学-imec信息技术系IDLab)

AI总结 本文提出Le MuMo JEPA框架,通过学习融合标记实现多模态统一表示学习,实验显示其在性能与效率之间取得最佳平衡,尤其在CenterNet检测和密集深度估计中表现优异。

Comments 14 pages, 4 figures, supplementary material. Accepted at the CVPR 2026 Workshop on Unified Robotic Vision with Cross-Modal Sensing and Alignment (URVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09266 2026-04-02 cs.CV

ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert LoRA and Cross-View Hypergraph

ForgeDreamer: 工业文本到3D生成的多专家LoRA与跨视图超图

Junhao Cai, Deyu Zeng, Junhao Pang, Lini Li, Zongze Wu, Xiaopin Zhong

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院)

AI总结 本文提出ForgeDreamer框架,通过多专家LoRA集合和跨视图超图增强方法,解决工业文本到3D生成中的领域适应与几何推理问题,提升语义泛化和几何精度。

Comments Accepted to CVPR 2026 Findings!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19053 2026-04-02 cs.CV cs.RO

TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

TeFlow:实现多帧监督以实现自监督前馈场景流估计

Qingwen Zhang, Chenhan Jiang, Xiaomeng Zhu, Yunqi Miao, Yushan Zhang, Olov Andersson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Warwick(华威大学) Linköping University(林雪平大学) Scania(斯堪尼亚)

AI总结 TeFlow通过挖掘时间一致的监督信号,改进多帧监督以提升自监督前馈场景流估计的稳定性与性能,实现33%的性能提升。

Comments CVPR 2026; 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16148 2026-04-02 cs.CV

ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

ActionMesh: 带有时间轴的3D扩散模型用于动画3D网格生成

Remy Sabathier, David Novotny, Niloy J. Mitra, Tom Monnier

机构 * Meta Reality Labs(Meta现实实验室) SpAItial University College London(伦敦大学学院)

AI总结 ActionMesh通过引入时间轴的3D扩散模型,实现了从多种输入生成动画3D网格,具备快速生成、无骨骼和拓扑一致性的优势,提升了在纹理和重定向等应用中的效率。

Comments CVPR 2026. Project webpage with code and videos: https://remysabathier.github.io/actionmesh/ . V2 update includes more baseline models with a larger evaluation set on our new publicly released benchmark ActionBench, and {3D+video}-to-animated-mesh qualitative comparison in supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18640 2026-04-02 cs.CV cs.AI cs.RO

Geometric-Photometric Event-based 3D Gaussian Ray Tracing

几何-光度事件基于的3D高斯射线追踪

Kai Kohyama, Yoshimitsu Aoki, Guillermo Gallego, Shintaro Shiba

机构 * Keio University(庆应义塾大学) Technische Universität Berlin(柏林工业大学) Science of Intelligence Excellence Cluster(智能科学卓越集群) Einstein Center Digital Future(爱因斯坦数字未来中心) Robotics Institute Germany(德国机器人研究所) The University of Tokyo(东京大学)

AI总结 本文提出GPERT框架,通过分离事件渲染与快照渲染,解决事件基于3DGS的精度与时间分辨率平衡问题,实现高精度3D重建。

Comments 15 pages, 12 figures, 5 tables

Journal ref IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Denver, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03932 2026-04-02 cs.CV

Beyond the Ground Truth: Enhanced Supervision for Image Restoration

超越真实数据:图像修复的增强监督

Donghun Ryou, Inju Ha, Sanghyeok Chu, Bohyung Han

AI总结 本文提出一种增强真实图像的框架,通过超分辨率和自适应频率掩码生成高质量监督,提升图像修复效果,实验表明其能改善修复图像质量。

Comments Project page: https://hij1112.github.io/beyond-the-ground-truth/ Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08250 2026-04-02 cs.CV cs.LG

CHEEM: Continual Learning by Reuse, New, Adapt and Skip -- A Hierarchical Exploration-Exploitation Approach

CHEEM:通过重用、新信息、适应和跳过进行持续学习——一种分层探索-利用方法

Chinmay Savadikar, Michelle Dai, Tianfu Wu

机构 * North Carolina State University(北卡罗来纳州立大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出CHEEM框架,通过分层探索-利用方法解决持续学习中的稳定性与可塑性矛盾,实现高效神经网络架构搜索,优于现有方法,接近全微调上限。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00172 2026-04-02 cs.CV

Suppressing Non-Semantic Noise in Masked Image Modeling Representations

抑制掩码图像建模表示中的非语义噪声

Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera

机构 * University of Oslo(奥斯陆大学) UiT The Arctic University of Norway(特罗姆瑟大学 - 挪威北极大学)

AI总结 本文提出SOAP方法,通过PCA分析实测和合成非语义图像,抑制图像补丁表示中的非语义信息,提升零样本性能。

Comments Published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01399 2026-04-02 cs.CV

Resolving the Identity Crisis in Text-to-Image Generation

缓解文本到图像生成中的身份危机

Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院)

AI总结 本文提出DisCo框架,通过强化学习优化图像内和跨样本的身份多样性,解决多人类生成中的身份重复和计数错误问题,无需真实数据,在DiverseHumans数据集上取得高准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30038 2026-04-01 cs.CV

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29941 2026-04-01 cs.CV cs.LG

Better than Average: Spatially-Aware Aggregation of Segmentation Uncertainty Improves Downstream Performance

优于平均:基于空间的分割不确定性聚合改进下游性能

Vanessa Emanuela Guarino, Claudia Winklmayr, Jannik Franzen, Josef Lorenz Rumberger, Manuel Pfeuffer, Sonja Greven, Klaus Maier-Hein, Carsten T. Lüth, Christoph Karg, Dagmar Kainmueller

机构 * Max-Delbrück-Center (MDC)(马克斯·德尔布吕克中心) Helmholtz Imaging(亥姆霍兹成像) Charité Universitätsmedizin(柏林夏里特医学院) Humboldt-Universität zu Berlin(柏林洪堡大学) University of Potsdam(波茨坦大学) German Cancer Research Center (DKFZ)(德国癌症研究中心) Heidelberg University(海德堡大学)

AI总结 研究通过空间感知的不确定性聚合方法提升下游任务性能,分析现有聚合策略的优劣,提出新策略并验证其在不同数据集上的有效性。

Comments 27 pages, 13 figures, 6 tables. Accepted at CVPR 2026 (The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29855 2026-04-01 cs.GR

PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

PosterReward: 解锁高质量图形设计生成的准确评估

Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu

AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29842 2026-04-01 cs.CV cs.LG

Toward Generalizable Whole Brain Representations with High-Resolution Light-Sheet Data

迈向高分辨率光片数据的通用全脑表示

Minyoung E. Kim, Dae Hee Yun, Aditi V. Patel, Madeline Hon, Webster Guan, Taegeon Lee, Brian Nguyen

机构 * LifeCanvas Technologies

AI总结 本文提出CANVAS,首个大规模高分辨率光片数据集,用于提升全脑表示的通用性,揭示现有模型在处理异质细胞形态时的局限。

Comments 21 pages, 12 figures. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29734 2026-04-01 cs.CV

GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis

GRVS:一种通用且递归的方法用于单目动态视图合成

Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero

AI总结 本文提出GRVS方法,通过递归循环和动态输入平面扫描,实现高精度的单目动态视图合成,优于现有多种基于高斯点划和扩散的方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29634 2026-04-01 cs.CV cs.AI

MacTok: Robust Continuous Tokenization for Image Generation

MacTok: 图像生成中的鲁棒连续分词

Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu

机构 * Fudan University(复旦大学)

AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26984 2026-04-01 cs.CV

A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性

Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi

机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)

AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏