arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.24484 2026-03-26 cs.CV

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24322 2026-03-26 cs.CV

Heuristic Self-Paced Learning for Domain Adaptive Semantic Segmentation under Adverse Conditions

启发式自适应学习用于恶劣条件下域自适应语义分割

Shiqin Wang, Haoyang Chen, Huaizhou Huang, Yinkan He, Dongfang Sun, Xiaoqing Chen, Xingyu Liu, Zheng Wang, Kaiyan Zhao

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心、人工智能研究院、计算机科学学院、武汉大学) Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机科学学院,武汉,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 本文提出自适应学习方法,通过动态调整语义类别学习顺序,提升恶劣天气下域自适应语义分割性能,实现类别平衡与动态学习。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24157 2026-03-26 cs.CV

CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare

CarePilot: 一种用于医疗领域长周期计算机任务自动化的多智能体框架

Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Mohamed bin Zayed University of AI (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出CarePilot多智能体框架,通过双记忆机制和actor-critic范式,解决医疗领域长周期任务自动化中的复杂推理问题,实验表明其在基准和分布外数据集上均优于现有基线。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22094 2026-03-26 cs.CV

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御

Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22070 2026-03-26 cs.CV

Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

通过多模态贝叶斯分布学习适应点云分析

Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yonglinag Wu, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(脑信息处理实验室,中国科学技术大学) Opus AI Research(Opus AI研究院) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出BayesMM框架,通过多模态贝叶斯分布学习实现测试时点云分析的持续适应,利用文本先验和流式视觉特征的高斯分布融合,提升在分布偏移下的鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19083 2026-03-26 cs.CV

ChordEdit: One-Step Low-Energy Transport for Image Editing

ChordEdit: 图像编辑中的一步低能耗传输

Liangsi Lu, Xuhang Chen, Minzhe Guo, Shichu Li, Jingchao Wang, Yang Shi

机构 * Guangdong University of Technology(广东工业大学) Huizhou University(惠州大学) Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 本文提出ChordEdit,一种无需训练和反向传播的图像编辑方法,通过动态最优传输理论实现低能耗、高精度的一步编辑,解决传统方法在图像编辑中出现的失真和不一致性问题。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22533 2026-03-26 cs.CV

Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

Fast3Dcache: 无训练3D几何合成加速

Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) University of Electronic Science and Technology of China(电子科学与技术大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Fast3Dcache,一种无训练的几何感知缓存框架,通过动态缓存调度和时空稳定性准则,显著加速3D扩散模型推理,同时保持几何精度。

Comments Accepted by CVPR 2026; Project page: https://fast3dcache-agi.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18281 2026-03-26 cs.CV cs.AI

Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

Uni-DAD: 集成扩散模型的蒸馏与适应以实现少步少样本图像生成

Yara Bahram, Mélodie Desbos, Mohammadhadi Shateri, Eric Granger

机构 * LIVIA, ILLS, ETS(LIVIA、ILLs、ETS)

AI总结 Uni-DAD通过统一蒸馏与适应流程,提升少样本图像生成质量与多样性,采用双域分布匹配和多头GAN损失,实现单阶段高效生成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15778 2026-03-26 cs.CR

Towards Stealthy and Effective Backdoor Attacks on Lane Detection: A Naturalistic Data Poisoning Approach

面向车道检测的隐蔽且有效的后门攻击:一种自然数据污染方法

Yifan Liao, Yuxin Cao, Yedi Zhang, Wentao He, Yan Xiao, Xianglong Du, Zhiyong Huang, Jin Song Dong

AI总结 本文提出DBALD框架,通过自然触发器生成提升车道检测模型的攻击成功率和隐蔽性,实验显示其在四个主流模型上的平均成功率提升10.87%。

Comments Accepted in CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05296 2026-03-26 cs.GR cs.CV

Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation

让雪落下!通过物理引导的分数蒸馏动画3D高斯场景的动态天气效果

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校) Cornell University(康奈尔大学)

AI总结 本文提出物理引导的分数蒸馏框架,通过结合物理模拟和视频基于的分数蒸馏采样,实现3D场景的动态天气效果生成,提升真实感与动态一致性。

Comments Accepted to CVPR 2026. Project webpage: https://galfiebelman.github.io/let-it-snow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22172 2026-03-26 cs.CV

CA-LoRA: Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

CA-LoRA:面向领域对齐的分割数据集生成的概念感知LoRA

Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi

机构 * KAIST(韩国科学技术院) Qualcomm AI Research(高通AI研究) Kyung Hee University(庆熙大学)

AI总结 本文提出CA-LoRA方法,通过文本到图像生成模型生成分割数据集,解决数据稀缺问题。该方法通过选择性更新与领域对齐相关的概念权重,提升生成样本的多样性和信息量,在城市场景分割中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24146 2026-03-26 cs.CV

LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds

LightSplat: 五秒内快速且内存高效的开放词汇3D场景理解

Jaehun Bang, Jinhyeok Kim, Minji Kim, Seungheon Jeong, Kyungdon Joo

机构 * AIGS, UNIST(UNIST人工智能研究所) GSAI, POSTECH(POSTECH人工智能研究所)

AI总结 本文提出LightSplat框架,通过注入紧凑的2字语义索引实现快速且内存高效的开放词汇3D场景理解,实现50-400倍速度提升和64倍内存降低。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24134 2026-03-26 cs.CV

Spectral Scalpel: Amplifying Adjacent Action Discrepancy via Frequency-Selective Filtering for Skeleton-Based Action Segmentation

频谱手术刀:通过频率选择性过滤放大相邻动作差异以实现基于骨架的动作分割

Haoyu Ji, Bowen Chen, Zhihao Yang, Wenze Huang, Yu Gao, Xueting Liu, Weihong Ren, Zhiyong Wang, Honghai Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen H&T Intelligent Control Co., Ltd.(深圳H&T智能控制有限公司) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学)

AI总结 本文提出Spectral Scalpel方法,通过频率选择性过滤增强相邻动作差异,改进基于骨架的动作分割性能,实验表明其在多个数据集上达到最优效果。

Comments CVPR Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24097 2026-03-26 cs.CV

LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation

LaDy:基于空间-时间调制的拉格朗日-动态网络用于基于骨骼的动作分割

Haoyu Ji, Xueting Liu, Yu Gao, Wenze Huang, Zhihao Yang, Weihong Ren, Zhiyong Wang, Honghai Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学)

AI总结 本文提出LaDy网络,通过整合拉格朗日动力学原理,提升骨骼动作分割的精度与边界定位能力,实验表明其在挑战性数据集上取得最优性能。

Comments CVPR Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24078 2026-03-26 cs.CV

PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation

PosterIQ: 一份面向海报理解和生成的设计视角基准

Yuheng Feng, Wen Zhang, Haodong Duan, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) Snapchat Inc.(Snapchat公司) ByteDance Seed(字节跳动种子)

AI总结 PosterIQ 是一个设计驱动的海报理解与生成基准,包含7765个图像注释实例和822个生成提示,评估了最先进的MLLMs和扩散生成器,揭示了视觉层次、字体语义等领域的差距。

Comments CVPR 2026, Project Page: https://github.com/ArtmeScienceLab/PosterIQ-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24043 2026-03-26 cs.CV

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

HAM: 一种通过异构注意力调节的无训练风格迁移方法用于扩散模型

Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Macao Polytechnic University(澳门 polytechnic 大学)

AI总结 本文提出一种无训练的风格迁移方法HAM,通过异构注意力调节保护内容图像的身份信息,解决风格与内容的平衡问题。

Comments Accepted in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24039 2026-03-26 cs.CV cs.GR cs.HC

SemLayer: Semantic-aware Generative Segmentation and Layer Construction for Abstract Icons

SemLayer:基于语义的生成分割与抽象图标分层构建

Haiyang Xu, Ronghuan Wu, Li-Yi Wei, Nanxuan Zhao, Chenxi Liu, Cuong Nguyen, Zhuowen Tu, Zhaowen Wang

AI总结 SemLayer通过生成分割和分层构建技术,恢复抽象图标中丢失的语义分层结构,使原本无法编辑的扁平化矢量图形恢复可编辑性,推动语义分层重建成为实用任务。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24030 2026-03-26 cs.CV cs.MM

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23896 2026-03-26 cs.CV

MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation

MMTIT-Bench: 一个具有认知-感知-推理引导的多语言多场景文本-图像机器翻译基准

Gengluo Li, Chengquan Zhang, Yupu Liang, Huawen Shen, Yaping Zhang, Pengyuan Lyu, Weinong Wang, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University of Science and Technology(南京理工大学)

AI总结 MMTIT-Bench通过1400张覆盖14种非英语和非中文语言的图像,评估端到端文本-图像机器翻译的鲁棒性,并提出CPR-Trans数据范式提升翻译推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23883 2026-03-26 cs.CV

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

BioVITA: 生物数据集、模型和基准用于视觉-文本-音频对齐

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) OMRON SINIC X

AI总结 本文提出BioVITA框架,通过大规模数据集、模型和跨模态检索基准,实现生物物种的多模态对齐,提升生物多样性理解。

Comments CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23521 2026-03-26 cs.CL cs.AI cs.CV

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22593 2026-03-26 cs.CV cs.AI

Language Models Can Explain Visual Features via Steering

语言模型可通过引导解释视觉特征

Javier Ferrando, Enrique Lopez-Cuena, Pablo Agustin Martin-Torres, Daniel Hinjos, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心)

AI总结 本文提出通过因果干预引导语言模型解释视觉特征,提供了一种可扩展的替代方法,提升视觉模型的可解释性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22492 2026-03-26 cs.CV cs.AI cs.MM

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13904 2026-03-26 cs.CV cs.AI cs.LG cs.RO

Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where Composition

单个token中的像素级场景理解:视觉状态需要什么在哪里的组成

Seokmin Lee, Yunghee Lee, Byeonghyun Pak, Byeongju Woo

机构 * Agency for Defense Development(国防发展机构)

AI总结 本文提出CroBo框架,通过全局到局部重建目标,学习能捕捉场景元素语义身份和空间位置的视觉状态表示,以支持连续决策。

Comments Accepted to CVPR 2026 Workshop: Pixel-level Video Understanding in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11380 2026-03-26 cs.CV

DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding

DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解

Mingzhe Tao, Ruiping Liu, Junwei Zheng, Yufan Chen, Kedi Ying, M. Saquib Sarfraz, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。

Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA

详情

展开后加载摘要…

URL PDF HTML 收藏