arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2605.18700 2026-05-19 cs.CV

A Large-Scale Study on the Accuracy vs Cost Trade-offs of Training and Evaluation Settings in Fine-Grained Image Recognition

细粒度图像识别中训练和评估设置的准确性与成本权衡的大规模研究

Edwin Arkel Rios, Augusto Christian Surya, Oswin Gosal, Fernando Mikael, Mary Madeline Nicole, Kisoon Jang, Bo-Cheng Lai, Min-Chun Hu

机构 * National Yang Ming Chiao Tung University, Taiwan National Tsing Hua University, Taiwan

AI总结 本文通过2000多项实验,探讨了不同训练和评估设置下,模型精度与成本之间的权衡,提出改进的Counterfactual Attention Learning方法,并提供高效的评估变体以降低推理成本。

Comments Accepted to The 13th Workshop on Fine-Grained Visual Categorization (FGVC13) @ CVPR 2026. Main: 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18680 2026-05-19 cs.CV

CMAG: Concept-Scaffolded Retrieval for Marketplace Avatar Generation

CMAG:基于概念的市场人像生成检索

Rajeev Goel, Jason Ding, Phani Harish Wajjala, Pavan Turaga, Tejaswi Gowda, Krishna C. Garikipati

机构 * Arizona State University(亚利桑那州立大学) Roblox Corporation(Roblox公司)

AI总结 本文提出CMAG框架,通过概念引导的检索和验证组合方法,解决市场人像生成中因文本模糊、元数据噪声和部件不一致导致的检索问题,提升生成人像的拓扑一致性和组合正确性。

Comments Accepted to CVPR 2026 Workshop (GRAIL-V)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18608 2026-05-19 cs.CV

Dance Across Shifts: Forward-Facilitation Continual Test-Time Adaptation through Dynamic Style Bridging

跨越迁移:通过动态风格桥接实现向前促进的持续测试时间适应

Zhilin Zhu, Yabin Wang, Zhiheng Ma, Yaguang Song, Yaowei Wang, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) Guangdong Provincial Key Laboratory of Computility Microelectronics(广东省计算微电子重点实验室)

AI总结 本文提出了一种新的向前促进的持续测试时间适应方法,通过动态风格桥接机制,在部署前构建紧凑的知识库,并在测试时动态注入输入数据风格,以提供可靠的监督信号,从而在持续迁移中实现稳定的适应。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18263 2026-05-19 cs.CV

RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

RT-Splatting:基于高斯点散布的联合反射-透射建模

Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue

机构 * State Key Laboratory of General Artificial Intelligence(国家一般人工智能重点实验室) School of Intelligence Science and Technology(智能科学与技术学院)

AI总结 本文提出RT-Splatting方法,通过将高斯点的几何占用与光学不透明度分离,实现对半透明表面复杂反射和清晰透射的联合建模,从而在实时渲染中获得高质量的反射和透射效果。

Comments CVPR 2026 Highlight, Project Page: https://sjj118.github.io/RT-Splatting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18209 2026-05-19 cs.CV cs.AI

SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning

SPATIOROUTE: 动态提示路由用于零样本空间推理

Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(台湾国立大学) Delta Robotics Innovation Center(Delta机器人创新中心)

AI总结 本文提出SpatioRoute,一种动态提示生成方法,通过语义定制的提示模板路由问题,无需额外训练或3D传感器输入,在零样本设置下提升空间推理性能,同时发现Chain-of-Thought提示在空间视频理解中效果不佳。

Comments 10 pages, 2 figures, 2nd Workshop on 3D-LLM/VLA, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18193 2026-05-19 cs.CV cs.GR

Best Segmentation Buddies for Image-Shape Correspondence

图像-形状对应关系的最佳分割伙伴

Itai Lang, Dongwei Lyu, Dale Decatur, Rana Hanocka

机构 * University of Chicago(芝加哥大学)

AI总结 本文研究了在真实图像和无纹理3D形状之间估计分割到分割对应关系的任务,通过将图像像素与3D形状顶点链接,利用深度视觉特征进行特征相似性计算,从而实现跨模态的对应关系发现。

Comments CVPR 2026. Project page: https://threedle.github.io/bsb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18192 2026-05-19 cs.CV

View-Aware Semantic Alignment for Aerial-Ground Person Re-Identification

视感知语义对齐用于空-地人员重识别

Quan Zhang, Zeqiang Cai, Peiming Zhao, Jingze Wu, Cailun Wu, Hongbo Chen, Jianhuang Lai

机构 * Sun Yat-sen University, China(中山大学,中国) Pazhou Lab (HuangPu), Guangdong, China(琶洲实验室(黄埔),广东,中国) Guangdong Province Key Laboratory of Information Security Technology, Guangzhou, China(广东省信息安全技术重点实验室,广州,中国) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与高级计算重点实验室,中国)

AI总结 本文提出ViSA框架,通过视感知语义对齐方法解决空-地人员重识别中的视角差异问题,通过专家驱动令牌生成模块和双分支局部融合模块实现跨视角语义一致性,实验表明在CARGO基准测试中mAP提升了10.06%。

Comments CVPR 2026 POSTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18177 2026-05-19 cs.CV

Token-Space Mask Prediction for Efficient Vision Transformer Segmentation

基于令牌空间的掩码预测用于高效的视觉变换器分割

Calvin Galagain, Martyna Poreba, François Goulette

机构 * Université Paris-Saclay, CEA List(巴黎-萨克雷大学,CEA列表) U2IS, ENSTA Paris, Institut Polytechnique de Paris(U2IS,巴黎ENSTA,巴黎理工学院)

AI总结 本文提出TokenMask,一种直接从查询令牌亲和力计算掩码logits并进行logit空间插值的方法,从而在保持准确性的同时减少计算和内存需求,提高分割效率。

Comments CVPR, EVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23194 2026-05-19 cs.GR cs.CV cs.LG

PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinning

PhysSkin: 通过自监督神经皮肤化实现实时且可泛化的基于物理的动画

Yuanhang Lei, Tao Cheng, Xingxuan Li, Boming Zhao, Siyuan Huang, Ruizhen Hu, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui

机构 * State Key Laboratory of CAD&CG(CAD与计算机图形学国家重点实验室) BIGAI Shenzhen University(深圳大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 本文提出PhysSkin框架,通过自监督学习策略实现对多样3D形状和离散化形式的实时基于物理的动画,其核心方法是神经皮肤化场自动编码器和物理感知的学习策略。

Comments Accepted by CVPR 2026 Highlight. Project Page: https://zju3dv.github.io/PhysSkin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09405 2026-05-19 cs.CV

YOLO-NAS-Bench: A Surrogate Benchmark with Self-Evolving Predictors for YOLO Architecture Search

YOLO-NAS-Bench: 一种具有自进化预测器的代理基准,用于YOLO架构搜索

Zhe Li, Xiaoyu Ding, Jiaxin Zheng, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

AI总结 本文提出YOLO-NAS-Bench,一种针对YOLO检测器的代理基准,通过自进化机制提升预测器的准确性,从而在YOLO架构搜索中实现高效评估。

Comments Accepted as Oral at CVPR 2026 Workshop on Neural Architecture Search (NAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18991 2026-05-19 cs.CV

Fast Kernel-Space Diffusion for Remote Sensing Pansharpening

快速核空间扩散用于遥感全色锐化

Hancong Jin, Zihan Cao, Liang-jian Deng, Jingjing Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出KSDiff框架,通过整合低秩核心张量生成器和统一因子生成器,利用结构感知的多头注意力机制生成增强全局上下文的卷积核,以提升全色锐化质量并加速推理,实验表明其在性能和效率上均优于现有方法。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16278 2026-05-19 cs.CV cs.AI cs.RO

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE:面向端到端自动驾驶的视觉-语言-动作混合专家模型

Zhenjie Yang, Yilin Chai, Xiaosong Jia, Qifeng Li, Yuqian Shao, Xuekai Zhu, Haisheng Su, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学学院与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) AnyScale AI Project(AnyScale AI项目)

AI总结 本文提出DriveMoE,一种基于混合专家架构的端到端自动驾驶框架,通过场景专用的视觉混合专家和技能专用的动作混合专家,实现了对复杂驾驶场景的有效处理,展示了在自动驾驶任务中结合视觉和动作混合专家的有效性。

Comments Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18018 2026-05-19 cs.CV cs.AI cs.HC

See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

See What I Mean: 对齐视觉与语言表示以实现视频细粒度物体理解

Boyuan Sun, Bowen Yin, Yuanming Li, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Lab, Alibaba Group(阿里云实验室) NKIARI, Shenzhen Futian(深圳福田国家信息研究所)

AI总结 本文提出SWIM方法,通过对齐视觉和语言表示,仅从文本提示中实现细粒度物体理解,解决了传统方法需要显式视觉提示的问题,通过构建NL-Refer数据集和多层交叉注意力图提升文本-视觉对齐性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17954 2026-05-19 cs.CV cs.AI cs.LG

A More Word-like Image Tokenization for MLLMs

一种更像单词的图像标记化方法用于大规模语言模型

Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

机构 * Seoul National University(首尔国立大学) Ewha Womans University(成均馆大学)

AI总结 本文提出了一种解耦视觉标记化方法(DiVT),通过将图像块嵌入聚类为语义单元,使每个标记对应于独特的视觉概念,从而提升多模态模型的性能和效率。

Journal ref Proceedings of the IEEE/CVF International Conference on Pattern Recognition and Computer Vision (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17742 2026-05-19 cs.CV cs.HC

UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation

UST-Hand: 一种面向3D自监督手姿态估计的不确定性感知时空点云交互网络

Tianhao Han, Haoyang Zhang, Liang Xie, Haochen Chang, Kun Gao, Yuan Cheng, Pengfei Ren, Erwei Yin

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Sun Yat-sen University(中山大学) Peking University(北京大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新院,军事科学学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 本文提出UST-Hand,一种通过估计手姿态不确定性分布并构建概率点云特征空间的自监督学习框架,以更稳定地建模复杂的时空关系,从而在三个具有挑战性的数据集上实现了最先进的性能,比现有自监督方法在均位点误差(MPVPE)上高出37.8%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17584 2026-05-19 cs.CV

VVitCutLER: Towards Unsupervised Object Detection and Segmentation in Videos

VVitCutLER: 向视频中无监督的目标检测和分割迈进

Zhijing Lu, Khurram Azeem Hashmi, Didier Stricker, Muhammad Zeshan Afzal

机构 * RPTU University of Kaiserslautern-Landau(莱茵-瓦尔德大学凯撒斯劳滕-兰道分校) German Research Center for Artificial Intelligence(德国人工智能研究中心)

AI总结 该研究提出VVitCutLER框架,通过引入时间一致性提升视频中伪标签的质量,从而改进目标检测和实例分割的性能,减少时间不稳定性。

Comments 11 figures, cvpr workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20200 2026-05-19 cs.RO cs.AI cs.CV

Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

全局先验与局部一致性:双内存增强的视觉-语言-动作模型用于高效机器人操作

Zaijing Li, Bing Hu, Rui Shao, Gongwei Chen, Dongmei Jiang, Pengwei Xie, Jianye Hao, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) PengCheng Laboratory(鹏城实验室) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出OptimusVLA模型,通过引入全局先验内存和局部一致性内存,解决机器人操作中动作生成效率低和鲁棒性差的问题,从而在多个基准测试中实现了更高的成功率和更快的推理速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01593 2026-05-19 cs.CV cs.MM

Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

超越补丁:面向多模态少样本字体生成的全局感知自回归模型

Haonan Cai, Yuxuan Luo, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学轩计算机技术研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 本文提出GAR-Font,一种多模态少样本字体生成的自回归框架,通过全局感知分词器、多模态风格编码器和后处理流程,提升了字体生成的全局风格一致性和质量。

Comments 28 pages, Accepted as CVPR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21016 2026-05-19 cs.LG cs.CL

Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression

门控KalmaNet:通过测试时岭回归实现渐逝记忆层

Liangzu Peng, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Wei Xia, Stefano Soatto

机构 * University of Pennsylvania(宾夕法尼亚大学) AWS Agentic AI(AWS 代理人工智能)

AI总结 本文提出门控KalmaNet(GKA),通过测试时岭回归实现渐逝记忆层,解决了线性状态空间模型(SSMs)在记忆过去信息时的效率与精度问题,展示了GKA在短上下文任务和长上下文任务中的优越性能。

Comments 30 pages, 10 figures. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17309 2026-05-19 cs.CV cs.AI

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17014 2026-05-19 cs.CV

RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos

RHINO:从单目视频中重建人类与新物体的交互

Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas

机构 * ETH Zürich(苏黎世联邦理工学院) The University of Tokyo(东京大学) University of Amsterdam(阿姆斯特丹大学) Aristotle University of Thessaloniki(希腊塞萨洛尼基阿里斯托芬大学)

AI总结 本文提出RHINO框架,通过三步方法从单目视频中重建3D人类、新物体和静态场景,解决了视频中物体和人类交互的重建问题,提升了4D重建和新视角合成的性能。

Comments CVPR 2026. Project page: https://lxxue.github.io/RHINO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16880 2026-05-19 cs.AI

Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities

虚拟节点引导的动态图神经网络用于缺失模态的脑肿瘤分割

Sha Tao, Jiao Pan, Yu Guo, Chao Yao

机构 * University of Science and Technology Beijing(科学技术大学)

AI总结 本文提出了一种基于图的单阶段框架,通过引入模态特定的虚拟节点来补偿缺失模态,利用图网络的灵活性设计动态连接策略,提升模型对任意模态组合的鲁棒性,并在BRATS-2018和BRATS-2020数据集上验证了方法在不完整模态下的优越性能。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16873 2026-05-19 cs.CV

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16864 2026-05-19 cs.CV cs.AI

Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks

基于度量的视觉基础模型特征融合用于分割任务

Yachan Guo, JoseLuis Gomez Zurita, Danna Xue, Yi Xiao, AntonioManuel Lopez Pena

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Computer Vision Center(计算机视觉中心) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

AI总结 本文提出了一种基于度量的特征融合方法,通过评估不同视觉基础模型的特征空间,选择并聚合互补特征以提升密集预测任务的性能。

Comments Accepted to the CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16806 2026-05-19 cs.LG cs.AI cs.CV

Cross-modal Affinity-aligned Multimodal Learning Analytics for Predicting Student Collaboration Satisfaction in Game-Based Learning

跨模态亲和对齐的多模态学习分析用于预测基于游戏的学习中学生协作满意度

Wen-Hsin Tsai, Chia-Ming Lee, Yuk-Ying Tung

机构 * Institute of Education, National Cheng Kung University(国立成功大学教育研究所) Institute of Intelligent System, National Yang Ming Chiao Tung University(阳明交通大学智能系统研究所) Department of Computer Science, University at Albany, State University of New York(纽约州立大学水牛城分校计算机科学系)

AI总结 本文提出了一种跨模态亲和对齐的多模态学习分析框架,通过建模模态间关系和对比学习来增强学生协作满意度预测的鲁棒性和可解释性。

Comments Accetped by CVPR 2026 CVxEdu Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21071 2026-05-19 cs.CV cs.AI

CTFS : Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels

CTFS:用于极有限标注数据的前瞻性声呐图像语义分割协作教师框架

Ping Guo, Chengzhou Li, Guanchen Meng, Qi Jia, Jinyuan Liu, Zhu Liu, Yu Liu, Zhongxuan Luo, Xin Fan

机构 * School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

AI总结 本文提出CTFS框架,通过多教师协作机制提升声呐图像在极有限标注下的分割性能,通过跨教师可靠性评估机制减少噪声伪标签影响,实验显示在FLSMD数据集上2%标注时mIoU提升5.08%。

Comments Accepted to CVPR 2026 Finding. Code: https://github.com/pingggg516/CTFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04870 2026-05-19 cs.CV

Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

基于扩散的sRGB真实噪声生成:通过提示驱动的噪声表示学习

Jaekyun Ko, Dongjin Kim, Soomin Lee, Guanghui Wang, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(翰阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门) Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

AI总结 本文提出Prompt-Driven Noise Generation框架,通过学习提示特征生成真实噪声图像,无需依赖相机元数据,提升噪声合成的通用性和应用性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23058 2026-05-19 cs.CV cs.RO

GeoWorld: Geometric World Models

GeoWorld:几何世界模型

Zeyu Zhang, Danning Li, Ian Reid, Richard Hartley

机构 * ANU(澳大利亚国立大学) MBZUAI(穆斯林人工智能研究所)

AI总结 GeoWorld通过超几何JEPA和几何强化学习解决传统能量预测模型在几何结构和长周期预测中的不足,实验显示在3-4步规划中性能提升3%-2%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07245 2026-05-19 cs.CV

Zero-Shot Textual Explanations via Translating Decision-Critical Features

通过翻译决策关键特征实现零样本文本解释

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏