arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2506.13130 2026-04-07 cs.CV cs.AI cs.CL

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07002 2026-04-07 cs.CV

BePo: Dual Representation for 3D Occupancy Prediction

BePo:3D占用预测的双表示

Yunxiao Shi, Hong Cai, Jisoo Jeong, Yinhao Zhu, Shizhong Han, Amin Ansari, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 本文提出BePo,通过结合BEV和稀疏点的双表示,解决小物体和大平面的占用预测问题,实验表明其在多个基准上表现优异且推理成本低。

Comments CVPR 2026 Workshop on Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02794 2026-04-07 cs.GR cs.AI cs.CV

PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis

PhysGaia:一个包含多体相互作用的物理感知基准,用于动态新视角合成

Mijeong Kim, Gunhee Kim, Jungyoon Choi, Wonjae Roh, Bohyung Han

机构 * Computer Vision Laboratory, Seoul National University(首尔大学计算机视觉实验室)

AI总结 PhysGaia是首个关注动态新视角合成中物理一致性重建的基准,包含复杂多体交互场景和多种材料,提供高保真物理模拟和真实轨迹数据以推动相关研究。

Comments Accepted at CVPR 2026 Project page: http://cvlab.snu.ac.kr/research/PhysGaia Dataset: https://huggingface.co/datasets/mijeongkim/PhysGaia/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16042 2026-04-07 cs.CV

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18716 2026-04-07 cs.CV

SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation

SketchDeco:无需训练的潜在空间构图用于精确草图着色

Chaitat Utintu, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX团队)

AI总结 SketchDeco通过无需训练的潜在空间构图方法,实现精确草图着色,结合专业设计需求与直观区域控制,利用简单掩码和颜色调色板实现空间和色彩精确指定,无需手动分配或文本提示模糊性。

Comments Accepted in CVPR 2026. Project page available at https://chaitron.github.io/SketchDeco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04086 2026-04-07 cs.CV

LAA-X: Unified Localized Artifact Attention for Quality-Agnostic and Generalizable Face Forgery Detection

LAA-X:统一的局部化瑕疵注意力用于质量无关且可泛化的面部伪造检测

Dat Nguyen, Enjie Ghorbel, Anis Kacem, Marcella Astrid, Djamila Aouada

机构 * CRISTAL laboratory, ENSI, University of Manouba(马努巴大学ENSI学院CRISTAL实验室) SnT, University of Luxembourg(卢森堡大学SnT中心)

AI总结 本文提出LAA-X框架,通过多任务学习与数据合成结合,实现对高质量伪造和未知篡改的鲁棒检测,支持CNN和Transformer结构,提供LAA-Net和LAA-Former两种版本,能与最新方法在多个基准上竞争。

Comments Journal version of LAA-Net (CVPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04063 2026-04-07 cs.CV

4C4D: 4 Camera 4D Gaussian Splatting

4C4D: 4台相机的4维高斯点散布

Junsheng Zhou, Zhifan Yang, Liang Han, Wenyuan Zhang, Kanle Shi, Shenkun Xu, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技)

AI总结 本文提出4C4D框架,通过极稀疏相机拍摄实现高保真4维高斯点散布,解决视频中4维动态场景重建问题,提升几何建模能力。

Comments Accepted by CVPR 2026. Project page: https://junshengzhou.github.io/4C4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03972 2026-04-07 cs.CV

Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection

具有自适应补丁代码书的分层点-补丁融合用于3D形状异常检测

Xueyang Kang, Zizhao Li, Tian Lan, Dong Gong, Kourosh Khoshelham, Liangliang Nan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学) Delft University of Technology(代尔夫特理工大学)

AI总结 本文提出一种分层点-补丁异常评分网络,通过联合建模区域部分特征和局部点特征,提升3D形状异常检测的鲁棒性。采用自适应补丁化模块捕捉复杂结构偏差,并在公开和工业数据集上取得优越的AUC-ROC和AUC-PR性能。

Comments 10 pages, 5 figures, 6 tables

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03950 2026-04-07 cs.LG cs.AI

Diagonal-Tiled Mixed-Precision Attention for Efficient Low-Bit MXFP Inference

对角 tiled 混合精度注意力机制用于高效低比特 MXFP 推理

Yifu Ding, Xinhao Zhang, Jinyang Guo

机构 * State Key Laboratory of Complex & Critical Software Environment (SKLCCSE), Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出了一种低比特混合精度注意力核,利用MXFP数据格式在下一代GPU架构上实现高效低比特MXFP推理,通过融合核和硬件级并行性提升推理速度而不牺牲模型性能。

Comments CVPR Workshop EDGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03841 2026-04-07 cs.CV

Training a Student Expert via Semi-Supervised Foundation Model Distillation

通过半监督基础模型蒸馏训练学生专家

Pardis Taghavi, Tian Liu, Renjie Li, Reza Langari, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学)

AI总结 本文提出半监督知识蒸馏框架,利用有限标注和大量未标注数据压缩预训练视觉基础模型,提升实例分割性能,通过对比学习和多目标损失提升学生模型效果。

Comments Accepted to the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03819 2026-04-07 cs.CV

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

活动取证:一种全面的基准,用于定位视频中的篡改活动

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) VinUniversity

AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。

Comments [CVPR 2026] The first benchmark for action-level deepfake localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03814 2026-04-07 cs.CV cs.AI

InCaRPose: In-Cabin Relative Camera Pose Estimation Model and Dataset

InCaRPose:车内相对相机姿态估计模型与数据集

Felix Stillger, Lukas Hahn, Frederik Hasecke, Tobias Meisen

机构 * University of Wuppertal(伍珀塔尔大学) Aptiv(Aptiv公司)

AI总结 本文提出InCaRPose模型,基于Transformer架构实现车内环境下高精度相机姿态估计,通过合成数据训练实现对鱼眼镜头畸变的鲁棒性,并在7-Scenes数据集上表现优异。

Comments Accepted at the CVPR 2026 Workshop on Autonomous Driving (WAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03716 2026-04-07 cs.CV cs.GR

CGHair: Compact Gaussian Hair Reconstruction with Card Clustering

CGHair: 基于卡聚类的紧凑高斯发丝重建

Haimin Luo, Srinjay Sarkar, Albert Mosella-Montoro, Francisco Vicente Carrasco, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出一种紧凑的高保真发丝重建方法,通过卡聚类减少存储和渲染成本,同时保持视觉质量。

Comments Accepted to CVPR 2026. This arXiv version is not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03706 2026-04-07 cs.CV

XSeg: A Large-scale X-ray Contraband Segmentation Benchmark For Real-World Security Screening

XSeg:一个大规模X射线违禁品分割基准用于现实世界的安全筛查

Hongxia Gao, Litao Li, Yixin Chen, Jiali Wen, Kaijie Zhang, Qianyun Liu

机构 * Xi’an Jiaotong University(西安交通大学) South China University of Technology(华南理工大学) Shenzhen Loop Area Institute(深圳河套学院) Pazhou Laboratory(琶洲实验室)

AI总结 本文提出XSeg,首个大规模X射线违禁品分割数据集,包含98644张图像和295932个实例掩码,通过自定义数据清洗流程提升数据质量,并引入APSAM模型提升分割性能。

Comments 12 pages, 8 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03657 2026-04-07 cs.CV cs.IR cs.MM

Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

爱我,爱我的标签:重新思考标签在视觉上下文学习中的提示检索中的作用

Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

AI总结 本文提出LaPR框架,通过增强标签信息提升视觉上下文学习中提示检索的性能,实验表明其在分割、检测和着色任务中表现优异。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03653 2026-04-07 cs.CV cs.IR cs.MM

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03619 2026-04-07 cs.CV

Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?

自然图像自编码器能否为长程动态建模紧凑地编码fMRI体积?

Peter Yongho Kim, Juhyeon Park, Jungwoo Park, Jubin Choi, Jungwoo Seo, Jiook Cha, Taesup Moon

机构 * ECE, Seoul National University(首尔大学电气与计算机工程系) IPAI, Seoul National University(首尔大学IPAI研究所) BCS, Seoul National University(首尔大学生物与认知科学系) Psychology, Seoul National University(首尔大学心理学系) ASRI / INMC / AIIS, Seoul National University(首尔大学ASRI/INMC/AIIS研究所)

AI总结 本文提出TABLeT方法,利用预训练的2D自然图像自编码器对fMRI体积进行紧凑编码,以高效建模长程时空动态,优于现有方法并在计算和内存效率上取得显著提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03606 2026-04-07 cs.LG

BlazeFL: Fast and Deterministic Federated Learning Simulation

BlazeFL:快速且确定性的联邦学习仿真

Kitsuya Azuma, Takayuki Nishio

机构 * Institute of Science Tokyo(东京科学大学)

AI总结 BlazeFL通过自由线程共享内存执行和确定性随机数管理,解决了联邦学习仿真中效率与可重复性之间的权衡问题,提升了仿真速度并保持轻量级依赖。

Comments 9 pages, 4 figures. Accepted to the FedVision at CVPR 2026 (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03590 2026-04-07 cs.CV

SBF: An Effective Representation to Augment Skeleton for Video-based Human Action Recognition

SBF:一种有效的表示方法用于增强基于视频的人体动作识别的骨架

Zhuoxuan Peng, Yiyi Ding, Yang Lin, S. -H. Gary Chan

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出SBF表示方法,通过引入尺度图、人体图和流图来增强骨架信息,提升动作识别精度。

Comments Accepted by ABAW2026 (CVPR Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03454 2026-04-07 cs.CV cs.AI

RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

RDFace:一种用于罕见疾病面部图像分析的基准数据集,在极端数据稀缺和表型意识合成生成下

Ganlin Feng, Yuxi Long, Hafsa Ali, Erin Lou, Fahad Butt, Qian Liu, Yang Wang, Pingzhao Hu

机构 * Western University(西安大略大学) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) University of Winnipeg(温尼伯大学)

AI总结 RDFace包含456张儿童面部图像,涵盖103种罕见遗传疾病,旨在开发和评估在低数据条件下高效的人工智能模型,通过合成生成和数据增强提升诊断准确率。

Comments Accepted to CVPR 2026. 8 pages main paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03448 2026-04-07 cs.CV cs.AI cs.HC cs.LG

ExpressEdit: Fast Editing of Stylized Facial Expressions with Diffusion Models in Photoshop

ExpressEdit: 在Photoshop中使用扩散模型快速编辑风格化面部表情

Kenan Tang, Jiasheng Guo, Jeffrey Lin, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 ExpressEdit通过开放源代码的Photoshop插件,实现快速且无伪影的风格化面部表情编辑,结合Liquify等原生功能,提升编辑效率与艺术创作灵活性。

Comments Accepted to CVPR 2026 Workshop on Generative AI for Storytelling (AISTORY)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03320 2026-04-07 cs.CV

Robust Multi-Source Covid-19 Detection in CT Images

在CT图像中实现鲁棒的多源新冠检测

Asmita Yuki Pritha, Jason Xu, Daniel Ding, Justin Li, Aryana Hou, Xin Wang, Shu Hu

机构 * Capstone School Dhaka(达卡顶点学校) Carmel High School(卡梅尔高中) Clarkstown High School South(克拉克镇南高中) University at Albany, State University of New York(纽约州立大学奥尔巴尼分校) Purdue University(普渡大学)

AI总结 本文提出多任务学习方法,通过预测新冠诊断和数据源来提高多中心CT图像检测的鲁棒性,实现高F1分数和AUC-ROC值。

Comments 8 pages, 5 figures, 3 tables. Accepted at the 3rd Workshop on New Trends in AI-Generated Media and Security (AIMS) @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03296 2026-04-07 cs.CV cs.AI

3D-IDE: 3D Implicit Depth Emergent

3D-IDE: 3D隐式深度涌现

Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院) FreiNexus School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

AI总结 本文提出3D-IDE方法,通过几何自监督学习实现3D感知的隐式涌现,消除了深度和姿态依赖,提升推理效率和多任务性能。

Comments CVPR 2026 accepted. Project page: https://chushanzhang.github.io/3D-IDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29773 2026-04-07 cs.CV

Beyond Ground-Truth: Leveraging Image Quality Priors for Real-World Image Restoration

超越真实数据:利用图像质量先验进行现实场景图像修复

Fengyang Xiao, Peng Hu, Lei Xu, XingE Guo, Guanyi Qin, Yuqi Shen, Chengyu Fang, Rihan Zhang, Chunming He, Sina Farsiu

机构 * Duke University(杜克大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑分校)

AI总结 本文提出IQPIR框架,通过引入图像质量先验指导图像修复,提升感知质量。方法整合代码本先验,采用Transformer和双分支结构优化修复效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26357 2026-04-07 cs.CV

MPDiT: Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

MPDiT:一种多块全局到局部变换器架构用于高效的流匹配和扩散模型

Quan Dao, Dimitris Metaxas

机构 * Rutgers University(罗格斯大学)

AI总结 MPDiT通过多块变换器架构在扩散和流匹配模型中实现高效计算,减少50%的GFLOPs消耗同时保持生成性能,改进时间与类别嵌入设计加速训练收敛。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09573 2026-04-07 cs.CV

More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

全景语言模型:超越拼接的全景场景理解

Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Shenzhen University(深圳大学) UCL(伦敦大学学院)

AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03944 2026-04-07 cs.CV

SCP: Spatial Causal Prediction in Video

SCP:视频中的空间因果预测

Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学) Sichuan University(四川大学) National Tsing Hua University(国立清华大学)

AI总结 本文提出SCP任务,挑战模型超越观察预测空间因果结果,并构建SCP-Bench基准测试,揭示人类与模型性能差距及因果推理局限。

Comments 30 pages, 21 figures, 17 tables, CVPR findings

详情

展开后加载摘要…

URL PDF HTML 收藏