arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.12533 2026-03-31 cs.CV

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02190 2026-03-31 cs.CV cs.AI cs.GR cs.HC cs.LG

Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

Sketch2Colab: 通过可控流蒸馏实现基于草图的多人体动画

Divyanshu Daiya, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(普渡大学计算机科学系IDEAS实验室)

AI总结 Sketch2Colab通过可控流蒸馏将故事板风格的2D草图转化为连贯的3D多人体运动,实现对代理、关节、时序和接触的精细控制,实验显示其在约束遵循和感知质量上优于基线方法。

Comments Accepted to CVPR 2026 Main Conference (11 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23153 2026-03-31 cs.CV cs.AI

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

高效无编码器的基于傅里叶的3D大多模态模型

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) JKU Linz, Austria(奥地利林茨约翰·开普勒大学) CSIRO, Australia(澳大利亚联邦科学与工业研究组织)

AI总结 本文提出Fase3D,一种基于傅里叶变换的无编码器3D多模态模型,通过结构化超点和空间填充曲线实现高效全局上下文建模,显著提升计算效率和参数效率。

Journal ref CVPR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21655 2026-03-31 cs.CV cs.AI

CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

CCCaption: 为完整和正确图像描述的双奖励强化学习

Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng Hou, Anxiang Zeng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) LLM Team, Shopee Pte. Ltd.(Shopee私人有限公司大语言模型团队)

AI总结 本文提出CCCaption框架,通过双奖励强化学习优化图像描述的完整性和正确性,利用多样化LVLMs和动态查询采样策略提升训练效率,并通过验证子描述查询的真实性来惩罚幻觉,从而生成更符合客观标准的描述。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04361 2026-03-31 cs.CV cs.AI cs.LG

SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration

SparVAR:探索视觉自回归建模中的稀疏性以实现无训练加速

Zekun Li, Ning Wang, Tongxin Bai, Changwang Mei, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanjing University of Science and Technology(南京理工大学) City University of Hong Kong(香港城市大学)

AI总结 SparVAR通过利用自回归注意力的稀疏性,提出了一种无需训练的加速框架,有效降低计算复杂度,提升生成速度并保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17470 2026-03-31 cs.CV

PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

PhaSR:基于物理对齐先验的通用图像阴影去除

Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Cheng Kung University(国立成功大学)

AI总结 PhaSR通过双层先验对齐解决不同光照条件下阴影去除问题,结合物理对齐归一化和几何-语义校正注意力,提升单光源到多源环境的鲁棒性,实验显示其在复杂光照下表现优异。

Comments CVPR 2026 Camera Ready; Project Page: https://ming053l.github.io/PhaSR_github

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13680 2026-03-31 cs.CV

LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction

LASER:基于分层尺度对齐的无训练流式4D重建

Tianye Ding, Yiming Xie, Yiqing Liang, Moitreya Chatterjee, Pedro Miraldo, Huaizu Jiang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

AI总结 本文提出LASER框架,通过分层尺度对齐将离线重建模型转换为流式系统,实现14fps和6GB内存下的千米级流式视频重建,优于现有方法。

Comments CVPR 2026, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10950 2026-03-31 cs.CV

E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

E-RayZer:基于空间视觉预训练的自监督3D重建

Qitao Zhao, Hao Tan, Qianqian Wang, Sai Bi, Kai Zhang, Kalyan Sunkavalli, Shubham Tulsiani, Hanwen Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院) Harvard University(哈佛大学)

AI总结 本文提出E-RayZer,一种通过未标注图像直接学习几何基础表示的自监督3D视觉模型,通过显式几何实现3D重建,优于现有方法。

Comments CVPR 2026 Camera-ready. Project website: https://qitaozhao.github.io/E-RayZer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03350 2026-03-31 cs.CV

SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation

SeeU: 通过4D动态感知生成可见的世界

Yu Yuan, Tharindu Wickremasinghe, Zeeshan Nadir, Xijun Wang, Yiheng Chi, Stanley H. Chan

机构 * Purdue University(普渡大学) Samsung Research America(三星美国研究院)

AI总结 SeeU通过4D动态感知生成框架,从稀疏单目2D帧重建4D世界,学习连续4D动态并生成未见视觉内容,实现物理一致的连续生成。

Comments Accepted by CVPR 2026. Camera-Ready Version. Project Page: https://yuyuanspace.com/SeeU/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03336 2026-03-31 cs.LG cs.AI stat.ML

Single-Round Scalable Analytic Federated Learning

单轮可扩展的分析联邦学习

Alan T. L. Bacellar, Mustafa Munir, Felipe M. G. França, Priscila M. V. Lima, Radu Marculescu, Lizy K. John

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Federal University of Rio de Janeiro(里约热内卢联邦大学) Instituto de Telecomunicações, Porto(波尔图电信研究所)

AI总结 本文提出SAFLe框架,通过引入分桶特征结构头部和稀疏分组嵌入,实现非线性可扩展性,证明其等价于高维线性回归,从而在单轮分析联邦学习中实现高效可扩展的联邦视觉解决方案。

Comments To appear in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18600 2026-03-31 cs.CV

NeAR: Coupled Neural Asset-Renderer Stack

NeAR:耦合神经资产-渲染堆栈

Hong Li, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Ziyang Yan, Lixing Xiao, Zhaoxi Chen, Jianfeng Xiang, Shaocong Xu, Xuhui Liu, Yikai Wang, Baochang Zhang, Xiaoguang Han, Jiaolong Yang, Hao Zhao

机构 * BUAA(北京航空航天大学) BAAI(北京智源人工智能研究院) FNii, CUHKSZ(香港中文大学(深圳)未来网络创新研究院) HKUST(香港科技大学) NJU(南京大学) UniTn(特伦托大学) ZJU(浙江大学) NTU(南洋理工大学) THU(清华大学) BNU(北京师范大学) SSE, CUHKSZ(香港中文大学(深圳)理工学院) AIR, THU(清华大学智能产业研究院)

AI总结 NeAR通过耦合资产表示与渲染器设计,提升生成质量和一致性。引入Lighting-Homogenized SLAT和光照感知解码器,实现实时可重照明的3D高斯溅射生成,优于现有方法。

Comments Accepted by CVPR 2026. The project page: https://near-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03100 2026-03-31 cs.CV

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

AVATAR:通过视频进行视觉、听觉和推理的强化学习

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

AI总结 AVATAR通过离线训练架构和时间优势塑造策略解决多模态长时视频推理中的数据效率、消失优势和信用分配问题,实现跨多个基准测试的优越性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24862 2026-03-31 cs.CV

ViStoryBench: Comprehensive Benchmark Suite for Story Visualization

ViStoryBench:故事可视化全面评估基准套件

Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) AGI Lab, Westlake University(西湖大学AGI实验室)

AI总结 本文提出ViStoryBench,一个全面评估故事可视化模型的基准套件,通过多维度指标评估叙事结构、视觉风格和角色设定,结合人类验证确保一致性与真实性,推动视觉叙事技术发展。

Comments Accepted by CVPR 2026. 44 Pages, Project Page: https://vistorybench.github.io, Code: https://github.com/vistorybench/vistorybench, Dataset: https://huggingface.co/datasets/ViStoryBench/ViStoryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04594 2026-03-31 cs.CV

Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection

释放链式预测在单目3D物体检测中的潜力

Zhihao Zhang, Abhinav Kumar, Girish Chandar Ganesan, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出MonoCoP框架,通过链式预测和不确定性引导选择器结合,提升单目3D检测的深度精度,尤其在远距离物体上表现优异。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26929 2026-03-31 cs.CV

Live Interactive Training for Video Segmentation

视频分割的实时交互训练

Xinyu Yang, Haozheng Yu, Yihong Sun, Bharath Hariharan, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

AI总结 本文提出LIT框架,通过实时学习用户反馈提升视频分割性能,LIT-LoRA在挑战性任务中减少18-34%的修正,且训练开销低。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26908 2026-03-31 cs.CV

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26810 2026-03-31 cs.CV eess.IV

Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

Unblur-SLAM:用于模糊输入的密集神经SLAM

Qi Zhang, Denis Rozumny, Francesco Girlanda, Sezer Karaoglu, Marc Pollefeys, Theo Gevers, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) Meta Reality Labs(Meta现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出Unblur-SLAM,一种针对模糊图像输入的RGB SLAM pipeline,能够处理多种模糊类型,在运动模糊和失焦模糊情况下表现出最佳性能,通过调整计算量和多视图优化提升重建效果。

Comments 14 pages, 9 figures (based on the document's total length and the final Figure 9 ). Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26777 2026-03-31 cs.CV astro-ph.IM cs.LG

BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting

BHCast: 从单张模糊图像解锁黑洞等离子体动力学的长期预测

Renbo Tu, Ali SaraerToosi, Nicholas S. Conroy, Gennady Pekhimenko, Aviad Levis

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

AI总结 BHCast通过单张模糊图像预测黑洞等离子体动力学,结合多尺度金字塔损失实现超分辨率和长期稳定预测,提取时空特征并利用梯度提升树恢复黑洞属性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10833 2026-03-31 cs.LG cs.AI cs.CV

Measuring the (Un)Faithfulness of Concept-Based Explanations

测量基于概念的解释的(不)忠实性

Shubham Kumar, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究了基于概念的解释方法的忠实性,提出Surrogate Faithfulness方法以评估其忠实度,发现许多视觉上吸引人的U-CBEMs并不忠实。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏