arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11920 篇
2605.14542 2026-09-30 cs.AI 版本更新

Ottilie: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments 10 pages, 7 figures. An earlier version, titled "VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce", was accepted to the CVPR 2026 HiGen Workshop (non-archival). This version extends it with a deployment study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12006 2026-09-30 cs.CV 版本更新

Robust Promptable Video Object Segmentation

鲁棒可提示视频对象分割

Sohyun Lee, Yeho Gwon, Lukas Hoyer, Konrad Schindler, Christos Sakaridis, Suha Kwak

机构 * POSTECH ; Google(谷歌) ; ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出鲁棒可提示视频对象分割方法MoGA,通过内存对象条件门控适应处理视频对象分割中的退化问题,提升在真实环境下的鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21838 2026-09-29 cs.CV cs.LG 版本更新

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Neuromatch ; Boston University(波士顿大学)

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-09-29 cs.CV 版本更新

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15372 2026-09-29 cs.CR cs.AI cs.MM

The Synthetic Media Shift: Tracking the Rise, Virality, and Detectability of AI-Generated Multimodal Misinformation

合成媒体的演变:跟踪AI生成多模态虚假信息的兴起、传播与可检测性

Zacharias Chrysidis, Stefanos-Iordanis Papadopoulos, Symeon Papadopoulos

机构 * Centre for Research and Technology Hellas(希腊研究中心)

AI总结 本文提出CONVEX数据集,研究多模态虚假信息的传播与共识动态,发现AI生成内容虽传播迅速但依赖被动互动,且检测性能随生成模型发展而下降。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 8626-8635

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-09-29 cs.CV 版本更新

GeoBridge++: Fact-Guided Geo-Semantic Bridging for Unified Cross-View Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zhiming Luo, Wenbin Liu, Haonan Guo, En Wang, Bo Du, Liangpei Zhang

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments Extended journal version of the CVPR 2026 paper. Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-09-29 cs.CV cs.AI cs.LG 版本更新

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18640 2026-09-28 cs.CV cs.AI cs.RO 版本更新

Geometric-Photometric Event-based 3D Gaussian Ray Tracing

几何-光度事件基于的3D高斯射线追踪

Kai Kohyama, Yoshimitsu Aoki, Guillermo Gallego, Shintaro Shiba

机构 * Keio University(庆应义塾大学) ; Technische Universität Berlin(柏林工业大学) ; Science of Intelligence Excellence Cluster(智能科学卓越集群) ; Einstein Center Digital Future(爱因斯坦数字未来中心) ; Robotics Institute Germany(德国机器人研究所) ; The University of Tokyo(东京大学)

AI总结 本文提出GPERT框架,通过分离事件渲染与快照渲染,解决事件基于3DGS的精度与时间分辨率平衡问题,实现高精度3D重建。

Comments 15 pages, 12 figures, 5 tables

Journal ref IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Denver, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-09-28 cs.CV 版本更新

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments Accepted to CVPR 2026 (camera-ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09896 2026-09-28 cs.CV 版本更新

Exploring the Benefits of Vision Foundation Models for Unsupervised Domain Adaptation

探索视觉基础模型在无监督域适应中的优势

Brunó B. Englert, Fabrizio J. Piva, Tommie Kerssies, Daan de Geus, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 本研究证明视觉基础模型与无监督域适应在语义分割中互补,能提升性能并实现显著加速,为UDA设定新标准。

Comments CVPR 2024 Workshop Proceedings for the Second Workshop on Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.29091 2026-09-25 cs.RO 新提交

From Passive Execution to Active Exploration: Agentic Embodied Manipulation in Realistic Environments

从被动执行到主动探索:真实环境中的智能体具身操作

Shilin Ma, Chubin Zhang, Xulong Bai, Zifeng Gao, Shiyi Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

AI总结 针对现有具身操作框架被动执行、难以应对真实环境中语义线索与不可见目标的问题,提出由规划、感知、执行三模块协作的主动探索框架及感知-执行交错策略,在真实Find-and-Place任务中验证了有效性。

Comments 1st Place in the CVPR 2026 GigaBrain Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-09-25 cs.RO cs.AI cs.CV 版本更新

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Ding Yi, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) ; Tsinghua University(清华大学) ; Juxi Tech(矩芯科技) ; IntelliFusion Inc.(智融公司) ; The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures. Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition Conference Findings (CVPRF 2026)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF), 2026, pp. 1346-1357

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.27442 2026-09-24 cs.CV eess.IV 新提交

SatUnreal: A High-Precision Synthetic Dataset for Satellite Stereo Matching via Unreal Engine

SatUnreal:基于虚幻引擎的卫星立体匹配高精度合成数据集

Han-Gyeol Kim, JaeWan Park, Junmin Park, Darongsae Kwon

机构 * TelePIX

AI总结 提出基于虚幻引擎的合成数据集SatUnreal,通过物理几何模拟、时空一致性、地形多样性和数学标签完整性生成高精度立体图像对,训练模型在真实基准上取得优于真实数据的零样本迁移性能。

Comments Accepted at CVPR 2026 Workshop on EarthVision (CVPRW 2026), pp. 7990-7999. Code and dataset: https://github.com/jmp-Telepix/SatUnreal_A_High-Precision_Synthetic_Dataset_for_Satellite_Stereo_Matching_via_UnrealEngine Supplementary material: https://openaccess.thecvf.com/content/CVPR2026W/EarthVision/supplemental/Kim_SatUnreal_A_High-Precision_CVPRW_2026_supplemental.pdf

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 7990-7999

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.27194 2026-09-24 cs.CV 新提交

Diverse by Design: Architectural Constraints for Prototype-Based Interpretability

多样性的设计:基于原型的可解释性的架构约束

Xinmiao Lin, Matthew Wright

机构 * Rochester Institute of Technology(罗切斯特理工学院)

AI总结 针对基于原型的神经网络原型冗余、缺乏多样性和定量评估的问题,提出DAPL,通过架构约束和前景感知训练提升原型多样性,在CUB-200-2011上以81.69%准确率实现最佳平衡。

Comments Accepted to CVPR 2026 Trustworthy, Robust, Uncertainty-Aware, and Explainable Visual Intelligence and Beyond (TRUE-V) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16080 2026-09-24 cs.CV 版本更新

ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation

ReAlign:通过推理对齐表示实现通用图像伪造检测

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Future Technology, South China University of Technology(华南理工大学未来技术学院) ; School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

AI总结 本文提出ReAlign框架,通过对比学习将LLM生成的高质量推理文本转化为轻量级AIGI检测器,提升检测准确性和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15533 2026-09-24 cs.LG cs.CV

Sequential training of GANs against GAN-classifiers reveals correlated "knowledge gaps" present among independently trained GAN instances

对抗GAN分类器的GAN顺序训练揭示独立训练的GAN实例间存在相关的“知识缺口”

Arkanath Pathak, Nicholas Dufour

机构 * Google Research(谷歌研究院)

AI总结 本研究通过顺序训练GAN分类器与GAN,发现StyleGAN2能在不降低输出质量的情况下欺骗分类器,而DCGAN不能,揭示了不同GAN实例间相关的知识缺口及其对训练的影响。

Journal ref 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.25302 2026-09-23 cs.NI 新提交

Multi-Agent Video Prediction: Self-Correcting Conditional Frames for Dynamic Scene Forecasting

多智能体视频预测:用于动态场景预测的自校正条件帧

Qixin Zhang, Ajay Kumar, Zhi-Li Zhang

AI总结 针对远程驾驶中网络延迟导致新物体出现时预测失效的问题,提出多智能体视频预测框架,结合连续预测与掩码引导条件重调节,实现语义恢复并保持质量与效率。

Comments Published in the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1087-1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08912 2026-09-23 cs.CV cs.RO 版本更新

LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception

LiDAS: 基于光照的动态主动感知用于夜间感知

Simon de Moreau, Andrei Bursuc, Hafid El-Idrissi, Fabien Moutarde

机构 * Valeo - Mines Paris PSL(Valeo - 巴黎 Mines 工程学院) ; Valeo ; Mines Paris PSL(巴黎 Mines 工程学院)

AI总结 LiDAS是一种基于光照的动态主动感知系统,通过自适应照明控制提升夜间感知性能,实现白天训练模型在夜间场景中的零样本泛化。

Comments Published at CVPR 2026. 12 pages, 9 figures. Project page: https://simondemoreau.github.io/LiDAS/

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08125 2026-09-22 eess.IV cs.CV

FlowSteer: Conditioning Flow Field for Consistent Image Restoration

FlowSteer: 条件化流场以实现一致图像恢复

Tharindu Wickremasinghe, Chenyang Qi, Harshana Weligampola, Zhengzhong Tu, Stanley H. Chan

机构 * Purdue University(普渡大学) ; HKUST(香港科技大学) ; Texas A&M University(德克萨斯农工大学)

AI总结 提出FlowSteer,一种算子感知的条件化方案,通过在采样路径中注入测量先验,将冻结流的隐式引导与显式测量约束耦合,在零样本设置下实现超分辨率、去模糊、去噪和着色等任务的一致图像恢复。

Comments Accepted by CVPRF 2026. Camera Ready version. Project page is \href{https://tharindu-nirmal.github.io/FlowSteer/}{in this link}

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17558 2026-09-22 cs.CV

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 12279-12288, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-09-21 cs.CV

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19134 2026-09-21 cs.CV

Mapping Networks

映射网络

Lord Sen, Shyamapada Mukherjee

机构 * National Institute of Technology Rourkela Odisha(印度奥迪沙省拉尔克ela国家理工学院)

AI总结 映射网络通过降低参数数量显著减少过拟合,实现复杂视觉任务中与目标网络相当或更好的性能。

Comments 10 pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36215-36223

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08775 2026-09-21 cs.CV 版本更新

ALINA: Advanced Line Identification and Notation Algorithm

ALINA:高级线条识别与标注算法

Mohammed Abdul Hafeez Khan, Parth Ganeriwala, Siddhartha Bhattacharyya, Natasha Neogi, Raja Muthalagu

机构 * Florida Institute of Technology(佛罗里达理工学院) ; NASA Langley Research Center(美国国家航空航天局兰利研究中心) ; BITS Pilani Dubai Campus(印度比拉斯布尔大学 Pilani 迪拜校区)

AI总结 本文提出ALINA标注框架及CIRCLEDAT算法,用于自动标注滑行道数据集,在60,249帧上实现98.45%的检测率,解决了传统标注成本高、隐私等问题。

Comments Paper has been accepted to The 3rd CVPR Workshop on Vision Datasets Understanding, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00095 2026-09-17 cs.CV cs.AI cs.CL cs.RO

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

弥合2D-3D鸿沟:面向视觉语言导航的分层语义几何地图

Kailing Li, Tianwen Qian, Lijin Yang, Yuqian Fu, Jingyu Gong, Xiaoling Wang, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Bosch Corporate Research(博世企业研究) ; King Abdullah University of Science and Technology(卡布斯大学)

AI总结 提出分层语义几何地图(HSGM),将3D几何信息转化为VLM可理解的结构化表示,结合VLM高层语义规划与经典路径规划,实现零样本视觉语言导航,在R2R-CE和RxR-CE基准上达到最先进性能。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 15243-15252

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17629 2026-09-17 cs.CV cs.AI cs.CL

CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning

CLiViS: 通过语言-视觉协同释放认知地图用于具身视觉推理

Kailing Li, Qi'ao Xu, Tianwen Qian, Yuqian Fu, Yang Jiao, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; King Abdullah University of Science and Technology(科廷大学) ; Fudan University(复旦大学)

AI总结 提出CLiViS框架,通过LLM进行高层任务规划并协调VLM驱动的开放世界视觉感知,构建动态认知地图以迭代更新场景上下文,实现无需训练的具身视觉推理。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 5134-5143

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26727 2026-09-17 cs.CV cs.AI

The Nonverbal Gap: Toward Affective Computer Vision for Safer and More Equitable Online Dating

非语言鸿沟:迈向更安全和公平的在线约会情感计算

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir

机构 * University of Kansas(堪萨斯大学) ; University of Maryland(马里兰大学)

AI总结 本文探讨在线约会中非语言信息缺失的问题,提出以公平性为核心的研究议程,涵盖实时不适检测、互动不对称建模、知情同意互动设计及长期互动总结等能力领域,强调需建立公平评估体系和设备端处理架构以提升安全性和公平性。

Journal ref CVPR Humans of Generative AI (HuG) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15678 2026-09-16 cs.CV 版本更新

HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning

HyCal:一种无需训练的跨学科少样本类增量学习原型校准方法

Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim

机构 * Chung-Ang University(Chung-Ang 大学) ; KT Corporation(KT 公司) ; Dentium ; ETRI

AI总结 本文提出HyCal方法,通过结合余弦相似度和马氏距离,解决跨学科少样本类增量学习中的领域引力问题,提升在不平衡数据下的性能。

Comments Accepted to CVPR 2026. Eunju Lee and MiHyeon Kim contributed equally as co-first authors. Official code implementation is available at: https://github.com/EJLEE5826/HyCal-CIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15120 2026-09-15 cs.CV 新提交

DNF-SR: Dual-Input and Negative-Aware Feature Fine-Tuning for Real-World Image Super-Resolution

DNF-SR:用于真实世界图像超分辨率的双输入与负感知特征微调

Shuhao Han, Wenjie Liao, Hayden Vance, Hang Dong, Rui Zhang, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) ; NKIARI, Shenzhen Futian(深圳福田NKIARI)

AI总结 提出DNF-SR,通过双输入拼接与负感知特征微调(NF2T),利用噪声多样性引导单步扩散模型,实现高保真且稳定的真实世界图像超分辨率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18177 2026-09-15 cs.CV 版本更新

Token-Space Mask Prediction for Efficient Vision Transformer Segmentation

基于令牌空间的掩码预测用于高效的视觉变换器分割

Calvin Galagain, Martyna Poreba, François Goulette

机构 * Université Paris-Saclay, CEA List(巴黎-萨克雷大学,CEA列表) ; U2IS, ENSTA Paris, Institut Polytechnique de Paris(U2IS,巴黎ENSTA,巴黎理工学院)

AI总结 本文提出TokenMask,一种直接从查询令牌亲和力计算掩码logits并进行logit空间插值的方法,从而在保持准确性的同时减少计算和内存需求,提高分割效率。

Comments Accepted at the CVPR 2026 Embedded Vision Workshop (EVW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12077 2026-09-15 cs.CV cs.AI

The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments

缺失的GAP:从解决正方形拼图到处理现实世界考古碎片

Ofir Itzhak Shahar, Gur Elkin, Ohad Ben-Shahar

机构 * Stein Faculty of Computer and Information Science(Stein 计算机与信息科学学院)

AI总结 本文提出GAP数据集和PuzzleFlow框架,解决非正方形拼图问题,提升对考古碎片的处理能力。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 3186-3196

详情

展开后加载摘要…

URL PDF HTML 收藏
↑