arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 555
2606.27784 2026-06-29 cs.CV cs.AI cs.LG 新提交

Improving Adversarial Robustness via Activation Amplification and Attenuation

通过激活放大与衰减提升对抗鲁棒性

Taïga Gonçalves, Yongsong Huang, Tomo Miyazaki, Shinichiro Omachi

机构 * Graduate School of Engineering, Tohoku University(东北大学工学研究科)

AI总结 提出激活放大与衰减(A3)轻量模块,通过可学习缩放机制动态调整激活值,利用放大信号构建对比损失,在衰减模式下提升对抗鲁棒性,计算开销小。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27779 2026-06-29 cs.CV 新提交

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

MindFlow:调和认知语义与声学动态的对话面部动画生成

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

机构 * Beihang University(北京航空航天大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Laboratory(中关村实验室)

AI总结 提出双路径生成框架MindFlow,受神经科学腹侧-背侧通路模型启发,通过Chunk-State方法建模上下文感知情感状态链,结合条件自回归流匹配网络与选择性声学注入器,实现高保真面部动画,在语义适切性和运动自然度上超越现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27729 2026-06-29 cs.CV 新提交

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective

学习基于1比特LiDAR的定位与辅助目标

Kaijie Yin, Zhiyuan Zhang, Tian Gao, Wentao Zhu, Cheng-zhong Xu, Hui Kong

机构 * University of Macau(澳门大学) Singapore Management University(新加坡管理大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

AI总结 提出首个二值神经网络框架BiLoc用于6-DoF LiDAR定位,通过信息瓶颈原理和辅助目标缓解二值化信息损失,实现轻量高效定位。

Comments European Conference on Computer Vision(ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27718 2026-06-29 cs.CV 新提交

MASS: Motion-Aligned Selective Scan for Refinement in Flow-Based Video Frame Interpolation

MASS: 面向基于光流的视频帧插值优化的运动对齐选择性扫描

Jun-Sang Yoo, Seung-Won Jung

机构 * Department of Electrical Engineering, Korea University(高丽大学电气工程学院)

AI总结 提出运动对齐选择性扫描(MASS)框架,通过沿光流轨迹构建特征序列并用状态空间模型聚合,以解决大运动和非线性运动下的视频帧插值难题,在标准基准上取得领先性能。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27554 2026-06-29 cs.CV 新提交

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

理解自动驾驶感知中的跨传感器配置泛化:多配置基准与配置变化度量

Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer, Wilhelm Stork

机构 * Dept. of Highly Automated and Assisted Driving, Dr. Ing. h.c. F. Porsche AG(保时捷股份公司高度自动化与辅助驾驶部门) Institute for Information Processing Technologies, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息处理技术研究所) Faculty of Mobility and Technology, Esslingen University of Applied Sciences(埃斯林根应用科学大学移动性与技术学院)

AI总结 针对自动驾驶感知中传感器配置变化导致的领域差距,构建了包含14种系统化相机配置的基准,提出两种基于标定的配置描述符(配置方差和配置对比距离),实验证明几何配置差异与性能变化强相关。

Comments Accepted at ECCV 2026; Project Page: https://badertim.github.io/plentiful-carla-camera-rigs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27514 2026-06-29 cs.CV 新提交

Tessellating The Earth

镶嵌地球

Daniel Cher, Hamza Iqbal, Eric Xing, Brian Wei, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 提出可学习的球面Voronoi分区位置编码器TTE,通过全局语义令牌共享语义,在多项地理空间任务上达到最优。

Comments European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27444 2026-06-29 cs.CV 新提交

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

SemCityLoc: 使用语义3D城市模型的航空6自由度定位

Jingfeng Mao, Xuyang Chen, Qilin Zhang, Oussema Dhaouadi, Guangming Wang, Brian Sheil, Daniel Cremers, Yan Xia, Olaf Wysocki

机构 * Technical University of Munich(慕尼黑工业大学) University of Cambridge(剑桥大学) University of Science and Technology of China(中国科学技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出SemCityLoc,通过语义-几何对齐将航空位姿估计转化为结构化表面配准,利用基础模型视觉先验和标准化LoD城市模型,在重复遮挡环境中提升位姿判别性,并引入首个真实基准SemCityLockeD,实现定位误差从9.89m降至2.62m。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26716 2026-06-29 eess.IV cs.CV 新提交

Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution

双先验引导的零空间学习与样条混合用于任意医学切片超分辨率

Haofei Song, Siyuan Xu, Xintian Mao, Shaojie Guo, Qingli Li, Yan Wang

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理重点实验室) East China Normal University(华东师范大学)

AI总结 提出DP-NSL框架,通过测量一致性投影和样条混合模块,在零空间内学习几何连续先验,实现任意尺度医学切片超分辨率,保持测量一致性并优于现有方法。

Comments Accepted to ECCV 2026! Project page: https://github.com/DeepMed-Lab-ECNU/Medical-Image-Reconstruction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25343 2026-06-29 cs.CV 新提交

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

发票草垛:强视觉同质性下的文档检索与视觉问答基准测试

Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lakehead University(湖首大学)

AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。

Comments Accepted to presentation at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27373 2026-06-26 cs.CV 新提交

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

在自进化大型多模态模型中更加关注视觉标记

Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

AI总结 提出VISE框架,通过几何不变性和语义不变性奖励直接正则化视觉条件策略,解决自进化LMMs中视觉欠条件问题,在无监督设置下提升视觉语言理解。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27372 2026-06-26 cs.CV 新提交

DnA: Denoising Attention for Visual Tasks

DnA:用于视觉任务的去噪注意力

Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

机构 * University of Central Florida(中佛罗里达大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 提出去噪注意力(DnA),通过正负查询分离相关与无关特征,提升多头部注意力的判别性,在ImageNet-1K上提升0.8%,并适用于视频理解任务。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27371 2026-06-26 cs.CV 新提交

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

机构 * Indian Institute of Science(印度科学研究所) Stanford University(斯坦福大学)

AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。

Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27339 2026-06-26 cs.CV 新提交

SAM2Matting: Generalized Image and Video Matting

SAM2Matting:通用图像与视频抠图

Ruiqi Shen, Guangquan Jie, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 提出SAM2Matting框架,将VOS追踪器增强为高保真视频抠图,通过区域提议桥接和专用抠图头解耦任务,仅用图像训练即实现视频抠图新SOTA,支持多种提示类型并保持强时间一致性。

Comments ECCV 2026. Extended version. Project Page: https://henghuiding.com/SAM2Matting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27268 2026-06-26 cs.RO cs.AI 新提交

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS:一种新的机器人操作具身测试时缩放框架

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) FiveAges(五时代)

AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。

Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26973 2026-06-26 cs.CV cs.LG 新提交

Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning

几何梯度修正用于安全开放集半监督学习

Jiahe Chen, Qian Shao, Qiyuan Chen, Jiaying He, Jintai Chen, Jian Wu, Hongxia Xu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Liangzhu Laboratory and WeDoctor Cloud(良渚实验室和微医云) Shanghai Innovation Institute(上海创新研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Transvascular Implantation Devices and TIDRI(经血管植入器械全国重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

AI总结 提出几何梯度修正(GGR)框架,通过将辅助梯度投影到监督梯度的允许区域,解决开放集半监督学习中样本筛选与利用的权衡问题,提升闭集泛化与开放集鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26916 2026-06-26 cs.CV 新提交

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26812 2026-06-26 cs.CV 新提交

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

机构 * Foshan University(佛山大学) China University of Mining and Technology, Beijing(中国矿业大学(北京)) Kunming University of Science and Technology(昆明理工大学)

AI总结 提出一种掩码引导的多模态图像融合方法,通过伪真实标签和掩码生成机制同时实现特征恢复与跨模态交互,在合成和真实数据集上超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26769 2026-06-26 cs.AI cs.CV 新提交

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase: 即插即用的相位映射与抗噪宏轨迹外推用于扩散加速

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

AI总结 针对扩散模型推理延迟高的问题,提出ResilPhase框架,通过将加速推理重构为ODE空间中的稳定宏轨迹外推,并引入无导数重心拉格朗日外推器和有界相位映射,实现高加速比下的抗噪加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26754 2026-06-26 cs.CV 新提交

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

容量控制的多视图3D高斯泼溅风格化

Zhihao Wen, Yixin Yang, Bojian Wu, Yang Zhou, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省可视媒体与多维智能重点实验室,计算机科学与软件工程学院,深圳大学) Tencent Games(腾讯游戏) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

AI总结 提出基于最优传输的容量控制框架,通过半平衡最优传输和列容量约束解决多视图风格分配不稳定问题,实现跨视图一致的3D风格化。

Comments Accepted to ECCV 2026. Project page: https://vcc2310.github.io/SceneStyler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26734 2026-06-26 cs.CV cs.AI 新提交

Robust Onion: Peeling Open Vocab Object Detectors Under Noise

鲁棒洋葱:在噪声下剖析开放词汇目标检测器

Priyank Pathak, Mukilan Karuppasamy, Aaditya Baranwal, Shruti Vyas, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学人工智能研究所)

AI总结 通过受控合成视觉退化逐层分析开放词汇目标检测器,发现视觉骨干相似时鲁棒性主要由图像域决定,并提出轻量级方法提升真实场景鲁棒性。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26609 2026-06-26 cs.CV 新提交

LogicIR: Logic Gate Networks for Image Restoration

LogicIR: 用于图像恢复的逻辑门网络

Hongjae Lee, Myungjun Son, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出首个基于逻辑门网络的图像恢复模型LogicIR,采用UNet架构和可微位解码层及索引洗牌机制,在多个基准上以低计算成本实现强性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26424 2026-06-26 cs.LG cs.CV cs.RO 新提交

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

重新思考预测中的训练与推理:将赢家通吃带回高斯混合模型

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 针对轨迹预测中赢家通吃训练导致模式后验不可靠的问题,提出测试时后验加权合并和一步EM更新两种轻量级后处理方法,无需重训练即可提升模式排序和预测精度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26379 2026-06-26 cs.CV 新提交

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏