arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 552
2607.29463 2026-08-03 cs.CV 新提交

Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification

用于隐式神经表示分类的权重空间专家混合模型

Stanislaw Janik, Michal Byra

机构 * Institute of Fundamental Technological Research, Polish Academy of Sciences(波兰科学院基础技术研究所) Samsung AI Center(三星人工智能中心)

AI总结 提出分层专家混合Transformer结合元学习框架,在权重空间实现隐式神经表示分类,在多分辨率基准达最优准确率,还揭示了INRs编码判别信息的结构特性。

Comments ECCV 2026, 22 pages

URL PDF HTML 收藏
2607.29059 2026-08-03 cs.CV 新提交

Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation

从逆境中学习:通过对抗性扰动实现语义感知的掩码细化

Beomyoung Kim, Sung Ju Hwang

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出Phoenix框架,用对抗学习生成语义噪声、对比学习建模细化关系,在图像分割掩码细化任务中性能优于现有方法,可提升先进分割模型。

Comments ECCV 2026

URL PDF HTML 收藏
2607.29040 2026-08-03 cs.CV 新提交

Rethinking Detection Calibration: A Coordinate and Direction Perspective

重新思考检测校准:坐标与视角方向

Juyong Lee, Seungjin Jung, Jungmin Lee, Sunju Lee, Jongwon Choi

机构 * Chung-Ang University(中央大学)

AI总结 针对现有检测校准仅关注框级定位的不足,提出ReDC框架,定义坐标级对齐与偏差方向,生成可靠坐标级置信度,实验表明其定位精度优于现有方法且覆盖原有校准方法范围。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.27843 2026-07-31 cs.CV 新提交

VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection

VCP-DCN:超越视觉隐蔽属性的深度协作网络用于伪装目标检测

Songsong Duan, Xi Yang, Nannan Wang

机构 * Xidian University(西安电子科技大学)

AI总结 针对现有伪装目标检测方法忽略深度域隐蔽目标模态特性的问题,提出VCP-DCN网络,通过SPE、MDA、DAI模块逐步实现多模态对齐、交互与融合,在三个权威数据集上验证了有效性。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.27755 2026-07-31 cs.CV 新提交

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

EgoGVAE:基于引导变分自编码器的自我身体网格重建

Jaehun Jung, Wonjun Kim

机构 * Konkuk University(建国大学)

AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。

Comments 18 pages, 6 figures, Accepted to ECCV 2026

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

URL PDF HTML 收藏
2607.27729 2026-07-31 cs.CV 新提交

PrintAnything: Learning an Intermediate Representation for 3D printing G-code Generation

PrintAnything:学习用于3D打印G-code生成的中间表示

Sangmin Hong, Daniel Sungho Jung, Heewon Kim, Kyoung Mu Lee

机构 * IPAI, Seoul National University(首尔大学 IPAI) Seoul National University(首尔大学) Soongsil University(崇实大学) Kairoba Inc.(Kairoba公司)

AI总结 PrintAnything框架无需网格重建,通过切片式点投影策略和G-plan图,直接从点云生成可执行3D打印G-code,实现无网格的实用3D打印流程。

Comments European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2607.27154 2026-07-30 cs.CV cs.AI 新提交

Anatomy Contextualized Adaption of CT Foundation Models

CT基础模型的解剖学上下文适配

Roshan Kenia, Stephanie L McNamara, William Lotter

机构 * Harvard Medical School(哈佛医学院) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Massachusetts General Hospital(麻省总医院) Brigham and Women’s Hospital(布里格姆妇女医院)

AI总结 本研究提出轻量框架ACA,适配冻结CT基础模型实现解剖学级视觉-语言对齐,在Merlin、CT-RATE数据集上零样本发现分类性能优于基线,训练耗时短且可保留增强全局解剖学上下文。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 MedFM-Bench Workshop

URL PDF HTML 收藏
2607.26889 2026-07-30 cs.GR cs.CV cs.RO 新提交

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction

StructureGS:面向关节物体重建的结构感知高斯溅射

Gahye Lee, Gyoonseo Kim, Wonjong Jang, Jooeun Son, Seungyong Lee

AI总结 该研究针对关节物体重建中参数纠缠导致的部件分解缺陷,提出StructureGS框架,结合结构感知引导的3D高斯溅射,通过定向包围盒约束实现更优重建性能。

Comments accepted at ECCV 2026

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.25984 2026-07-29 cs.CV cs.LG 新提交

Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics

薛定谔的猫:潜在场景运动学的概率表示与预测

Timy Phan, Jannik Wiese, Björn Ommer

AI总结 研究如何从部分观测预测场景演变,提出GARFIELD概率模型,能学习潜在表示实现轨迹联合采样和运动分布访问,实验显示其在运动规划性能、采样速度及密度估计上优势显著。

Comments Accepted at ECCV 2026. Project page: https://compvis.github.io/schroedingers_cat

URL PDF HTML 收藏
2607.25565 2026-07-29 cs.CV 新提交

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

ReDesign:通过智能分解从图像中恢复可编辑设计结构

Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Helmholtz Munich(慕尼黑亥姆霍兹中心) Korea University(韩国大学)

AI总结 研究旨在从图像恢复可编辑设计文件,提出ReDesign智能框架,通过跨模态选工具生成层层次结构,引入优雅验证与评估基准,在视觉保真度和编辑性上表现出色,超越基线和管道。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2607.25362 2026-07-29 cs.CV 新提交

PanoLess: Environment Reconstruction from Partial Reflective Views

PanoLess:从部分反射视图进行环境重建

Ahitagni Das, Ashok Veeraraghavan, Vivek Boominathan

机构 * Rice University(莱斯大学)

AI总结 研究从部分反射视图进行环境重建,提出基于高斯点的PanoLess框架,利用表面对齐二维高斯点和延迟阴影恢复法线与反射线索,生成可见性图,能从部分视图输入实现光照估计,在多数据集上表现出色,实现高保真和几何一致的环境重建。

Comments ECCV 2026. Main paper with supplementary material

URL PDF HTML 收藏
2607.25125 2026-07-29 cs.CV 新提交

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

LENS:用于长视频关键帧采样的自适应时空缩放

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。

Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/

URL PDF HTML 收藏
2607.24794 2026-07-29 cs.AI cs.CV 新提交

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2607.22931 2026-07-28 cs.LG cs.CV 新提交

Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions

用于长尾分布的频谱感知分析类增量学习

Quyen Tran, Hai Nguyen, Quan Dao, Zhuowei Li, Nam Le, Trung Le, Dimitris Metaxas

AI总结 研究针对长尾分布的类增量学习问题,提出几何频谱校正(GSR)框架,将其视为频谱正则化问题,构造频谱扰动矩阵有选择地增大尾部类坍缩特征值,实验表明该方法在计算效率和鲁棒泛化间取得更好权衡,达新最优水平。

Comments ECCV 2026

URL PDF HTML 收藏
2607.22924 2026-07-28 cs.CV 新提交

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2607.22919 2026-07-28 cs.CV cs.AI 新提交

Controlling Embedding Spaces with Text-Conditioned Transformations

通过文本条件变换控制嵌入空间

Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani, Mubarak Shah, Kushal Kafle

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Adobe Research(Adobe研究院)

AI总结 研究提出文本条件变换视觉嵌入,通过自然语言描述属性类别,网络生成仿射变换强调指定属性,能同时学习多属性,可在推理时访问,为控制嵌入空间提供统一高效框架,在多任务中展现近零推理成本的最优性能。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2607.22674 2026-07-28 cs.GR cs.CV cs.HC 新提交

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

URL PDF HTML 收藏
2607.22446 2026-07-27 cs.CV cs.GR 新提交

Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering

可变形三角形散列:用于实时辐射场渲染的灵活基元

Oriol Jiménez-Ayguadé, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(工业机器人与信息学研究所,西班牙国家研究委员会-加泰罗尼亚理工大学)

AI总结 研究针对辐射场方法依赖凸边界问题,提出可变形三角形散列,通过控制点和位移实现非凸形状表示,设计光栅化管道可微渲染,经多种场景验证,在视觉质量、通用性和渲染效率上表现出色。

Comments Accepted at ECCV 2026. Project page: https://orioljim1.github.io/detris

URL PDF HTML 收藏
2607.22355 2026-07-27 cs.CV cs.AI 新提交

SiPhy: Single-Image Physical Property Reasoning

SiPhy:单图像物理属性推理

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。

Comments Accepted to ECCV 2026 (main track)

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.22087 2026-07-27 cs.CV 新提交

FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection

FAIR:用于人工智能生成的假图像检测的特征增强隐式正则化

Md Redwanul Haque, Manzur Murshed, Manoranjan Paul, Tsz-Kwan Lee

机构 * Deakin University(迪肯大学) Charles Sturt University(查尔斯·斯特尔特大学)

AI总结 针对人工智能生成图像检测中泛化难的问题,提出FAIR方法,通过引入场景构图结构(SCS)特征增强隐式正则化,训练时约束模型优化轨迹,推理时丢弃结构先验,提升跨生成器泛化能力,在多基准测试中提高准确率。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

URL PDF HTML 收藏
2607.21592 2026-07-24 cs.CV 新提交

Unified Video Dense Prediction from Disjoint Data

从不相交数据进行统一视频密集预测

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

机构 * Adobe Research(Adobe 研究院) Cornell University(康奈尔大学)

AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。

Comments ECCV 2026

URL PDF HTML 收藏