arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-09-01 至 2026-09-01 共收录 25
2608.31023 2026-09-01 cs.CV 新提交

SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting

SMG:用于单目动态高斯溅射的语义运动图

Haozheng Yu, Xinyu Yang, Rundong Luo, Jennifer J. Sun, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

AI总结 该研究针对单目动态高斯溅射过拟合、复杂场景下表现差的问题,提出SMG模型,引入新数据集,实现了该任务的最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30714 2026-09-01 cs.CV 新提交

SegWave: Wavelet-Driven Segmentation of Tampered Regions

SegWave:基于小波的篡改区域分割

Siddhi Pravin Lipare, Vishesh Kumar, Akshay Agarwal

机构 * IIIT-Hyderabad(印度国际信息技术研究所海得拉巴分校) IISER-Bhopal(印度科学教育与研究研究所博帕尔分校)

AI总结 针对图像真实性验证难题,提出SegWave混合框架,结合Transformer与DWT并引入ASA模块,经多基准数据集实验,其性能优于现有最先进的篡改检测方法。

Comments Accepted at the PFATCV Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30690 2026-09-01 cs.CV cs.RO 新提交

Failure or Drift? Evaluating Monocular SLAM under Synthetic and Real-World Corruptions

失效还是漂移?在合成与真实世界干扰下评估单目SLAM

Abhay Skaria Thomas, Shashank Agnihotri, Margret Keuper

机构 * University of Mannheim(曼海姆大学) Max-Planck-Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本研究评估单目SLAM在合成与真实世界干扰下的表现,区分跟踪失效与漂移,发现学习型跟踪器会产生持续漂移,且其排序随干扰物理保真度变化。

Comments Accepted at the 3rd NeuSLAM workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30656 2026-09-01 cs.CV 新提交

APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images

APT:用于完全再生图像篡改定位的锚点对齐扰动

Suhyeon Ha, Woo Jae Kim, Joonsung Jeon, Sooel Son, Sung-eui Yoon

机构 * KAIST(韩国科学技术院)

AI总结 针对现有篡改定位方法在完全再生图像中失效的问题,提出半脆弱潜在空间扰动APT,通过锚点对齐特征实现篡改定位,在COCO数据集上FR IoU达0.92,性能优于基线,可泛化到未知篡改类型。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30510 2026-09-01 cs.CV cs.AI cs.CL cs.DL 新提交

Lot Machine: Multimodal Lot Extraction from Auction Catalogs

拍品提取模型:从拍卖目录中进行多模态拍品提取

Mathias Zinnen, Alisha Mund, Sabine Lang, Lukas Hüttner, Thomas Gorges, Vincent Christlein

机构 * FAU Erlangen(埃尔朗根-纽伦堡大学) Pattern Recognition Lab(模式识别实验室)

AI总结 该研究提出基于视觉语言模型(VLM)的流水线,从历史拍卖目录中自动提取结构化拍品级元数据,对比不同部署模式的模型性能,为文化遗产机构提供可行的自动化分析方案。

Comments Accepted at the VISART Workshop (Computer Vision for Art Analysis), ECCV 2026. 19 pages, 6 figures, 5 tables. Supplementary material included as an appendix. Code, benchmark data, and prompt templates: https://github.com/mathiaszinnen/auction-lot-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30342 2026-09-01 cs.CV 新提交

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

CapFrame:基于几何伪标签的3D高斯场景中文本引导视角定位

Jirong Li, Satoshi Ikehata, Shuhei Kurita, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学大学) Denso IT Laboratory, Inc.(电装IT实验室) National Institute of Informatics(信息学研究所)

AI总结 本文针对3D高斯场景中虚拟相机位姿需人工设置的问题,提出CapFrame框架,通过检索-转换-优化流程实现文本引导的视角定位,实验表明其对齐度优于基线方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30194 2026-09-01 cs.CV 新提交

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

NoisEasier:用于文本到视频生成的测试时噪声优化

Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30129 2026-09-01 cs.CV 新提交

Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

基于线性注意力的像素空间扩散实现高效高质量深度估计

Bingde Liu, Wu Ran, Jinglei Zhang, Huanhuan Yuan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(上海交通大学人工智能研究院(教育部人工智能重点实验室))

AI总结 本研究提出基于线性注意力的像素空间生成框架Lapis,通过由粗到细的层级结构解决生成式深度估计的高计算成本问题,在多分辨率基准上实现SOTA精度,推理延迟大幅降低。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30087 2026-09-01 cs.CV 新提交

The Nearest Target Is the Wrong One: Target Separation in Arc2Face Identity Unlearning

最近的目标是错误的:Arc2Face身份遗忘中的目标分离

Zeynel Tok

机构 * University of Oxford(牛津大学)

AI总结 该研究针对Arc2Face身份遗忘中重定向目标导致的失败问题,通过审计Arc2Face发现目标分离是关键设计变量,采用特定策略可提升干净遗忘率并降低遗忘身份的重新识别率。

Comments 16 pages, accepted at the ECCV 2026 Workshop on Unlearning and Model Editing (U&ME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30054 2026-09-01 cs.LG cs.CV 新提交

When 3D Gaussian Splatting Recovers Real Surfaces

当3D高斯溅射(3DGS)恢复真实表面时

Songhe Wang, David Johnathan Miller

机构 * School of EECS, Penn State(宾夕法尼亚州立大学电子工程与计算机科学学院)

AI总结 该研究构建基于首击渲染抽象的数学框架,明确3D高斯溅射(3DGS)的可识别性窗口,经合成与真实数据集实验验证,揭示角容量对3DGS恢复真实表面的关键影响。

Comments Accepted at ECCV 2026. 30 pages, 3 figures, 1 table; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30003 2026-09-01 cs.CV 新提交

OPAL: Orthonormal Prototype Alignment Learning for Interpretable Image Classification

OPAL:用于可解释图像分类的正交原型对齐学习

Ilán Carretero, Gustavo Jesús Angulo, Rocío del Amor, Valery Naranjo

机构 * Universitat Politècnica de València(瓦伦西亚理工大学) Mines Paris, PSL University(巴黎矿业学院,巴黎文理研究大学) Artikode Intelligence S.L.

AI总结 提出单阶段端到端框架OPAL,通过正交基锚定潜在空间、空间竞争机制实现可解释图像分类,性能优于同类模型,可提供细粒度视觉解释。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29928 2026-09-01 cs.CV 新提交

Biomechanical 3D Body: Self-Supervised Distillation of Biomechanical Pose from a 3D Body Foundation Model

生物力学三维人体:从三维人体基础模型自监督蒸馏生物力学姿态

R. James Cotton, J. D. Peiffer, Lucinda Williamson, John Leske, Georgios Pavlakos

机构 * Shirley Ryan AbilityLab(雪莉·瑞安能力实验室) Northwestern University(西北大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究扩展SAM-3D-Body模型新增生物力学预测头,用JAX结合Equinox实现,在公开数据集训练后,在多数据集验证中优于现有生物力学回归模型,仅略逊于需高成本轨迹优化的同类方法。

Comments Accepted to the ECCV 2026 Workshop MoCha

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29917 2026-09-01 cs.CV 新提交

FoundYou: A Unified Model for Personalized Segmentation and Retrieval

FoundYou:个性化分割与检索的统一模型

Gabriele Trivigno, Marcos Alfaro, Claudia Cuttano, Gabriele Berton, Luis Payá, Carlo Masone

机构 * Politecnico di Torino(都灵理工大学) Miguel Hernández University of Elche(埃尔切米格尔·埃尔南德斯大学) Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学院与研究网络)

AI总结 本研究提出FoundYou统一框架,基于SAM 2的实例级线索实现个性化分割与检索,在相关基准上取得显著性能提升,模型规模小、速度快,且在类别级检索任务中也达最优。

Comments ECCV 2026. Project page: https://ga1i13o.github.io/FoundYou

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29590 2026-09-01 cs.CV 新提交

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

强安全护栏下大型视觉语言模型的护栏无关社会偏见评估

Yusuke Hirota, Michael Ross Boone, Arun George Zachariah, Jibin Rajan Varghese, Yu-Chiang Frank Wang, Boyi Li, Ryo Hachiuma

机构 * NVIDIA(英伟达)

AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29577 2026-09-01 cs.CV 新提交

TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection

TRINITY:面向个人风格视频精彩片段检测的多视角基准测试集

Qianqian Chen, Hyun Bin Kim, Denzel Elden Wijaya, Yang Yi, Bo Liu, Yangkai Ding

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对个人风格视频精彩片段检测的传统方法泛化性差的问题,提出TRINITY多视角基准测试集与对应多分支架构,在两个数据集上显著优于现有方法,验证了多视角建模的有效性。

Comments 32 pages, 9 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29396 2026-09-01 cs.RO 新提交

Toward Trustworthy Robot-Assisted Sliding Palpation for Shallow Vessel Localisation with a Calibrated Digital Twin

面向基于校准数字孪生的浅血管定位的可信机器人辅助滑动触诊

Piotr Blaszyk, Wen Fan, Kaizhong Deng, Daniel Elson, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

AI总结 本文提出带校准数字孪生的机器人辅助滑动触诊框架,结合时空图神经网络实现浅血管定位,在三类数据集上验证了模拟到真实的定位精度,为可信触觉触诊提供了进展。

Comments ECCV workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29313 2026-09-01 cs.CV cs.AI 新提交

Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training

Hyper3-CLIP:层级条件双曲视觉-语言训练

Matin Mahmood, Antonio Rueda-Toicen, Mohamed ElBassat, Seifeldin Elkerdany, Weixing Wang, Gerard de Melo

机构 * hyper 3 labs(超3实验室) Hasso Plattner Institute(哈索·普拉特纳研究所) University of Potsdam(波茨坦大学) Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)

AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。

Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29177 2026-09-01 cs.CV 新提交

Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding

面向开放词汇三维场景理解的动态鲁棒光度-语义重建

Boyu Cai, Li Yang, Yan Xu, Wei Liu, Nian Liu, Sikui Zhang, Yan Wang, Chunfeng Yuan, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) The Chinese University of Hong Kong(香港中文大学) Deepeleph Intelligent Technology(深智科技)

AI总结 提出SPAR架构与动态区域感知训练范式,解决NVS与OVS模型在动态场景的特征错位问题,在D-RE10K基准上实现SOTA性能,3/4视图下PSNR达22.15/23.33 dB,运动掩码预测mIoU达88.5%。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29145 2026-09-01 cs.CV cs.AI 新提交

STARLINC: Satellite Trail Artifact Removal using Inter-Frame Correlation

STARLINC:基于帧间相关性的卫星尾迹伪影去除

Shingeon Kim, Hyeyoon Lee, Dain Kwon, Kanghyun Choi, Sunjong Park, Mi-Ryang Kim, Jeong-Eun Lee, Jinho Lee

机构 * Seoul National University(首尔大学)

AI总结 针对低轨卫星污染天文图像的问题,本文提出无需像素级标注的STARLINC框架,结合合成尾迹生成、帧间差分图和热图实现尾迹去除,性能优于基线,可扩展用于下一代天文观测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28913 2026-09-01 cs.CV cs.GR cs.LG eess.SP 新提交

mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis

mmIR:用于3D毫米波雷达ADC合成的频率空间逆渲染方法

Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

机构 * Cornell Tech(康奈尔科技学院)

AI总结 提出开源可微分的FMCW雷达逆渲染器mmIR,采用LiDAR辅助逆渲染,在ColoRadar数据集上实现高分辨率3D雷达数据合成,相关性能优于Sionna-RT且可跨雷达硬件迁移。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://mmwave-inverse-rendering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28895 2026-09-01 cs.CV 新提交

ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views

ReconSplat:超越观测视图的通用3D场景重建

Giuseppe Stracquadanio, Kevin Raj, Julia Grabinski, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) Zuse School ELIZA(楚斯学校ELIZA)

AI总结 ReconSplat是基于3DGS与MV-LDM的前馈3D场景重建模型,解决未观测区域视图生成与几何一致性的权衡问题,在RealEstate10K、DL3DV-10K基准上优于现有方法,可外推未观测视点并保持精确几何。

Comments ECCV 2026. Code and additional visual results are available on our project page: https://visinf.github.io/reconsplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28693 2026-09-01 cs.RO cs.CV 新提交

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture:面向人形机器人交互的实时语义对齐式伴随语音手势生成

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海智知研究院)

AI总结 本研究提出 RoboGesture 框架,构建专属数据集并设计相关算法,使人形机器人可实时生成语义对齐的伴随语音手势,在 Unitree G1 机器人上的实验表明其性能优于现有最优方法。

Comments Accepted at ECCV 2026. Project page: https://RoboGesture.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏