arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-22 至 2026-07-22 共收录 12
2607.19171 2026-07-22 cs.CV 新提交

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

点阶梯调优:用于3D点云理解的参数高效分层适配

Junlin Chang, Longhao Zou, Rui Li

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室)

AI总结 研究针对3D点云理解中微调预训练主干参数效率低的问题,提出点阶梯调优框架PLT,通过构建分层网络、融合局部与全局特征、生成动态提示等进行参数高效分层适配,实验表明其以极少参数达最优性能。

Comments Accepted to ECCV 2026. Code: https://github.com/JunLinChang/ECCV2026-PLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19100 2026-07-22 cs.CV 新提交

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

FlexiAvatar:任意身体可见性下的统一3D高斯人体头像

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek

机构 * UNIST(韩国蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere(雾球公司)

AI总结 研究从单目视频重建3D人体头像问题,提出FlexiAvatar框架,结合遮挡鲁棒跟踪与特定部分残差细化捕捉细节,用扩散方法处理不可见区域,实验表明其重建质量高,还能减少运行时和内存开销。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19036 2026-07-22 cs.CV cs.AI 新提交

CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement

CoGoal3D:基于3D感知融合与优化的协作式3D目标检测

Zhihao Yang, Zhiyu Xiang, Peng Xu, Tianyu Pu, Kai Wang, Eryun Liu, Dongping Zhang, Yong Ding

机构 * Zhejiang University(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) China Jiliang University(中国计量大学)

AI总结 针对V2X协作目标检测中3D检测效果不佳的问题,提出CoGoal3D框架,通过两阶段管道提取和优化3D特征,设计融合模块与辅助任务,还提出数据增强策略,在多数据集上取得新的最优性能。

Comments Accepted to ECCV 2026. 17 pages, 8 figures, 6 tables. Code: https://github.com/Megalo-f/CoGoal3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19032 2026-07-22 cs.CV 新提交

IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion

IMMoE:通过视图专家融合进行不完整多视图异常检测

Lei Hu

机构 * South China University of Technology(华南理工大学)

AI总结 研究不完整多视图异常检测问题,提出IMMoE方法,含多视图专家融合与局部异常增强编码器两个关键模块,通过自动生成数据集,在RIMAD和Real-IAD数据集上取得领先性能,提升了像素级和图像级指标。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18863 2026-07-22 cs.CV 新提交

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

用于通用行人重识别的可靠性感知3D几何注入

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(武汉大学计算机学院多媒体软件国家工程研究中心)

AI总结 针对通用行人重识别问题,提出UniGeo框架,通过一致性感知可靠性门和双流残差融合,将3D信息处理解耦,投影单目3D参数补偿结构,以残差形式引入3D先验并过滤噪声,提升了挑战性场景性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18763 2026-07-22 cs.CV 新提交

Posterior Samplings are Missing Modalities Generators for Medical Image Translation

后验采样是医学图像翻译中缺失模态的生成器

Jonghun Kim

机构 * Sungkyunkwan University(成均馆大学)

AI总结 针对医学图像因时间和协议限制存在缺失模态的问题,提出统一框架,将缺失模态生成视为联合分布下的线性逆问题,通过后验采样及流匹配模型解决,在多数据集实验中性能优于基线,下游肿瘤分割表现更好。

Comments ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26615 2026-07-22 cs.CV eess.IV 版本更新

TaskTok: Delving into Task Tokens for Task-driven Image Restoration

TaskTok: 深入探究任务驱动图像恢复中的任务令牌

Hongjae Lee, Sojung Kang, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11704 2026-07-22 cs.CV 版本更新

ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation

ScaleMoGen:基于人类动作生成的自回归多尺度预测

Inwoo Hwang, Hojun Jang, Bing Zhou, Jian Wang, Young Min Kim, Chuan Guo

机构 * Seoul National University(首尔国立大学) Snap Inc.(Snap公司) Meta Reality Labs(Meta现实实验室)

AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。

Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15280 2026-07-22 cs.CV cs.AI 版本更新

Why Do Vision Language Models Struggle To Recognize Human Emotions?

为什么视觉语言模型难以识别人类情绪?

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

机构 * The University of Edinburgh, UK(爱丁堡大学)

AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏