arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-08 至 2026-07-08 共收录 10
2606.30611 2026-07-08 cs.CV 版本更新

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

视频Transformer中重加权帧级注意力用于面部表情理解

Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

机构 * Inria, Université Côte d’Azur, France(法国国家信息与自动化研究所、法国滨海阿尔卑斯大学) Hanyang University, South Korea(韩国家阳大学) Pusan National University, South Korea(韩国釜山国立大学)

AI总结 提出MiRA框架,通过重加权帧级注意力增强ViT对细微面部动态的时空选择性,无需额外参数,在表情识别基准上持续提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27932 2026-07-08 cs.CV 版本更新

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

动态聚类数据采样用于高效且长尾感知的视觉-语言预训练

Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所)

AI总结 本文提出动态聚类采样方法DynamiCS,通过动态调整数据分布平衡语义长尾概念,降低训练成本并提升长尾概念表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23916 2026-07-08 cs.CV cs.AI 版本更新

DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning

DecepGPT: 基于多文化数据集和鲁棒多模态学习的模式驱动欺骗检测

Jiajian Huang, Dongliang Zhu, Zitong YU, Hui Ma, Jiayu Zhang, Chunmei Zhu, Xiaochun Cao

机构 * Great Bay University(Great Bay大学) Wuhan University(武汉大学) Sun Yat-sen University(孙中山大学)

AI总结 本文提出DecepGPT,通过构建包含结构化线索描述和推理链的推理数据集,释放多文化数据集T4-Deception,并提出SICS和DMC模块,实现多模态欺骗检测的鲁棒学习,实验表明其在领域内和跨领域场景中均取得最佳性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02716 2026-07-08 cs.CV 版本更新

MorphGS: Morphology-Adaptive Articulated 3D Motion Transfer from Videos

MorphGS:基于形态的 articulated 3D 动作迁移从视频

Taeyeon Kim, Youngju Na, Jumin Lee, Sebin Lee, Minhyuk Sung, Sung-Eui Yoon

AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13431 2026-07-08 cs.CV 版本更新

FUSE: A Flow-based Mapping Between Shapes

FUSE:一种基于流的形状间映射

Lorenzo Olearo, Giulio Viganò, Daniele Baieri, Filippo Maggioli, Simone Melzi

机构 * University of Milano-Bicocca(米兰-布西卡大学) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Pegaso University(佩加索大学)

AI总结 研究3D形状间映射,基于流匹配模型提出新型神经表示,计算高效,支持跨表示形状匹配,无需大规模训练等。通过特定流映射和嵌入编码形状,在多种形状匹配任务及其他任务如UV映射、人体点云扫描配准中表现出色。

Comments 11 pages, 9 figures. Accepted for publication at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19120 2026-07-08 cs.CV 版本更新

Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition

Freqformer:通过有效频率分解实现图像去网纹的Transformer

Xiaoyang Liu, Bolin Qiu, Zheng Chen, Libo Zhu, Zihan Zhou, Kai Liu, Jiezhang Cao, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对图像去网纹难题,提出Freqformer框架,通过有效频率分解,将莫尔条纹分离为高频纹理和低频颜色失真,用双分支架构及不对称训练处理,还引入FCT和SA-CA模块,实现高保真重建,以紧凑模型达最优性能。

Comments Accepted to ECCV 2026. Code is available at https://github.com/xyLiu339/Freqformer

详情

展开后加载摘要…

URL PDF HTML 收藏