arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 4771
2608.03198 2026-08-05 cs.CV cs.RO 新提交

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

URL PDF HTML 收藏
2607.22673 2026-08-05 cs.GR cs.CV 版本更新

URHead: A Unified UV-Space Representation for Joint Mesh-3DGS Optimization in Head Avatars

URHead:用于头部虚拟形象中联合网格-3DGS优化的统一UV空间表示

Seonghak Lee, Junhee Cho, Jisoo Park, Min-Gyu Park, Jongmin Lee, Ju Hong Yoon, Junseok Kwon

AI总结 研究针对头部虚拟形象,提出URHead统一表示法,通过UV空间统一及联合优化,让网格与高斯方法互补,保持参数可控性与特定主体细节,在重建质量和动画一致性上超越现有方法。

Comments Project page/code: https://lseonghak.github.io/website/project/urhead/, Accepted to ECCV 2026

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

URL PDF HTML 收藏
2508.01312 2026-08-05 cs.CV 版本更新

P3P Made Easy

P3P简化

Seong Hun Lee, Patrick Vandewalle, Javier Civera

机构 * EAVISE, KU Leuven(鲁汶大学EAVISE实验室) I3A, University of Zaragoza(萨拉戈萨大学I3A研究所)

AI总结 本文重新审视经典的透视三点问题,提出一个简洁的代数求解器,在精度和运行时间上与最新方法相当,平衡了简洁性、效率和准确性。

Comments Accepted to ECCV Workshop 2026 (SFM-DL)

URL PDF HTML 收藏
2604.01973 2026-08-05 cs.CV 版本更新

NearID: Identity Representation Learning via Near-identity Distractors

NearID: 通过近身份干扰实现身份表示学习

Aleksandar Cvejic, Rameen Abdal, Abdelrahman Eldesokey, Bernard Ghanem, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Snap Research(Snap研究院)

AI总结 本文提出NearID框架,通过近身份干扰消除背景影响,提升身份识别精度,改进模型在个性化生成和图像编辑任务中的表现。

Comments Accepted to ECCV 2026, Code, model, and dataset are released, visit https://github.com/Gorluxor/NearID

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.01793 2026-08-04 cs.LG 新提交

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD:用于基于能量的异常检测的整流流预处理

Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 该研究针对统一异常检测中高维token空间EBM训练不稳定问题,提出ReFP-AD方法,经实验在MVTec-AD和VisA数据集上取得优于基线的异常检测性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.01761 2026-08-04 cs.CV 新提交

DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing

DecoupleGS:用于端到端自动驾驶测试的交互式三维高斯溅射

Siying Li, Ying Ni, Jie Sun, Jian Sun, Haotian Shi

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室)

AI总结 DecoupleGS是一种解耦三维高斯溅射框架,通过分解场景为静态背景与动态智能体,结合三个针对性模块实现高保真交互,为端到端自动驾驶测试提供实用闭环传感器仿真平台。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2608.01706 2026-08-04 cs.CV 新提交

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

UniSim-SLAM:采用统一Sim(3)优化的前馈SLAM

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

机构 * National Institute of Science and Technology(国立科学技术研究所)

AI总结 UniSim-SLAM是采用统一Sim(3)优化的前馈SLAM系统,通过前端两视图跟踪与后端多视图子图优化,在TUM RGB-D和7-Scenes数据集上实现了当前最佳未校准设置下的轨迹精度,误差显著降低。

Comments Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/

URL PDF HTML 收藏
2608.01643 2026-08-04 cs.CV cs.AI cs.GR 新提交

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

StreamTalk:基于关键姿态锚定的流式伴随语音手势生成

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

机构 * The University of Tokyo(东京大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学)

AI总结 StreamTalk是带周期性生成-检索-精调循环的闭环流式伴随语音手势生成框架,通过关键姿态锚定减少长程漂移,在BEAT2数据集上达到最优FGD指标,实时运行帧率达76 FPS。

Comments ECCV 2026

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

URL PDF HTML 收藏
2608.01129 2026-08-04 cs.RO cs.CV 新提交

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

FeDepth:面向机器人异构性的深度估计联邦学习

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院)

AI总结 针对机器人感知深度估计中联邦学习因客户端异构性导致性能下降的问题,本文提出FeDepth框架,通过软聚类建模客户端关系,在多架构上提升了联邦学习的鲁棒性。

Comments Accepted at ECCV 2026. Ganghyeon Lee and Inha Lee contributed equally. Kyungdon Joo is the corresponding author

URL PDF HTML 收藏
2608.00903 2026-08-04 cs.CV 新提交

PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos

PeCA:调色板上下文辅助推理,用于动画视频的测试时油漆桶上色

Dongheng Lin, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

AI总结 针对动画视频油漆桶上色的区域对应易受模糊片段影响的问题,提出无训练即插即用的PeCA框架,通过空间与时间上下文推理优化,实验证实其性能持续提升。

Comments ECCV 2026, Project Page: https://rathgrith.github.io/PeCA/

URL PDF HTML 收藏
2608.00800 2026-08-04 cs.CV 新提交

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

AIMold:一种用于复杂模具设计的自主AI驱动流水线

Pengyun Qiu, Shuo Wang, Zeyuan Chen, Yihao Zhi, Chongjie Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) FNii-Shenzhen(深圳未来网络研究院)

AI总结 研究针对复杂模具设计依赖专家知识、缺乏公开数据集的问题,推出含超2.3万个模型的MoldCAD数据集,提出AI流水线实现模具设计自动化,助力制造感知型CAD生成。

Comments Accepted to ECCV 2026. Code is available at https://github.com/tb2-sy/AIMold

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

URL PDF HTML 收藏
2607.02252 2026-08-04 cs.CV 版本更新

ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection

ArcAD: 冷启动监督异常检测的异常校正校准框架

Ningning Han, Lei Fan, Jia Guo, Yunkang Cao, Xiu Su, Feng Cao, Donglin Di, Tonghua Su

机构 * Faculty of Computing, Harbin Institute of Technology, Harbin, China University of New South Wales, Sydney, Australia School of Biomedical Engineering, Tsinghua University, Beijing, China School of Artificial Intelligence Robotics, Hunan University, Changsha, China Big data institute, Central South University, Sydney, Australia DZ-Matrix, Beijing, China Chongqing Research Institute of HIT, Chongqing, China

AI总结 针对工业异常检测中冷启动场景下正常样本不足、异常样本稀少的问题,提出基于推拉学习范式的即插即用校准框架ArcAD,通过将正常样本投影到超球面并聚类、合成伪异常并利用真实异常优化边界,在多个数据集上显著优于现有方法。

Comments Accepted to European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

URL PDF HTML 收藏
2512.09112 2026-08-04 cs.CV 版本更新

GimbalDiffusion: Gravity-Aware Camera Control for Video Generation

GimbalDiffusion:基于重力的摄像机控制用于视频生成

Frédéric Fortier-Chouinard, Yannick Hold-Geoffroy, Valentin Deschaintre, Matheus Gadelha, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Adobe

AI总结 本文提出GimbalDiffusion框架,通过物理坐标系实现摄像机运动的精确控制,引入null-pitch conditioning策略以避免冲突提示内容干扰,并建立新基准评估重力感知摄像机控制视频生成能力。

Comments Accepted at ECCV 2026. Project page: https://lvsn.github.io/GimbalDiffusion/

URL PDF HTML 收藏
2603.25129 2026-08-04 cs.CV 版本更新

AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting

AirSplat:基于鲁棒前馈3D高斯散射的对齐与评分

Minh-Quan Viet Bui, Jaeho Moon, Munchurl Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出AirSplat框架,通过自一致性姿态对齐和基于评分的透明度匹配技术,提升无姿态视角合成的重建质量。

Comments Project page: https://kaist-viclab.github.io/airsplat-site, accepted to ECCV 2026

URL PDF HTML 收藏
2509.21541 2026-08-04 cs.GR cs.CV 版本更新

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

URL PDF HTML 收藏
2607.29463 2026-08-03 cs.CV 新提交

Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification

用于隐式神经表示分类的权重空间专家混合模型

Stanislaw Janik, Michal Byra

机构 * Institute of Fundamental Technological Research, Polish Academy of Sciences(波兰科学院基础技术研究所) Samsung AI Center(三星人工智能中心)

AI总结 提出分层专家混合Transformer结合元学习框架,在权重空间实现隐式神经表示分类,在多分辨率基准达最优准确率,还揭示了INRs编码判别信息的结构特性。

Comments ECCV 2026, 22 pages

URL PDF HTML 收藏
2607.29059 2026-08-03 cs.CV 新提交

Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation

从逆境中学习:通过对抗性扰动实现语义感知的掩码细化

Beomyoung Kim, Sung Ju Hwang

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出Phoenix框架,用对抗学习生成语义噪声、对比学习建模细化关系,在图像分割掩码细化任务中性能优于现有方法,可提升先进分割模型。

Comments ECCV 2026

URL PDF HTML 收藏
2607.29040 2026-08-03 cs.CV 新提交

Rethinking Detection Calibration: A Coordinate and Direction Perspective

重新思考检测校准:坐标与视角方向

Juyong Lee, Seungjin Jung, Jungmin Lee, Sunju Lee, Jongwon Choi

机构 * Chung-Ang University(中央大学)

AI总结 针对现有检测校准仅关注框级定位的不足,提出ReDC框架,定义坐标级对齐与偏差方向,生成可靠坐标级置信度,实验表明其定位精度优于现有方法且覆盖原有校准方法范围。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.01499 2026-08-03 cs.CV 版本更新

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Anti-Prompt: 针对文本引导的图像到视频生成的图像保护

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

机构 * GIST(光州科学技术院) POSTECH(浦项科技大学)

AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏