arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-04 至 2026-08-04 共收录 18
2608.02502 2026-08-04 cs.AI 新提交

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01793 2026-08-04 cs.LG 新提交

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD:用于基于能量的异常检测的整流流预处理

Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 该研究针对统一异常检测中高维token空间EBM训练不稳定问题,提出ReFP-AD方法,经实验在MVTec-AD和VisA数据集上取得优于基线的异常检测性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01761 2026-08-04 cs.CV 新提交

DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing

DecoupleGS:用于端到端自动驾驶测试的交互式三维高斯溅射

Siying Li, Ying Ni, Jie Sun, Jian Sun, Haotian Shi

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室)

AI总结 DecoupleGS是一种解耦三维高斯溅射框架,通过分解场景为静态背景与动态智能体,结合三个针对性模块实现高保真交互,为端到端自动驾驶测试提供实用闭环传感器仿真平台。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01706 2026-08-04 cs.CV 新提交

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

UniSim-SLAM:采用统一Sim(3)优化的前馈SLAM

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

机构 * National Institute of Science and Technology(国立科学技术研究所)

AI总结 UniSim-SLAM是采用统一Sim(3)优化的前馈SLAM系统,通过前端两视图跟踪与后端多视图子图优化,在TUM RGB-D和7-Scenes数据集上实现了当前最佳未校准设置下的轨迹精度,误差显著降低。

Comments Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01643 2026-08-04 cs.CV cs.AI cs.GR 新提交

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

StreamTalk:基于关键姿态锚定的流式伴随语音手势生成

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

机构 * The University of Tokyo(东京大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学)

AI总结 StreamTalk是带周期性生成-检索-精调循环的闭环流式伴随语音手势生成框架,通过关键姿态锚定减少长程漂移,在BEAT2数据集上达到最优FGD指标,实时运行帧率达76 FPS。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01129 2026-08-04 cs.RO cs.CV 新提交

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

FeDepth:面向机器人异构性的深度估计联邦学习

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院)

AI总结 针对机器人感知深度估计中联邦学习因客户端异构性导致性能下降的问题,本文提出FeDepth框架,通过软聚类建模客户端关系,在多架构上提升了联邦学习的鲁棒性。

Comments Accepted at ECCV 2026. Ganghyeon Lee and Inha Lee contributed equally. Kyungdon Joo is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00903 2026-08-04 cs.CV 新提交

PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos

PeCA:调色板上下文辅助推理,用于动画视频的测试时油漆桶上色

Dongheng Lin, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

AI总结 针对动画视频油漆桶上色的区域对应易受模糊片段影响的问题,提出无训练即插即用的PeCA框架,通过空间与时间上下文推理优化,实验证实其性能持续提升。

Comments ECCV 2026, Project Page: https://rathgrith.github.io/PeCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00800 2026-08-04 cs.CV 新提交

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

AIMold:一种用于复杂模具设计的自主AI驱动流水线

Pengyun Qiu, Shuo Wang, Zeyuan Chen, Yihao Zhi, Chongjie Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) FNii-Shenzhen(深圳未来网络研究院)

AI总结 研究针对复杂模具设计依赖专家知识、缺乏公开数据集的问题,推出含超2.3万个模型的MoldCAD数据集,提出AI流水线实现模具设计自动化,助力制造感知型CAD生成。

Comments Accepted to ECCV 2026. Code is available at https://github.com/tb2-sy/AIMold

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02252 2026-08-04 cs.CV 版本更新

ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection

ArcAD: 冷启动监督异常检测的异常校正校准框架

Ningning Han, Lei Fan, Jia Guo, Yunkang Cao, Xiu Su, Feng Cao, Donglin Di, Tonghua Su

机构 * Faculty of Computing, Harbin Institute of Technology, Harbin, China University of New South Wales, Sydney, Australia School of Biomedical Engineering, Tsinghua University, Beijing, China School of Artificial Intelligence Robotics, Hunan University, Changsha, China Big data institute, Central South University, Sydney, Australia DZ-Matrix, Beijing, China Chongqing Research Institute of HIT, Chongqing, China

AI总结 针对工业异常检测中冷启动场景下正常样本不足、异常样本稀少的问题,提出基于推拉学习范式的即插即用校准框架ArcAD,通过将正常样本投影到超球面并聚类、合成伪异常并利用真实异常优化边界,在多个数据集上显著优于现有方法。

Comments Accepted to European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09112 2026-08-04 cs.CV 版本更新

GimbalDiffusion: Gravity-Aware Camera Control for Video Generation

GimbalDiffusion:基于重力的摄像机控制用于视频生成

Frédéric Fortier-Chouinard, Yannick Hold-Geoffroy, Valentin Deschaintre, Matheus Gadelha, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Adobe

AI总结 本文提出GimbalDiffusion框架,通过物理坐标系实现摄像机运动的精确控制,引入null-pitch conditioning策略以避免冲突提示内容干扰,并建立新基准评估重力感知摄像机控制视频生成能力。

Comments Accepted at ECCV 2026. Project page: https://lvsn.github.io/GimbalDiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25129 2026-08-04 cs.CV 版本更新

AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting

AirSplat:基于鲁棒前馈3D高斯散射的对齐与评分

Minh-Quan Viet Bui, Jaeho Moon, Munchurl Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出AirSplat框架,通过自一致性姿态对齐和基于评分的透明度匹配技术,提升无姿态视角合成的重建质量。

Comments Project page: https://kaist-viclab.github.io/airsplat-site, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21541 2026-08-04 cs.GR cs.CV 版本更新

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

详情

展开后加载摘要…

URL PDF HTML 收藏