arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.01983 2026-07-07 cs.CV cs.LG 新提交

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment

基于双判别器扩散对齐的开放天气鲁棒3D检测

Shuyao Li, Chuanxing Geng, Heyang Sun, Qiang Zhou, Jingjing Gu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(工业和信息化部模式分析与机器智能重点实验室)

AI总结 提出双判别器引导扩散对齐(DCDA)框架,通过4D雷达条件扩散过程恢复退化LiDAR特征,无需显式天气建模,在未见天气类型和强度下实现鲁棒3D检测。

Comments 18 pages, 6 figures, 8 tables. ECCV 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01885 2026-07-07 cs.CV 新提交

Diversity-aware View Partitioning for Scalable VGGT

面向可扩展VGGT的多样性感知视图划分

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) KAIST(韩国科学技术院) RLWRLD

AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。

Comments 34 pages, 11 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01051 2026-07-07 cs.RO 新提交

AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation

AutoSpeed:面向机器人操作的无标注阶段自适应运动速度学习

Qingda Hu, Ziheng Qiu, Jieru Zhao, Zhongxue Gan, Wenchao Ding

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出AutoSpeed框架,通过频域速度调制和复合代价优化,使视觉运动策略能根据任务阶段自适应调整执行速度,减少执行时间并提高成功率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30545 2026-07-07 cs.CV 版本更新

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS: 基于立体先验的稀疏视角3D高斯泼溅

Wenhao Yuan, Yiyuan Ge, Deli Cai

机构 * South China University of Technology, China(华南理工大学)

AI总结 提出StereoGS框架,利用立体深度正则化和梯度感知不透明度衰减策略,在稀疏视角下实现高质量3D重建和新视角合成,无需额外推理开销。

Comments 15 pages, 6 figures, accepted to ECCV 2026, project page: https://stringerywh00.github.io/StereoGS_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23069 2026-07-07 cs.CV 新提交

Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection

重新思考基于原型的小样本目标检测相似性学习

KunHo Heo, Seungjae Kim, Wongyu Lee, SuYeon Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

AI总结 针对小样本目标检测中基于原型的方法存在类间混淆和定位线索不足的问题,提出文本锚定语义掩码和层级自回归回归,在COCO上提升10.1 nAP。

Comments Accepted by ECCV 2026. Code: https://github.com/VisualScienceLab-KHU/ReSet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22726 2026-07-07 cs.AI 新提交

Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation

文本主导,音乐装饰:基于能量的注意力机制用于可编辑舞蹈动作生成

Seong Jong Yoo, Siyuan Peng, Felix Gu, Stratis Aloimonos, Cornelia Fermüller

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 提出STREAM模型,通过模态解耦的扩散变压器分离文本语义和音乐节奏控制,实现可编辑舞蹈动作生成,并引入新数据集Motorica++和评估指标EDS。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22094 2026-07-07 cs.CV 新提交

Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring

位置不确定性下的跨视角偏航估计:基于线对齐的偏航评分

Taeho Kang, Nairan Zhang, Yelin Kim, Yujiao Shi, Youngki Lee

机构 * Seoul National University(首尔大学) Meta Amazon(亚马逊) ShanghaiTech University(上海科技大学)

AI总结 提出LAYS方法,通过径向不变的线共识投票,在无需精确位置的情况下实现亚度级偏航精度,显著提升未知偏航下的跨视角定位性能。

Comments 31 pages, 15 figures, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20971 2026-07-07 cs.CV 新提交

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

UNITY: 用于扩散模型中自适应条件化的注意力流网络

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

机构 * VIT Bhopal, India(印度VIT布巴尔学院) IIIT Delhi, India(印度德里理工学院) The University of Queensland, Australia(澳大利亚昆士兰大学) IIT Kanpur, India(印度坎普尔理工学院)

AI总结 提出UNITY,一种两阶段训练范式,通过可变形注意力流网络实现多模态条件共享与专化,在保持图像保真度的同时显著降低推理延迟和内存消耗。

Comments Acccepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19938 2026-07-07 cs.CV cs.AI 新提交

Triangular Consistency as a Universal Constraint for Learning Optical Flow

三角一致性作为光流学习的通用约束

Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan, Haniyeh Ehsani Oskouie, Alex Wong, Dong Lao

机构 * Louisiana State University(路易斯安那州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Yale University(耶鲁大学)

AI总结 提出三角一致性约束,通过组合两个光流诱导第三个光流并强制三者一致,适用于不同网络架构、监督类型和数据集,在监督、无监督和迁移学习中均提升性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-07-07 cs.CV cs.AI 版本更新

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01641 2026-07-07 cs.CV 版本更新

LivingWorld: Interactive 4D World Generation with Environmental Dynamics

LivingWorld:基于环境动态的交互式4D世界生成

Hyeongju Mun, In-Hwan Jin, Sohyeong Kim, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

AI总结 本文提出LivingWorld框架,通过单张图像生成具有环境动态的4D世界,解决大规模环境动态建模中的一致性与低延迟问题,采用几何感知对齐模块和紧凑哈希运动场实现高效动态传播。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08029 2026-07-07 cs.LG cs.CV 版本更新

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22972 2026-07-07 cs.CV 版本更新

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

WorldMesh: 通过网格条件图像扩散生成可导航的多房间3D场景

Manuel-Andreas Schneider, Angela Dai

机构 * Technical University of Munich(慕尼黑技术大学)

AI总结 本文提出WorldMesh方法,通过网格条件图像扩散生成大规模多房间3D场景,结合结构化网格与真实外观合成,实现高丰富度和多样性的3D环境生成。

Comments Accepted to ECCV 2026. Project page: https://mschneider456.github.io/world-mesh/ Video: https://www.youtube.com/watch?v=MKMEbPT38-s Code: https://github.com/mschneider456/worldmesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23669 2026-07-07 cs.CV cs.AI cs.LG 版本更新

Estimating Individual Tree Height and Species from UAV Imagery

利用无人机影像估计单株树木高度和树种

Jannik Endres, Etienne Laliberté, David Rolnick, Arthur Ouaknine

机构 * Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

AI总结 本文提出BIRCH-Trees基准,结合三种森林类型数据,引入DINOvTree模型,通过Vision Foundation Model实现高度和树种同时预测,实验表明其在参数效率和预测精度上表现优异。

Comments Accepted to ECCV 2026. Project page: https://RolnickLab.github.io/DINOvTree

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13649 2026-07-07 cs.CV 版本更新

Distribution Matching Distillation Meets Reinforcement Learning

分布匹配蒸馏与强化学习的结合

Dengyang Jiang, Dongyang Liu, Zanyi Wang, Qilong Wu, Liuzhuozheng Li, Hengzhuang Li, Xin Jin, David Liu, Changsheng Lu, Zhen Li, Bo Zhang, Mengmeng Wang, Steven Hoi, Peng Gao, Harry Yang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) SIAT, CAS(中国科学院深圳先进技术研究院) Shanghai AI Lab(上海人工智能实验室) ZJUT(浙江工业大学) CUHK(香港中文大学)

AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。

Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23483 2026-07-07 cs.CV cs.CL 版本更新

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

SpecEyes: 通过推测感知和规划加速代理多模态大语言模型

Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

AI总结 SpecEyes通过推测规划框架减少代理多模态大语言模型的序列开销,提升并发性能,实验显示在保持准确性的同时实现1.1-3.35倍的加速。

Comments ECCV 2026, Code: https://github.com/MAC-AutoML/SpecEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07155 2026-07-07 cs.CV

CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics

CHIMERA:适应性缓存注入与语义锚点提示的零样本图像变形方法:基于变形导向的度量

Dahyeon Kye, Jeahun Sung, Minkyu Jeon, Jihyong Oh

机构 * Chung-Ang University(Chung-Ang 大学) Princeton University(普林斯顿大学)

AI总结 CHIMERA通过逆向引导去噪和互补特征重用,解决传统图像变形方法中特征重用不充分和文本条件不兼容的问题,提出语义锚点提示和变形导向度量,提升变形效果的平滑性和语义一致性。

Comments ECCV 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/CHIMERA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20294 2026-07-07 cs.CV 版本更新

Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations

Ctrl-Z Sampling:通过受控随机zigzag探索扩展扩散采样

Shunqi Mao, Wei Guo, Chaoyi Zhang, Jieting Long, Ke Xie, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

AI总结 本文提出Ctrl-Z采样方法,通过检测质量景观中的高原并进行受控探索,提升扩散模型生成质量,在不同NFE预算下均表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19048 2026-07-07 cs.CV 版本更新

Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

动态生成视频中3D空间几何一致性的测量

Weijia Dou, Wenzhao Zheng, Weiliang Chen, Yu Zheng, Jie Zhou, Jiwen Lu

机构 * Tongji University(同济大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。

Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18797 2026-07-07 cs.CV 版本更新

VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation

VesselTok: 基于血管状3D生物医学图表示的分词方法用于重建与生成

Chinmay Prabhakar, Bastian Wittmann, Tamaz Amiranashvili, Paul Büschl, Ezequiel de la Rosa, Julian McGinnis, Benedikt Wiestler, Bjoern Menze, Suprosanna Shit

机构 * University of Zurich, Switzerland(苏黎世大学) ETH AI Center, Zurich, Switzerland(苏黎世联邦理工学院人工智能中心) Technical University of Munich, Germany(慕尼黑技术大学) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML))

AI总结 本文提出VesselTok框架,通过参数化形状视角学习血管状结构的潜在表示,实现复杂拓扑结构的稳健编码,并在不同解剖学中展示其生成和逆向问题应用的能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18528 2026-07-07 cs.AI 版本更新

Correlation-Weighted Multi-Reward Optimization for Compositional Generation

基于相关性的多奖励优化用于组合生成

Jungmyung Wi, Hyunsoo Kim, Donghyun Kim

机构 * Korea University(韩国大学) Korea Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出相关性加权多奖励优化方法,通过调整概念奖励权重提升多概念生成效果,改进了SD3.5和FLUX.1-dev模型在多概念基准测试中的表现。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00458 2026-07-07 cs.CV 版本更新

VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors

VLOD-TTA: 视觉语言目标检测器的测试时适应

Atif Belal, Heitor R. Medeiros, Marco Pedersoli, Eric Granger

机构 * International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS))

AI总结 本文提出VLOD-TTA,通过密集提案重叠和图像条件提示实现低开销的视觉语言目标检测器测试时适应,优于现有方法。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06576 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

BEVLM:将语言模型中的语义知识提炼到鸟瞰视图表示中

Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研发北美研究所) University of California, Irvine(加州大学伊尔弗分校)

AI总结 研究将大语言模型集成到自动驾驶,针对现有方法冗余计算、空间一致性受限等问题,提出BEVLM框架,连接鸟瞰视图表示与大语言模型,能有效提升跨视图驾驶场景推理准确性及端到端驾驶性能。

Comments Accepted to the 2026 European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10099 2026-07-07 cs.LG cs.CV 版本更新

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

流形上的学习:通过表示编码器解锁标准扩散变压器

Amandeep Kumar, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究利用表示编码器进行生成建模时标准扩散变压器收敛失败的问题,指出根本原因是几何干扰,提出黎曼流匹配与雅可比正则化方法,使标准扩散变压器无需宽度缩放就能收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14788 2026-07-07 cs.CV 版本更新

Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

用于文本到运动生成的重建锚定扩散模型

Yifei Liu, Changxing Ding, Ling Guo, Huaiguang Jiang, Qiong Cao

机构 * South China University of Technology(华南理工大学) Joy Future Academy(京东探索研究院)

AI总结 针对文本驱动人体运动生成中预训练文本编码器存在表征差距及迭代去噪过程中误差传播问题,提出重建锚定扩散模型,利用运动潜在空间监督,采用自正则化等目标函数训练,还提出重建误差引导机制,实验表明性能显著提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏