arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-25 至 2026-08-25 共收录 10
2608.18292 2026-08-25 cs.RO cs.CV 版本更新

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学)

AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。

Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15404 2026-08-25 cs.CV 版本更新

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

Comments Accepted to the Explainable Computer Vision (eXCV) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-08-25 cs.LG 版本更新

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

Comments Accepted as an extended abstract at Geometric Intelligence @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05176 2026-08-25 cs.CV 版本更新

FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection

FSDC-DETR:面向小目标检测的频域-空域协同DETR

Aiwen Liu, Chengguang Zhu, Gang Wang, Dandan Zhu, Haodong Lin, Yan Wang, Huiyu Zhou, Zhengyi Pan

机构 * Micro-Intelligence(微智感知) East China Normal University(华东师范大学) University of Leicester(莱斯特大学) Chongqing Normal University(重庆师范大学)

AI总结 针对现有检测器易丢失小目标高频分量的问题,提出频域-空域协同DETR框架,通过双分支融合、交互机制与动态下采样实现小目标检测性能显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02486 2026-08-25 cs.CV 版本更新

GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training

GeoMix: 通过全局上下文和多检测器训练实现无描述符视觉定位

Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

AI总结 提出GeoMix框架,通过局部方向与距离嵌入、全局上下文节点和多检测器混合训练,增强几何判别性,显著提升无描述符视觉定位精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19907 2026-08-25 cs.CV 版本更新

SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation

SceneOrchestra: 通过完整工具调用轨迹生成实现高效的代理3D场景合成

Yun He, Kelin Yu, Matthias Zwicker

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 SceneOrchestra通过训练可调的 orchestration 框架优化工具调用流程,消除逐步审查循环,提升效率和输出质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01844 2026-08-25 cs.CV 版本更新

FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting

FaCT-GS:基于高斯点撒的快速可扩展CT重建

Pawel Tomasz Pieta, Rasmus Juul Pedersen, Sina Borgi, Jakob Sauer Jørgensen, Jens Wenzel Andreasen, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出FaCT-GS框架,通过优化体素化和光栅化流程,实现快速且可扩展的CT重建,比现有方法快4-13倍,适用于不同投影尺寸。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-08-25 cs.CV cs.AI 版本更新

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Accepted to ECCV 2026; Project website: this https URL (https://visioncoach.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏