arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4771
2607.11798 2026-07-14 cs.CV cs.AI 新提交

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11710 2026-07-14 cs.CV 新提交

SVI360: Spherical Video Interpolation

SVI360:球面视频插值

Le-Kim Nguyen, Renato Martins, Pascal Vasseur, Cedric Demonceaux

机构 * Université Bourgogne Europe, ICB UMR 6303 CNRS, France(法国布尔格ogne欧洲大学,ICB UMR 6303 CNRS) Université de Picardie Jules Verne, MIS UR 4290, France(法国皮卡第-朱尔斯·维尔纳大学,MIS UR 4290)

AI总结 针对全向视频插值问题,提出双分支框架SVI360,结合图像帧及其旋转正交视图处理失真,增强原始视图与正交视图间流位移等变性改进中间帧预测,在插值质量上优于现有方法。

Comments Accepted at ECCV 2026. Code and trained models are available at: https://icb-vision-ai.github.io/video360_interpolation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11523 2026-07-14 cs.CV cs.AI 新提交

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Vinci2:在连续自我中心视频中提供主动协助

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * Dalian University of Technology(大连理工大学) Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

AI总结 研究连续自我中心视频中智能助手的主动协助问题,提出Vinci2系统,包含EgoServe基准测试和EgoMemo智能体,通过依赖上下文决策及相关技术,在新基准测试上建立强大基线且在现有测试中具竞争力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11205 2026-07-14 cs.CV 新提交

Parallax Portrait Matting

视差人像抠图

Xin Cai, Jiawen Chen, Lars Jebe, Tianfan Xue, Zhoutong Zhang

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

AI总结 针对图像抠图难题,提出视差人像抠图方法,利用连拍摄影中相机小幅度运动产生的前景-背景视差,通过估计trimap和前景/背景运动构建对齐视图预测,能恢复更精细细节和准确前景颜色。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10985 2026-07-14 cs.CV 新提交

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

MED-DSLC:通过域监督和对数校准进行多专家域分类

Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究针对视觉语言模型在多域零样本分类中存在的问题,提出MED-DSLC方法,结合域监督训练和域内对数缩放,恢复全局对数可比性,是轻量级方案,经实验验证可提升准确率、鲁棒性和可扩展性。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Leonard-Zeng/MED-DSLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10984 2026-07-14 cs.CV cs.AI cs.HC cs.LG 新提交

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion:通过等变潜扩散实现与运动学无关的人体运动预测

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 研究针对现有3D人体运动预测模型受骨骼运动学硬编码限制的问题,提出EquiFusion模型,通过排列等变架构实现潜扩散,对未见运动学有跨数据集泛化能力,在基准测试中成果领先,建立了新的人体运动预测标准。

Comments Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10840 2026-07-14 cs.CV 新提交

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX:通过前馈轨迹场进行任意视角和任意时刻的4D重建

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超智能安全北京重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 针对前馈4D重建方法局限,提出OmniX框架,通过解耦动态运动建模与静态几何预测,利用动态令牌和3D运动结构生成轨迹场,并构建数据引擎和数据集,在多任务上取得领先性能。

Comments Accepted by ECCV 2026, project page: https://omnix4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10792 2026-07-14 cs.CV 新提交

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat:用于高保真稀疏视图重建的多属性一致性

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia

机构 * Xidian University(西安电子科技大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对稀疏视图重建中现有方法存在几何伪影的问题,提出MAC-Splat训练框架,利用MASt3R和DINOv3获取2D对应关系并定义MAC损失,联合正则化3D属性,实验证明该方法能有效解决不适定的稀疏视图重建问题,性能优于基线。

Comments Accepted to the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10580 2026-07-14 cs.CV cs.AI 新提交

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

DiffUE:通过扩散自动编码器增强不可学习示例的效用-不可学习性权衡

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Oak Ridge National University, Knoxville(橡树岭国家实验室诺克斯维尔分部) University of Georgia, Athens(佐治亚大学雅典分校) Virginia Commonwealth University, Richmond(弗吉尼亚联邦大学里士满分校)

AI总结 针对AI模型利用个人图像致隐私侵犯问题,DiffUE通过在图像语义空间注入噪声,利用扩散自动编码器框架操纵语义特征,增强图像不可学习性,显著提升了图像质量和不可学习性之间的权衡,保障个人数据安全。

Comments To appear at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10495 2026-07-14 cs.CV 新提交

NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices

NanoVSR:迈向边缘设备上的实时视频超分辨率

Filip Pawlicki, Marcel Kańduła, Marcin Pucek, Kamil Dobies

机构 * Gdańsk University of Technology(格但斯克工业大学)

AI总结 研究针对边缘设备视频超分辨率计算开销大问题,提出NanoVSR架构,利用结构重参数化实现硬件兼容与低开销,通过渐进训练隐式学习时空对齐,在REDS4基准测试中平衡精度与效率,提升边缘设备超分辨率性能。

Comments Accepted to ECCV 2026. This is the pre-review submitted version, not the camera-ready version. The final authenticated version will be available in the ECCV 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10470 2026-07-14 cs.CV eess.IV 新提交

On the Real-World Generalisability of Optical Flow Models

关于光流模型的现实世界通用性

Petter Reijalt, Sander Gielisse, Rickard Karlsson, Jan van Gemert

机构 * TU Delft(代尔夫特理工大学) Computer Vision Lab(计算机视觉实验室)

AI总结 研究光流模型在现实世界的通用性问题,构建现实世界评估基准,通过FlowFactor数据集发现不同因素下模型性能与现实准确性的关联,指出合成基准测试对现实数据准确性预测能力弱,扩大训练数据量未必能解决差距。

Comments Accepted @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10308 2026-07-14 cs.CV 新提交

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

通过虚拟模态合成将大型多模态模型推广到通用视觉模态

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。

Comments Accepted by the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10238 2026-07-14 cs.CV 新提交

Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset

动态情感推理基准测试:一个以观众为中心的视频情感数据集

Zhiyan Zhang, Peipei Song, Jinpeng Hu, Jingyang Jia, Xun Yang, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 研究针对视频情感分析常被视为静态分类问题的不足,引入动态情感推理及数据集DAR,定义三项任务,提出DAR - R1框架,经实验验证其在情感定位和推理方面达新的先进水平。

Comments 25 pages, 6 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10071 2026-07-14 cs.CV cs.RO 新提交

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness

FlashBEV:具有I/O感知的快速且内存高效的精确BEV变换

Shunsuke Yokokawa, Hironori Kasahara

机构 * Waseda University(早稻田大学) T2, Inc.(T2公司)

AI总结 研究自动驾驶中BEV感知的视图变换问题,提出FlashBEV执行策略,通过重新设计执行方式,使其在数学上等同于Tensorized Sampling-VT,减少内存流量和开销,降低峰值GPU内存,加速推理延迟,突破可扩展性障碍。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09780 2026-07-14 cs.CV cs.LG 新提交

Towards Real-World Wearable Motion Reconstruction

迈向现实世界的可穿戴运动重建

Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) Google(谷歌)

AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06438 2026-07-14 cs.RO cs.CV cs.GR 版本更新

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation

WristMimic:基于手腕引导操作的全身人形机器人控制

Wongyun Yu, Youngwoon Kim, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学)

AI总结 研究如何将人类物体交互演示重定向到物理模拟,提出WristMimic框架,分离无接触身体运动与手部操作,通过手腕引导,让手指从物体跟踪和接触结果学习行为,实验显示该框架在跨手部模型重定向时效果良好。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29473 2026-07-14 cs.CV 版本更新

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

MAVIN:具有叙事控制的多镜头视听生成

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sun Yat-sen University(中山大学)

AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26740 2026-07-14 cs.CV 版本更新

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

LiveEdit:迈向基于扩散的实时流式视频编辑

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

机构 * THU(清华大学) HKUST(香港科技大学)

AI总结 提出一种因果逐帧编辑的流式视频框架,通过三阶段蒸馏将双向模型能力迁移至单向流式编辑器,结合AR掩码缓存实现12.66 FPS的实时编辑,并保持背景稳定。

Comments Accepted by ECCV 2026, Project page: https://live-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26515 2026-07-14 cs.CV 版本更新

Forget, Anticipate and Adapt: Test Time Training for Long Videos

遗忘、预期与适应:长视频的测试时训练

Rajat Modi, Sebastian Noel, Xin Liang, Yogesh Singh Rawat

机构 * University of Central Florida(中佛罗里达大学)

AI总结 提出帧遗忘网络(FFN),通过仅处理滑动窗口中的三帧并定义惊奇度量自适应调整窗口,实现长视频的高效测试时训练。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18757 2026-07-14 cs.CV 版本更新

Driving Like Yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving

驾驶千面:一个闭环个性化端到端自动驾驶的基准

Xiaoru Dong, Ruiqin Li, Xiao Han, Zhenxuan Wu, Jiamin Wang, Jian Chen, Qi Jiang, SM Yiu, Xinge Zhu, Yuexin Ma

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Person2Drive平台,通过个性化数据集、评价指标和框架,解决自动驾驶个性化难题,实现细粒度分析与有效个性化。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17665 2026-07-14 cs.CV 版本更新

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

OpenEarthAgent:一个用于工具增强地理空间代理的统一框架

Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir, Hiyam Debary, Mustansar Fiaz, Muhammad Zaigham Zaheer, Paolo Fraccaro, Fahad Shahbaz Khan, Muhammad Haris Khan, Xiao Xiang Zhu, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) IBM Research(IBM研究院) Linköping University(林霍姆斯大学) Technical University Munich(慕尼黑技术大学) Australian National University(澳大利亚国立大学)

AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16112 2026-07-14 cs.CV 版本更新

AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs

AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型

Yuan Zhang, Chun-Kai Fan, Sicheng Yu, Junwen Pan, Tao Huang, Ming Lu, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏