arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-30 至 2026-07-30 共收录 5
2607.25961 2026-07-30 cs.CV cs.AI 版本更新

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

用于视频级矛盾心理和犹豫识别的交互流知识引导多模态推理

Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

AI总结 研究视频级矛盾心理和犹豫识别难题,提出PRISM-AH框架,通过冻结编码器、轻量级流模型处理多模态冲突,经窗口级注释监督、知识引导大语言模型推理,在测试中取得较好宏观F1,验证推理增益可转移。

Comments 14 Pages, 1 Figure, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29716 2026-07-30 cs.CV 版本更新

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World

AerialMetric: 在真实世界中基准测试和适配无人机单目度量深度估计

Zhongqiang Song, Guanying Chen, Yuqi Zhang, Yin Zou, Chuanyu Fu, Zhiyuan Yuan, Chuan Huang, Shuguang Cui, Xiaochun Cao

机构 * Sun Yat-sen University, Shenzhen Campus(中山大学深圳校区) FNii–Shenzhen(FNii-深圳) SSE, CUHKSZ(SSE,CUHKSZ) SIAS, USTC(SIAS,中国科学技术大学)

AI总结 针对无人机航拍图像中的单目度量深度估计问题,构建了包含5.2万真实和1.6万合成图像-深度对的基准数据集,系统评估现有模型并微调代表性方法,实现航拍场景下的最优性能。

Comments ECCV 2026. Project page: ECCV2026-page/" target="_blank" rel="noopener">https://kuieless.github.io/AerialMetric-ECCV2026-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31088 2026-07-30 cs.CV 版本更新

Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation

面向会话式说话人脸生成的灵活、自然、高效交互

Baiqin Wang, Sen Chen, Jiankuo Zhao, Xiangyu Liu, Zhen Lei, Xiangyu Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心) SCSE, FIE, M.U.S.T(澳门科技大学创新工程学院计算机科学与工程学院)

AI总结 提出InterTalk框架,基于运动架构实现多轮多人对话的实时生成,通过显式建模对话动态、多参与者运动反馈和迭代生成策略,以及面部组件解耦,在保持30FPS实时性的同时提升交互自然性和灵活性。

Comments 17 Pages,8 figures. Project Page: https://bq-wang0511.github.io/InterTalk/

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28027 2026-07-30 eess.IV cs.AI cs.CV cs.LG 版本更新

MLVC: Multi-platform Learned Video Codec for Real-World Deployment

MLVC:面向实际部署的多平台学习型视频编解码器

Tanel Pärnamaa, Martin Lumiste, Ardi Loot, Evgenii Indenbom, Andrei Znobishchev, Ando Saabas

机构 * Microsoft Corporation(微软公司)

AI总结 提出MLVC,一种跨平台鲁棒的神经视频编解码器,通过超先验显式传输缩放参数保证熵编码一致性,结合门控记忆、ReGLU激活等架构改进,在VCD基准上相比硬件HEVC实现>70% BD-rate提升,且与无法跨平台运行的DCVC-RT主观质量相当。

Comments Accepted to ECCV 2026. Code: https://github.com/microsoft/mlvc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06228 2026-07-30 cs.CV 版本更新

Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention

低延迟基于事件的对象检测与空间稀疏线性注意力

Haiqing Hao, Zhipeng Sui, Rong Zou, Zijia Dai, Nikola Zubić, Davide Scaramuzza, Wenhui Wang

机构 * Tsinghua University(清华大学) University of Zurich(苏黎世大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出SSLA,一种空间稀疏线性注意力机制,用于提升基于事件的目标检测效率与精度,实现低延迟性能。

Comments 19 pages, 4 figures, 8 tables, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏