arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-22 至 2026-07-22 共收录 3
2607.18827 2026-07-22 cs.CV 新提交

Open-Vocabulary Gaze Object Prediction: Benchmark and Method

开放词汇注视对象预测:基准与方法

Binglu Wang, Sensen Niu, Ying Chen, Guangyu Guo

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Zhejiang University(浙江大学)

AI总结 研究注视对象预测问题,提出基于文本驱动对象发现和注视引导选择模块的框架,并引入梯度信息选择调整,构建含86个自然类别的基准,所提模型在开放和封闭词汇设置中均表现出色。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11063 2026-07-22 cs.AI 版本更新

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。

Comments ACM International Conference on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏