arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-24 至 2026-08-24 共收录 5
2608.21030 2026-08-24 cs.CV cs.CL cs.LG 新提交

COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET:面向视频多模态大语言模型的对比运动增强时序推理

Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Sun Yat-Sen University(中山大学) Pingan Technology(平安科技)

AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21022 2026-08-24 cs.CV cs.MM 新提交

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20809 2026-08-24 cs.CV cs.AI 新提交

TRACE: Training-time Report-guided and Clinically Ordered Concept Editing

TRACE:训练时报告引导且临床有序的概念编辑

Wentao Yue, Tianyou Lai, Jiayu Luo, Qingyu Mao, Ziying Wang, Zhenyuan Ning, Qilei Li

机构 * Lanzhou University(兰州大学) Shenzhen University(深圳大学) Southern Medical University(南方医科大学) Central China Normal University(华中师范大学)

AI总结 针对乳腺超声诊断深度学习方法可解释性与鲁棒性不足的问题,提出训练时报告引导的TRACE框架,结合SCMT与BUSC基准,实现仅图像输入的高性能诊断与跨域鲁棒性提升。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-08-24 cs.CV 版本更新

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Yanfeng Zhang, Mingwei Sun, Zhen Dong, Xiaoxiao Long, Zengmao Wang, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏