arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-10 至 2026-08-10 共收录 4
2608.07417 2026-08-10 cs.CV cs.AI 新提交

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07340 2026-08-10 cs.CV cs.AI 新提交

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

H2AL:用于基于配准的小样本医学图像分割的双曲层次感知聚合学习

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng

机构 * Dalian University of Technology(大连理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 针对基于配准的小样本医学图像分割忽视解剖结构层次的问题,提出H2AL框架,通过H2I模块与梯度聚合算法提升配准和分割性能,实验验证其有效性。

Comments 10 pages, 9 figures. Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06981 2026-08-10 cs.CV 新提交

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏