arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-25 至 2026-08-25 共收录 5
2608.23254 2026-08-25 cs.LG 新提交

From Multimodal Observation to Interpretable Suggestions: Counterfactual Time-Expanded Relational Modeling of Surgical Teams

从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模

Vincenzo Marco De Luca, Antonio Longa, Giovanna Varni, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22819 2026-08-25 cs.CV 新提交

Direct, Parallel, or Sequential? A Comparative Study of Training-Free Multi-Subject Image-to-Video Generation

直接式、并行式还是顺序式?无训练多主体图像到视频生成的对比研究

Yanliang Qi, Kexi Chen, Muchao Ye, Haomiao Ni

机构 * University of Memphis(孟菲斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Iowa(爱荷华大学)

AI总结 本文对比研究直接、并行、顺序三种无训练多主体图像到视频生成范式,通过实证评估明确各范式的优劣势,为可控多主体视频生成系统设计提供实用见解。

Comments ACM Multimedia Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22485 2026-08-25 cs.CV 新提交

HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization

HeatTok:基于热扩散分词的遥感图像理解增强方法

Yingying Yan, Jiaqi Tang, Wei Wei, Qianzhou Wang, Jinjian Wu, Botong Geng, Jianmin Chen, Yuyang Xia, Lei Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出HeatTok分词器,结合热扩散聚合与G-MRoPE编码,在VRSBench、EarthVQA数据集上实现遥感图像理解的最优性能,保留对象级语义完整性。

Comments 19 pages (10 pages main text + appendix), 10 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026), Rio de Janeiro, Brazil, November 10--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22329 2026-08-25 cs.MM cs.CV 新提交

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

ReART:用于情感感知艺术生成的参考引导检索与细化

Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

AI总结 ReART框架通过参考引导检索与AAS驱动的细化,在AffectiveArt 2026挑战赛Track 1中获第2,实现1.00的AAS与0.78总分,用于情感感知艺术生成。

Comments Accepted by ACM Multimedia 2026 (Grand Challenge Track 1), 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21450 2026-08-25 cs.CV 新提交

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏