arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-12 至 2026-08-12 收录 8
2608.10020 2026-08-12 eess.IV cs.MM 新提交

MD2G-Cast: Relay-Coordinated Multicast for Scalable Volumetric Streaming over MoQ

MD2G-Cast:基于MoQ的可扩展体积流传输的中继协调组播

Ruonan Chai, Yisu Wang, Zili Meng, Dirk Kutscher

AI总结 该研究提出基于MoQ的MD2G-Cast中继协调组播框架,通过PPO算法实现分组与增强准入控制,可提升体积流传输的可扩展性,降低链路负载,优于Rolling和Clustering等方法。

Comments 9 pages, 8 figures, 4 tables. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026)

URL PDF HTML 收藏
2608.11096 2026-08-12 cs.CV 新提交

Every Packet Counts: Dispersing Information for Loss-Resilient Learned Image Compression

每个数据包都重要:面向抗丢包的学习型图像压缩的信息分散方法

Yuhang Wei, Chuqin Zhou, Yibo Shi, Jing Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd.(华为技术有限公司) Central Media Technology Institute(中央媒体技术研究院)

AI总结 本文针对学习型图像压缩的抗丢包问题,提出ICR、ICG机制及双层双分支自回归结构,实验显示其在丢包场景下的重建质量和稳定性均优于现有方法,且可泛化到突发丢包场景。

Comments 16 pages, 12 figures, 8 tables. Joint first authors: Yuhang Wei and Chuqin Zhou. Corresponding author: Guo Lu. To appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

URL PDF HTML 收藏
2608.11002 2026-08-12 cs.CL cs.AI 新提交

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.10316 2026-08-12 cs.CV cs.LG cs.MM 新提交

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

UniMod:通过跨模态与模态内对齐增强多模态医学诊断

Zijian Gu, Weikai Lin, Shuang Zhou, Zihan Chen, Song Wang

机构 * University of Central Florida(中佛罗里达大学) University of Rochester(罗切斯特大学) Harvard Medical School(哈佛医学院) University of Virginia(弗吉尼亚大学)

AI总结 UniMod框架通过要求各模态独立预测诊断缓解多模态医学诊断的捷径学习,添加跨模态与模态内对齐,在两个数据集上优于基线方法,还可扩展至多标签5分类诊断。

Comments Accepted to ACM Multimedia 2026 (MM '26). 10 pages, 7 figures, 5 tables. Code: https://github.com/futurespyhi/UniMod

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2602.06075 2026-08-12 cs.DC 版本更新

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

MemGUI-Bench: 动态环境中移动GUI代理内存能力的基准测试

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang Chai, Weifeng Lin, Han Xiao, WenHao Wang, Siheng Chen, Zhengxi Lu, Gao Wu, Hao Wang, Liang Liu, Yong Liu

AI总结 MemGUI-Bench提出一个综合的内存导向基准测试,通过128个任务评估移动GUI代理的内存能力,揭示了各系统中的显著内存缺陷并提出5种设计改进措施。

Comments Accepted to ACM MM 2026. Project page: https://memgui-bench.github.io/

URL PDF HTML 收藏