arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-07 至 2026-08-07 共收录 6
2607.23070 2026-08-07 cs.CV 版本更新

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

DishSeg24k:用于食物分割的大规模基准测试及随机专家解码

Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) Hangzhou Dianzi University(杭州电子科技大学) North China Electric Power University(华北电力大学) Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院)

AI总结 针对现有食物分割基准测试无法捕捉现实用餐场景复杂性的问题,提出DishSeg24k基准测试,并基于此设计FEAST方法,通过将查询解码视为马尔可夫决策过程及重新设计解码器,提升分割性能,在多个指标上优于此前方法。

Comments 9 pages, 8 figures. This paper has been accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02183 2026-08-07 cs.AI 版本更新

TRU: Targeted Reverse Update for Efficient Multimodal Recommendation Unlearning

TRU:面向高效多模态推荐去学习的定向反向更新

Zhanting Zhou, KaHou Tam, Ziqiang Zheng, Zeyu Ma, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Macau(澳门大学)

AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。

Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08894 2026-08-07 cs.NE cs.AI cs.CV 版本更新

Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer

Ge$^\text{2}$mS-T:多维分组以实现脉冲变换器中超高能效

Zecheng Hao, Shenghao Xie, Kang Chen, Wenxuan Liu, Zhaofei Yu, Tiejun Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 本文提出Ge$^\text{2}$mS-T架构,通过多维分组计算提升Spiking Vision Transformers的能效,解决内存、精度与能耗的平衡问题。

Comments Accepted to ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11183 2026-08-07 cs.CV 版本更新

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

基于前馈二维高斯溅射标记化的通用视频表示

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。

Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏