Depth-Guided Video Object Counting in Crowded Scenes
拥挤场景中基于深度引导的视频目标计数
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
拥挤场景中基于深度引导的视频目标计数
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
MultiMoQ:面向鲁棒沉浸式视频流的多接入媒体传输 QUIC
AI总结 本文提出基于MoQ的多接入分块流框架MultiMoQ,通过重新设计传输机制提升沉浸式视频流的鲁棒性,经仿真验证其在吞吐量、延迟及播放连续性上优于DASH和标准MoQ。
Comments 9 pages, 15 figures. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)
DTRNet:用于手写中文文本识别及伪造字符检测的双文本-偏旁解码框架
AI总结 针对教育场景中手写中文文本识别需检测伪造字符的需求,本文提出DTRNet框架,通过解耦文本识别与结构验证,实现高效且可解释的伪造字符检测,效果显著。
Comments Accepted by ACM MM 2026 (Oral)
面向图像复原的关系流形上的流图蒸馏
AI总结 本文提出FoRM方法,将关系知识迁移转化为关系流形上的流图映射问题,通过安全半群一致性约束等优化,在5项图像复原任务上降低训练方差约50%,性能优于现有蒸馏基线。
Comments 9 pages, 7 figures. Accepted to ACM Multimedia 2026
显式规划与反应分解的轨迹预测统一框架
机构 * Software College, Northeastern University(东北大学软件学院)
AI总结 针对现有轨迹预测方法未充分区分社会影响功能角色的问题,提出INTraJ框架,将社会影响分解为规划与反应两阶段,在四个基准上实现性能提升,验证了阶段性社会建模的重要性。
Comments Accepted by ACM MM 2026
URNet:用于高效RGB-D语义分割的统一重参数化网络
机构 * University of Technology Sydney(悉尼科技大学) ; Nanjing University of Science and Technology(南京理工大学) ; Honor Device Co., Ltd.(荣耀终端有限公司) ; Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)
AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。
Comments ACM MM 2026
MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击
AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。
Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material
PD-GS:音素驱动的3DGS用于音频驱动的说话头生成
机构 * Southeast University(东南大学) ; School of Computer Science and Engineering(计算机科学与工程学院)
AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。
Comments Accepted to ACM MM 2026
DishSeg24k:用于食物分割的大规模基准测试及随机专家解码
机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) ; Hangzhou Dianzi University(杭州电子科技大学) ; North China Electric Power University(华北电力大学) ; Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院)
AI总结 针对现有食物分割基准测试无法捕捉现实用餐场景复杂性的问题,提出DishSeg24k基准测试,并基于此设计FEAST方法,通过将查询解码视为马尔可夫决策过程及重新设计解码器,提升分割性能,在多个指标上优于此前方法。
Comments 9 pages, 8 figures. This paper has been accepted by ACMMM 2026
MAC 2026:推动微动作分析迈向细粒度理解
机构 * United Arab Emirates University(阿联酋大学) ; Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; University of Oulu(奥卢大学) ; CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)
AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。
Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026
TRU:面向高效多模态推荐去学习的定向反向更新
机构 * University of Electronic Science and Technology of China(电子科技大学) ; University of Macau(澳门大学)
AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。
Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record
Ge$^\text{2}$mS-T:多维分组以实现脉冲变换器中超高能效
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 本文提出Ge$^\text{2}$mS-T架构,通过多维分组计算提升Spiking Vision Transformers的能效,解决内存、精度与能耗的平衡问题。
Comments Accepted to ACM MM 2026 (Oral)
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
基于前馈二维高斯溅射标记化的通用视频表示
AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。
Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil