Depth-Guided Video Object Counting in Crowded Scenes
拥挤场景中基于深度引导的视频目标计数
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
拥挤场景中基于深度引导的视频目标计数
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
MultiMoQ:面向鲁棒沉浸式视频流的多接入媒体传输 QUIC
AI总结 本文提出基于MoQ的多接入分块流框架MultiMoQ,通过重新设计传输机制提升沉浸式视频流的鲁棒性,经仿真验证其在吞吐量、延迟及播放连续性上优于DASH和标准MoQ。
Comments 9 pages, 15 figures. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)
DTRNet:用于手写中文文本识别及伪造字符检测的双文本-偏旁解码框架
AI总结 针对教育场景中手写中文文本识别需检测伪造字符的需求,本文提出DTRNet框架,通过解耦文本识别与结构验证,实现高效且可解释的伪造字符检测,效果显著。
Comments Accepted by ACM MM 2026 (Oral)
面向图像复原的关系流形上的流图蒸馏
AI总结 本文提出FoRM方法,将关系知识迁移转化为关系流形上的流图映射问题,通过安全半群一致性约束等优化,在5项图像复原任务上降低训练方差约50%,性能优于现有蒸馏基线。
Comments 9 pages, 7 figures. Accepted to ACM Multimedia 2026
显式规划与反应分解的轨迹预测统一框架
机构 * Software College, Northeastern University(东北大学软件学院)
AI总结 针对现有轨迹预测方法未充分区分社会影响功能角色的问题,提出INTraJ框架,将社会影响分解为规划与反应两阶段,在四个基准上实现性能提升,验证了阶段性社会建模的重要性。
Comments Accepted by ACM MM 2026
URNet:用于高效RGB-D语义分割的统一重参数化网络
机构 * University of Technology Sydney(悉尼科技大学) ; Nanjing University of Science and Technology(南京理工大学) ; Honor Device Co., Ltd.(荣耀终端有限公司) ; Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)
AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。
Comments ACM MM 2026
MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击
AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。
Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material
PD-GS:音素驱动的3DGS用于音频驱动的说话头生成
机构 * Southeast University(东南大学) ; School of Computer Science and Engineering(计算机科学与工程学院)
AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。
Comments Accepted to ACM MM 2026