arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-27 至 2026-08-27 共收录 5
2608.25851 2026-08-27 cs.CV 新提交

DEFUSE: Generalizable Backdoor Defense for Self-Supervised Encoders with Generative Priors

DEFUSE:面向带生成先验的自监督编码器的可泛化后门防御方法

Tuo Chen, Jie Gui, Minjing Dong, Lanting Fang, Ju Jia, Benlei Cui, Jian Liu

机构 * Ant Group(蚂蚁集团) Purple Mountain Laboratories(紫金山实验室) City University of Hong Kong(香港城市大学) Beijing Institute of Technology(北京理工大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出DEFUSE,一种基于条件扩散生成模型的可泛化后门检测框架,用于防御自监督学习编码器的后门攻击,实验表明其性能优于现有方法且泛化性更强。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25737 2026-08-27 cs.IR cs.MM 新提交

D3ER: Supporting Multi-Modal Recommendation via Disentangle and Distillation-based Dynamic Ensemble

D3ER:基于解耦与蒸馏的动态集成多模态推荐方法

Bingnan Wang, Yi Li, Xiongxin Tang, Fanjiang Xu, Jiangmeng Li

AI总结 该研究针对多模态推荐中同质性与异质性判别信息联合学习的缺陷,提出D3ER方法,引入梯度提升并结合知识蒸馏与全局校正正则化,在真实数据集上验证了其优越性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25386 2026-08-27 cs.CV 新提交

Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

带前瞻的高效训练:用于自回归图像生成的多令牌辅助监督

Guo Niu, Xiongfei Yao, Teng Wang, Nannan Zhu

机构 * Foshan University(佛山大学) The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

AI总结 该研究针对自回归图像生成的缺陷,提出MTAR框架,通过多令牌预测、令牌级对比正则化和语义丢弃提升性能,在ImageNet上实现了生成质量与效率的更优平衡。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24909 2026-08-27 cs.HC cs.CV cs.SD 新提交

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

超级明星:面向数字人的流式实时交互智能体

Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang

AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。

Comments Accepted by ACM Multimedia 2026. Project Page: \url{ this https URL (https://super-star-2026.github.io/) }

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-08-27 cs.CV cs.MM 版本更新

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏