Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
双流解耦学习用于AVSD中的时间一致性和说话人交互
AI总结 本文提出D$^2$Stream双流框架,通过解耦时间连续性和人际交互任务,提升AVSD性能,实现95.6%的mAP和更广的泛化能力。
Comments Submitted to ACMMM 2026
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
双流解耦学习用于AVSD中的时间一致性和说话人交互
AI总结 本文提出D$^2$Stream双流框架,通过解耦时间连续性和人际交互任务,提升AVSD性能,实现95.6%的mAP和更广的泛化能力。
Comments Submitted to ACMMM 2026
AIM:面向视觉问答持续学习的非对称信息掩码
机构 * Sun Yat-Sen University(中山大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Tsinghua University(清华大学)
AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。
Comments 18 pages, 9 figures. Submitted to ACM MM 2026