Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow
基于稀疏约束修正流的开放集视觉文本取证
AI总结 针对生成式AI视觉文本篡改的开放集取证问题,提出基于SC-RF的生成式检测器,在三基准上F1、IoU优于亚军,零样本性能强,还可用于漏洞分析。
Comments Accepted to ACM MM 2026
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
基于稀疏约束修正流的开放集视觉文本取证
AI总结 针对生成式AI视觉文本篡改的开放集取证问题,提出基于SC-RF的生成式检测器,在三基准上F1、IoU优于亚军,零样本性能强,还可用于漏洞分析。
Comments Accepted to ACM MM 2026
GenPrior:释放文本到动作生成先验用于零样本骨骼-based动作识别
机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Purple Mountain Laboratories(紫金山实验室)
AI总结 GenPrior是首个利用预训练T2M模型生成先验的ZSAR框架,通过分散门控特征融合和生成原型细化,在NTU-60等数据集上实现零样本及广义零样本动作识别的SOTA性能。
Comments Accepted by ACMMM 2026
用于视觉-语言模型测试时适应的局部间隔恢复
机构 * Guangzhou University(广州大学) ; The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) ; Jinan University(暨南大学) ; Pengcheng Laboratory(鹏城实验室)
AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。
Comments Accepted by ACM MM 2026
VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)
AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。
Comments ACM MM 2026
相同语义,不同路径:面向视觉-文本压缩的自改进对齐
机构 * Southeast University(东南大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。
Comments Accepted to ACM Multimedia 2026 (Oral)
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
DynActiveGS:面向动态场景重建的主动高斯溅射方法
机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Huawei Technologies Ltd(华为技术有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。
Comments Accepted to ACM Multimedia 2026
零样本图像描述中合成监督的实体忠实修复
机构 * Guangxi University(广西大学) ; School of Computer, Electronics and Information(计算机与电子信息学院)
AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures
基于潜在流匹配的混合域后验采样用于逆问题
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。
Comments Accepted to ACM Multimedia 2026
用于全类型音频深度伪造检测的隐藏域路由
机构 * OPPO AI Center(OPPO人工智能中心)
AI总结 针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。
Comments Accepted by ACMMM 2026
基于基因本体论(GO)的组织病理图像空间基因表达分层预测
机构 * National University of Defense Technology(国防科技大学)
AI总结 本研究提出MSGR模型,利用GO的基因功能层级结构作为先验,改进组织病理图像的空间基因表达预测,在9个HEST-1k数据集上验证其性能优于平坦解码方法。
Comments Accepted by ACM MM 2026. Code: https://github.com/NozomiMizore/MSGR
基于语义对比学习的表意文字视觉预训练
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Jilin University(吉林大学) ; King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。
Comments ACM MM 2026 paper
一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地
机构 * South China University of Technology(华南理工大学) ; HiThink Research(海思思考研究院)
AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。
Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026