arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-04 至 2026-08-04 共收录 13
2608.02258 2026-08-04 cs.CV cs.AI 新提交

Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow

基于稀疏约束修正流的开放集视觉文本取证

Jiangling Zhang, Shuxuan Gao, Zeyu Chen, Yichao Liu, Yu Zhou

AI总结 针对生成式AI视觉文本篡改的开放集取证问题,提出基于SC-RF的生成式检测器,在三基准上F1、IoU优于亚军,零样本性能强,还可用于漏洞分析。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02236 2026-08-04 cs.CV 新提交

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

GenPrior:释放文本到动作生成先验用于零样本骨骼-based动作识别

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Purple Mountain Laboratories(紫金山实验室)

AI总结 GenPrior是首个利用预训练T2M模型生成先验的ZSAR框架,通过分散门控特征融合和生成原型细化,在NTU-60等数据集上实现零样本及广义零样本动作识别的SOTA性能。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02216 2026-08-04 cs.CV 新提交

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

用于视觉-语言模型测试时适应的局部间隔恢复

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

机构 * Guangzhou University(广州大学) The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) Jinan University(暨南大学) Pengcheng Laboratory(鹏城实验室)

AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02214 2026-08-04 cs.CV 新提交

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能

Kaiyuan Pu, Tiantian Yang, Dan Zeng

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)

AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02109 2026-08-04 cs.CV 新提交

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

相同语义,不同路径:面向视觉-文本压缩的自改进对齐

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

机构 * Southeast University(东南大学) Nanjing University(南京大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。

Comments Accepted to ACM Multimedia 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01178 2026-08-04 cs.CV cs.AI 新提交

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00994 2026-08-04 cs.CV cs.CL 新提交

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

零样本图像描述中合成监督的实体忠实修复

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

机构 * Guangxi University(广西大学) School of Computer, Electronics and Information(计算机与电子信息学院)

AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00493 2026-08-04 cs.SD 新提交

Hidden-Domain Routing for All-Type Audio Deepfake Detection

用于全类型音频深度伪造检测的隐藏域路由

Yifan Gao, Yao Tian, Hongbin Suo, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

AI总结 针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00405 2026-08-04 cs.AI q-bio.GN 新提交

Gene Ontology-Guided Hierarchical Spatial Gene Expression Prediction from Histopathology Images

基于基因本体论(GO)的组织病理图像空间基因表达分层预测

Zhiwen Xu, Xiaoming Yan, Chengkun Wu, Juan Chen, Haoang Chi, Liyang Xu

机构 * National University of Defense Technology(国防科技大学)

AI总结 本研究提出MSGR模型,利用GO的基因功能层级结构作为先验,改进组织病理图像的空间基因表达预测,在9个HEST-1k数据集上验证其性能优于平坦解码方法。

Comments Accepted by ACM MM 2026. Code: https://github.com/NozomiMizore/MSGR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏