arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

至 收录 1940
2608.08523 2026-08-11 cs.AI 新提交

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

URL PDF HTML 收藏
2608.08508 2026-08-11 cs.CV 新提交

Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation

面向自适应超分辨率与质量评估的测试时适应方法

Ajeet Kumar Verma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院)

AI总结 该研究针对真实场景下VSR泛化不足的问题,提出基于TTA的无参考VQA框架、Transformer屏幕内容超分辨率架构及区域感知TTA策略,在多基准上实现感知质量与可读性的提升。

Comments 5 pages, 5 figures, 4 tables, 34th ACM International Conference on Multimedia, Accepted as Doctoral Symposium Track

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.08147 2026-08-11 cs.MM 新提交

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

SAMOT:面向视听实例分割的状态感知步长调制与最优传输匹配

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

AI总结 针对AVIS的模态状态变化干扰与跨模态分布差异问题,提出含ADSM与OT-MM的SAMOT框架,在AVIS基准取得最优性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.08066 2026-08-11 cs.CV eess.IV 新提交

EvBS: Event-guided Blur Synthesis for Domain-adaptive Motion Deblurring

EvBS:用于域自适应运动去模糊的事件引导模糊合成

Junsik Jung, Seokryun Choi, Yoonki Cho, Woo Jae Kim, Andrew Jeong, Sung-Eui Yoon

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出事件引导模糊合成框架EvBS,通过解耦运动与内容生成多样训练对,提升预训练去模糊模型的域自适应性能,经多基准实验验证其可增强模型在未见测试集上的鲁棒性。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

URL PDF HTML 收藏
2608.08009 2026-08-11 cs.CV cs.AI 新提交

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

基于证据的取证推理:检测与定位多模态媒体篡改

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。

Comments accepted by ACM MM 2026

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.07932 2026-08-11 cs.CV 新提交

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.00536 2026-08-11 cs.CV 版本更新

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

DocPO:通过定制化的步骤感知奖励推进文档策略优化

Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang

机构 * Tencent Hunyuan(腾讯混元)

AI总结 本研究针对文档解析强化学习中奖励区分度不足的问题,提出 Step-Aware Annealing 机制,构建 DocPO 框架并在 OmniDocBench 等数据集上验证了其对 GRPO 式 RL 的性能提升效果。

Comments 14 pages. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026). Yunhao Wang and Binghong Wu contributed equally. Updated to the final camera-ready version with supplementary material

URL PDF HTML 收藏
2607.24721 2026-08-11 cs.CV 版本更新

DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

DreamStyle3D:通过双注意力解缠实现高效3D风格化资产生成

Kai Wang, Ziheng Ouyang, Xuying Zhang, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, Nankai University(视觉计算与图像处理实验室,南开大学) JD Explore Academy(京东探索研究院) AAIS, Nankai University(人工智能学院,南开大学)

AI总结 针对高效生成风格化3D资产的需求,DreamStyle3D基于解耦双交叉注意力机制,明确分离几何与风格特征,采用轻量级训练策略,构建数据集和数据管道,能在10秒内生成高质量、几何一致的风格化3D资产,提升了效率并为3D创作提供新方案。

Comments ACM MM 2026; Project Page:https://nkwangk.github.io/project/DreamStyle3D/

URL PDF HTML 收藏
2604.26519 2026-08-11 cs.CV 版本更新

GIFGuard: Proactive Forensics against Deepfakes in Facial GIFs via Spatiotemporal Watermarking

GIFGuard:通过时空水印实现面向面部GIF的主动取证对抗深度伪造

Shupeng Che, Zhiqing Guo, Changtao Miao, Dan Ma, Gaobo Yang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

AI总结 本文提出GIFGuard,首个针对GIF中深度伪造的时空水印框架,通过STARE和DIRD实现高鲁棒性取证,构建GIFfaces基准数据集以促进研究。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2604.23957 2026-08-11 cs.CV 版本更新

LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization

LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位

Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) UNSW Sydney(新南威尔士大学悉尼分校) School of Information and Communication Technology(信息与通信技术学院) Griffith University(格里菲斯大学)

AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

URL PDF HTML 收藏
2604.03919 2026-08-11 cs.CV cs.AI 版本更新

Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders

通过时空稀疏自编码器解释视频表示

Atahan Dokme, Sriram Vishwanath

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文系统研究了稀疏自编码器在视频表示中的应用,提出时空对比目标和Matryoshka分组方法,提升时间一致性并改进动作分类和文本-视频检索性能。

Comments 9 pages, 3 figures. Camera-ready version, ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

URL PDF HTML 收藏
2512.11534 2026-08-11 cs.CV cs.CL cs.MM 版本更新

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

HFS: 为高效视频推理的全局查询感知帧选择

Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。

Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2508.04224 2026-08-11 cs.CV 版本更新

SplitGaussian: Reconstructing Dynamic Scenes via Visual Geometry Decomposition

SplitGaussian:通过视觉几何分解重建动态场景

Lechao Cheng, Jiahui Li, Jingxuan He, Shengeng Tang, Gang Huang, Tianrui Hui, Yaxiong Wang, Zhun Zhong

AI总结 SplitGaussian将场景表示分解为静态与动态分量,解耦运动建模与背景几何,提升动态场景重建的时间一致性、保真度与收敛速度,性能优于现有SOTA方法。

Comments version 2. Accepted By ACM MM 2026

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

URL PDF HTML 收藏
2608.07417 2026-08-10 cs.CV cs.AI 新提交

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

URL PDF HTML 收藏
2608.07340 2026-08-10 cs.CV cs.AI 新提交

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

H2AL:用于基于配准的小样本医学图像分割的双曲层次感知聚合学习

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng

机构 * Dalian University of Technology(大连理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 针对基于配准的小样本医学图像分割忽视解剖结构层次的问题,提出H2AL框架,通过H2I模块与梯度聚合算法提升配准和分割性能,实验验证其有效性。

Comments 10 pages, 9 figures. Accepted at ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.06981 2026-08-10 cs.CV 新提交

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026

URL PDF HTML 收藏
2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

URL PDF HTML 收藏
2608.06165 2026-08-10 cs.SD cs.AI cs.MM 版本更新

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)

URL PDF HTML 收藏
2607.12756 2026-08-10 cs.CV 版本更新

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

URL PDF HTML 收藏
2603.27723 2026-08-10 cs.LG 版本更新

TMTE: Effective Multimodal Graph Learning with Task-aware Modality and Topology Co-evolution

TMTE: 有效多模态图学习中的任务感知模态与拓扑共进化

Yinlin Zhu, Xunkai Li, Di Wu, Wang Luo, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University(中山大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出TMTE框架,通过任务感知的模态与拓扑共进化方法,解决多模态图学习中图拓扑质量不足的问题,实现多视角度量学习与跨模态对齐,提升下游任务性能。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.06236 2026-08-07 cs.CV cs.AI 新提交

Depth-Guided Video Object Counting in Crowded Scenes

拥挤场景中基于深度引导的视频目标计数

Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。

Comments Accepted at ACM Multimedia 2026

URL PDF HTML 收藏
2608.06102 2026-08-07 cs.NI cs.MM 新提交

MultiMoQ: Multi-Access Media-Over-QUIC for Robust Immersive Video Streaming

MultiMoQ:面向鲁棒沉浸式视频流的多接入媒体传输 QUIC

Yitong Li, Xinjiao Li, Ruonan Chai, Dirk Kutscher

AI总结 本文提出基于MoQ的多接入分块流框架MultiMoQ,通过重新设计传输机制提升沉浸式视频流的鲁棒性,经仿真验证其在吞吐量、延迟及播放连续性上优于DASH和标准MoQ。

Comments 9 pages, 15 figures. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)

URL PDF HTML 收藏
2608.05848 2026-08-07 cs.CV 新提交

DTRNet: Dual Text-Radical Decoding for Handwritten Chinese Text Recognition with Faked Character Detection

DTRNet:用于手写中文文本识别及伪造字符检测的双文本-偏旁解码框架

Runrui Li, Lin Zhu, Hua Huang

AI总结 针对教育场景中手写中文文本识别需检测伪造字符的需求,本文提出DTRNet框架,通过解耦文本识别与结构验证,实现高效且可解释的伪造字符检测,效果显著。

Comments Accepted by ACM MM 2026 (Oral)

URL PDF HTML 收藏
2608.05769 2026-08-07 cs.CV 新提交

Flow-Map Distillation on Relation Manifolds for Image Restoration

面向图像复原的关系流形上的流图蒸馏

Zihao He, Songhua Liu

AI总结 本文提出FoRM方法,将关系知识迁移转化为关系流形上的流图映射问题,通过安全半群一致性约束等优化,在5项图像复原任务上降低训练方差约50%,性能优于现有蒸馏基线。

Comments 9 pages, 7 figures. Accepted to ACM Multimedia 2026

URL PDF HTML 收藏