arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 2091 篇
2609.36832 2026-09-30 cs.CV 新提交

Motion Concept Unlearning in Video Diffusion Models

视频扩散模型中的运动概念遗忘

Ping Liu, Chi Zhang

机构 * University of Nevada, Reno(内华达大学雷诺分校) ; National University of Singapore(新加坡国立大学)

AI总结 针对T2V扩散模型中的运动概念擦除问题,提出无需训练的MUTE方法,通过令牌中和提取概念方向、空间门控和速度修正实现概念特异性、空间选择性与时间自然性,在多个模型上优于现有基线。

Comments Accepted to ACM MM 2026. Dr. Chi Zhang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36815 2026-09-30 cs.CV 新提交

CurvSpec: Adaptive Multi-Curvature Learning for Partial Relevant Video Retrieval

CurvSpec:面向部分相关视频检索的自适应多曲率学习

Zhen Liu, Letian Li, Jinpeng Wang, Shuzhao Xie, Yuzhi Huang, Jingyan Jiang, Zhi Wang

机构 * Tongji University(同济大学) ; SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 CurvSpec提出内容自适应曲率学习框架,通过并行欧几里得与双曲注意力及语义质心匹配,解决部分相关视频检索中的信号稀释与曲率刚性挑战,在三个基准上达到最优性能。

Comments 10 pages. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36562 2026-09-30 cs.CV cs.AI cs.LG 新提交

ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

ThinkingGuard:在多模态大语言模型中通过逐步风险归因解码隐含危害

Ruochen Zhang, Yao Huang, Yitong Sun, Jiahe Xie, Jin Yan, Jifan Ma, Yuanfang Guo, Xingxing Wei

机构 * Beihang University(北京航空航天大学) ; Tsinghua University(清华大学) ; State Key Laboratory of AI Safety(人工智能安全国家重点实验室)

AI总结 本文提出ThinkingGuard,一种通过逐步风险归因和结构化推理训练来检测多模态大语言模型中隐含危害的防护模型,并构建了首个风险组合性数据集TriggerBench。

Comments 9 pages, 4 figures, accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35775 2026-09-30 cs.HC cs.MM 新提交

SPECTRA: On-Device Cognitive Perturbation and Trajectory Analysis for Autonomous Edge-Cloud GUI Grounding

SPECTRA:面向自主边缘-云GUI接地(GUI Grounding)的端侧认知扰动与轨迹分析

Zhan Qu, Hui Zang, Ran Chen, Tao Wang, Shengyu Zhang

AI总结 针对边缘代理在GUI接地中因过度自信幻觉导致请求不可靠的问题,提出SPECTRA框架,通过显著性引导扰动和认知轨迹分析实现无需解码的云端请求评估,在保持高比例云端性能的同时显著降低请求率。

Comments Accepted at ACM MM 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12251 2026-09-30 cs.CV 版本更新

ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models

ArtifactWorld: 通过视频生成模型扩展3D高斯散射体修复

Xinliang Wang, Yifeng Shi, Zhenyu Wu

机构 * Ke Holdings Inc.(凯控股公司) ; Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家研究院) ; Rajiv Gandhi University(拉朱·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 本文提出ArtifactWorld框架,通过系统数据扩展和双模型范式解决3DGS修复问题,利用视频扩散骨干网络和Artifact-Aware Triplet Fusion机制提升稀疏视图合成和3D重建性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.34978 2026-09-29 cs.CV cs.HC 新提交

One Sensor, Whole Body - 3D Body Pose from a Single Consumer Earbud IMU

一个传感器,全身 - 从单个消费级耳塞IMU恢复3D身体姿态

Zhilin Guo, Boqiao Zhang, Oszkár Urbán, Josef Bengtson, Hakan Aktas, Wenzhao Li, Siyu Hong, Kyle Fogarty, Chenliang Zhou, Ali Senguel, Cengiz Oztireli

机构 * University of Cambridge(剑桥大学) ; Chalmers University of Technology(查尔姆斯理工大学)

AI总结 本研究探究单个消费级耳塞IMU能否恢复3D身体姿态,通过构建多模态基准和适配两种循环模型,证明头部IMU可恢复下半身姿态且添加足部IMU无益,指出传感器可靠性而非数量是关键,耳塞为最佳选择。

Comments 5 pages, 2 figures, 2 tables. Accepted at the 6th International Workshop on Human-centric Multimedia Analysis (HUMA '26), ACM Multimedia 2026, Rio de Janeiro, Brazil. Code: https://github.com/ZhilinGuo/one-sensor-whole-body

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.34502 2026-09-29 cs.CV 新提交

SubjectAnchor: Subject-Aware Memory-to-Video for Multi-Shot Storytelling

SubjectAnchor:面向多镜头叙事的主题感知记忆到视频生成

Xinyu Wang, Huafeng Shi, Zian Li, Yan Zhou, Xiaoqiang Liu, Yue Ma, Pengfei Wan

机构 * Kling AI Research(可灵AI研究院)

AI总结 SubjectAnchor提出一种基于显式视觉记忆的主题感知记忆到视频生成范式,通过记忆构建、时间旋转位置编码和注意力分区,在多镜头叙事中保持主题身份与场景一致性,实验验证其跨镜头一致性优于基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.32489 2026-09-29 cs.AI cs.CV 新提交

When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models

当有帮助的文本有害时:视觉语言模型中的选项重定向偏差

Tam Le Thi Thanh, Hoang Tran Van, Hong-Hanh Nguyen-Le, Thanh Duc Ngo

AI总结 本研究揭示视觉语言模型中,与问题一致但违背图像并支持干扰项的辅助文本会系统性重定向模型预测,导致高达53.1%的准确率下降,并提出无需训练的推理时干预方法以缓解此问题。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026). 25 pages, 16 figures. This arXiv version includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31718 2026-09-29 cs.IR cs.AI cs.CL cs.CV 新提交

MM-VeriRec: Failure-Guided Fusion for Verifiable Agentic Multimodal Recommendation

MM-VeriRec:面向可验证智能体多模态推荐系统的失败引导融合方法

Yufeng Wang

AI总结 针对智能体多模态推荐中视觉约束被忽视和不可能任务未被拒绝的问题,提出MM-VeriRec协议与失败引导融合方法,通过确定性属性验证和失败诊断路由,在MM-ML 1M和Amazon Reviews上超越基线,实现可验证的可信推荐。

Comments Accepted at the 1st International Workshop on Agentic Multimodal Intelligence: Models, Benchmarks, and Applications (AMI '26), co-located with ACM Multimedia 2026

Journal ref The 1st International Workshop on Agentic Multimodal Intelligence, co-located with ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05126 2026-09-29 cs.CL cs.MM 版本更新

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Qian Chen, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) ; Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) ; Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01178 2026-09-29 cs.CV cs.AI 版本更新

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Huawei Technologies Ltd(华为技术有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室)

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20258 2026-09-29 cs.CV 版本更新

Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing

重新思考编辑位置:面向任务的指令式图像编辑定位

Jingxuan He, Xiyu Wang, Mengyu Zheng, Xiangyu Zeng, Yunke Wang, Chang Xu

机构 * The University of Sydney(悉尼大学)

AI总结 本文提出一种无需训练的任务感知编辑定位框架,通过分析源和目标图像流,提升非编辑区域一致性并保持指令遵循性能。

Comments Accepted to ACM MM 2026. Project page: https://jessie459.github.io/TAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00717 2026-09-29 cs.CV 版本更新

Smoothing the Semantic Landscape: Generalizable AI-Generated Image Detection via Text-Induced Flatness

利用任意数据源进行AI生成图像检测而不牺牲泛化能力

Qinghui He, Haifeng Zhang, Yanan Luo, Bo Liu, Xiuli Bi, Bin Xiao

机构 * Chongqing Key Laboratory of Image Cognition, Chongqing University of Posts and Telecommunications(重庆邮电大学图像认知重庆市重点实验室) ; School of Computer Science and Technology(计算机科学与技术学院) ; School of Artificial Intelligence(人工智能学院) ; University of Macau(澳门大学) ; Jinan Inspur Data Technology Co., Ltd.(济南浪潮数据技术有限公司)

AI总结 本文提出一种单类属性建模框架,通过构建紧凑的属性空间增强真实与生成图像的差异,提升跨模型泛化能力,实验表明在准确率和跨模型泛化上优于现有检测器。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31247 2026-09-28 cs.CV cs.AI cs.CR cs.MM 新提交

Geometric Inconsistency Localization in Multi-View Image Sets

多视角图像集中的几何不一致性定位

Xander Staelens, Albéric Loos, Bert Ramlot, Hannes Mareen, Peter Lambert, Glenn Van Wallendael

机构 * IDLab, Ghent University - imec(根特大学-imec IDLab)

AI总结 本研究提出DeformView数据集和DEFECt3R分类器,用于在宽基线多视角图像中定位几何不一致性,显著提升取证任务性能并减少误报。

Comments 8 pages, accepted at the Deepfake Forensics Workshop (DFF 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17422 2026-09-28 cs.CV cs.MM 版本更新

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 10 pages, 5 figures. To appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.27461 2026-09-24 cs.CV 新提交

Invisible in Space, Visible in Time: Motion Vision CAPTCHA against GUI Agents

空间不可见,时间可见:面向GUI智能体的运动视觉验证码

Zeyu Zhang, Dingyi Rong, Zijian Chen, Zicheng Zhang, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对GUI智能体,提出基于层次化运动(连贯、结构、生物)的验证码框架MVCAP及基准MVCAP-Bench,人类准确率99.6%而最佳智能体仅16.8%,揭示动态背景伪装造成显著人机感知差距。

Comments Accepted at ACM Multimedia 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26255 2026-09-23 cs.SD 新提交

SceneTTS-Bench: A Benchmark for Scene-Level TTS in Drama Dubbing

SceneTTS-Bench:戏剧配音中的场景级文本转语音基准

Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Yingming Gao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing DeepLogic Intelligence Technology Co., Ltd.(北京深逻辑智能科技有限公司) ; University of California(加利福尼亚大学)

AI总结 针对戏剧配音中文本转语音评估停留在句子级的问题,提出场景级基准SceneTTS-Bench,从音色一致性、情感表现力和节奏连贯性三维度评估,实验表明场景级排名与句子级指标显著不同。

Comments 7 pages, 3 figures; submitted to the ACM Multimedia (ACM MM) 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.25693 2026-09-23 cs.CV 新提交

C2FXNet: Coarse-to-Fine Scene Expert for Unified Object Detection across Adverse Weather

C2FXNet:面向恶劣天气统一目标检测的从粗到细场景专家网络

Tianle Fang, Zhenbing Liu, Chong Yin, Bolun Li, Haoxiang Lu

机构 * Guilin University of Electronic Technology(桂林电子科技大学) ; Hainan University(海南大学)

AI总结 提出C2FXNet,通过从粗到细的场景专家网络实现恶劣天气下的统一目标检测,在多个数据集上超越现有方法。

Comments 10 pages, 8 figures. Accepted at ACM Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24768 2026-09-22 cs.CV cs.AI 新提交

PrismGPT: Proxy-Guided Learning for Region-Aware Photo Editing with Self-Synthesized Reasoning

PrismGPT:基于代理引导学习的自合成推理区域感知照片编辑

Ke Zhao, Hue Nguyen, Abhijith Punnappurath, Zhongling Wang, Iqbal Mohomed, Michael S. Brown

机构 * Samsung Electronics(三星电子)

AI总结 PrismGPT通过代理引导学习(操作分解与区域感知排序)训练视觉-语言模型,自合成推理轨迹,实现区域感知照片编辑,在MIT-Adobe FiveK和SPIRE基准上以6%训练数据达到最先进性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.23376 2026-09-22 cs.MM cs.CV cs.LG cs.SD 新提交

If You Hear It, Help Find It: Orthogonal Knowledge Distillation for Open-Vocabulary Audio-Visual Event Localization

如果你听到它,就帮助找到它:面向开放词汇音频-视觉事件定位的正交知识蒸馏

Yi Xu, Cheng Chen, Wenzhuo Lei

机构 * Tongji University(同济大学)

AI总结 针对开放词汇音频-视觉事件定位中教师监督可靠性差异问题,提出可靠性感知的非对称蒸馏框架OV-OrthKD,通过正交损失分离视觉与音频教师投影,在OV-AVEBench上显著提升定位性能。

Comments Accepted to ACM Multimedia 2026 (poster). 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22327 2026-09-22 cs.MM cs.AI cs.CV 新提交

Visual Graph Reasoning via Knowledge Compilation

视觉图推理:基于知识编译的方法

Rongzheng Wang, Zhe Wang, Ke Qin, Rongwei Wang, Muquan Li, Yizhuo Ma, Yihong Huang, Jielei Wang, Shuang Liang

机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

AI总结 提出VGCompiler,通过表示编译器和操作编译器从图图像中恢复显式图表示并编译查询意图,利用强化学习训练,在多个基准上显著超越现有方法,并泛化至真实世界领域。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22267 2026-09-22 cs.CV cs.MM 新提交

Did You Steal My Shot? Pioneering Camera Motion Plagiarism Detection in Generative Videos

你偷了我的镜头吗?开创生成视频中的相机运动抄袭检测

Chengguo Zhang, Ping Ping

机构 * Hohai University(河海大学)

AI总结 针对生成视频中相机运动抄袭问题,构建首个基准并提出结合涡量线索的光流增强表示,实现比最强基线高3.02倍的检测性能。

Comments Accepted to ACM Multimedia 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22264 2026-09-22 cs.MM cs.AI cs.CV cs.SD eess.AS 新提交

Hi-Singers: A Comprehensive High-Quality Dataset for Expressive Audio-Driven Singing Head Synthesis

Hi-Singers:用于表现力音频驱动歌唱头部合成的高质量综合数据集

Yichi Zhang, Hui Zhang, Guanjun Liu, Yuefeng Zou, Fengzhao Sun, Jun Yu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对歌唱头部合成中语音模型面临的领域差距,提出首个大规模高质量野外数据集Hi-Singers,含29,608个片段约170小时,经严格过滤和基准评估,显著提升视觉真实感、口型同步和节奏动态。

Comments 7 pages, 6 figures, 4 tables. Accepted to the 34th ACM International Conference on Multimedia (MM '26). Dataset: https://huggingface.co/datasets/CharlesZhang-USTC/Hi-Singers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06981 2026-09-22 cs.CV 版本更新

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026 Oral!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09420 2026-09-22 cs.CV cs.AI cs.MM 版本更新

Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery

关系检索:利用已知-新颖相互作用进行通用类别发现

Yulin Xu, Chunqi Guo, Yuanzhen Shuai, Jianyuan Ni

机构 * University of California, Irvine(加州大学尔湾分校) ; Sichuan Agricultural University(四川农业大学) ; University College London(伦敦大学学院) ; Juniata College(朱尼ata学院)

AI总结 本文通过关系检索视角解决通用类别发现问题,提出关系模式一致性方法,通过双向知识转移增强已知类别和新类别发现,实验表明在通用和细粒度基准上均取得最佳性能。

Comments Accepted at ICMR 2026

Journal ref Proceedings of the 2026 ACM International Conference on Multimedia Retrieval (ICMR '26), pp. 410-414, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01661 2026-09-22 cs.CV 版本更新

Single Point, Full Mask: Velocity-Guided Level Set Evolution for End-to-End Amodal Segmentation

单点输入,全掩码生成:速度引导的水平集演化用于端到端非模态分割

Zhixuan Li, Yujia Liu, Chen Hui, Chenyue Song, Weisi Lin

AI总结 针对现有非模态分割依赖密集提示且缺乏可解释性的问题,提出VELA方法,利用速度驱动的水平集演化,通过单点输入实现端到端、透明且几何可解释的轮廓演化,并在多个基准上超越现有方法。

Comments 10 pages, 4 figures. Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21480 2026-09-21 cs.CV 新提交

OpenSAL360: Open-Source Crowdsourcing Platform for Omnidirectional Video Saliency Collection

OpenSAL360:用于全景视频显著性采集的开源众包平台

Alexey Bryncev, Andrey Moskalenko, Kira Shilovskaya, Ivan Kosmynin, Dmitriy Vatolin

机构 * AI Center, Lomonosov Moscow State University(莫斯科国立大学人工智能中心) ; MSU Institute for Artificial Intelligence(莫斯科国立大学人工智能研究所) ; Lomonosov Moscow State University(莫斯科国立大学)

AI总结 针对VR眼动数据采集成本高的问题,提出开源众包平台OpenSAL360,仅需屏幕鼠标即可采集360°视频显著性数据,并发布含500个视频、2000+评估者的最大规模数据集。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21276 2026-09-21 cs.CV cs.AI 新提交

Beyond Exact Match: Task-Aware GRPO for Cross-Domain PCBA Visual Question Answering

超越精确匹配:面向跨领域PCBA视觉问答的任务感知GRPO

Jia Li, Li Dai, Peng Jia, Zhenzhen Hu, Chee Seng Chan, Bingkun Bao, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) ; Universiti Malaya(马来亚大学)

AI总结 针对跨领域PCBA视觉问答,提出任务感知GRPO框架,整合多组件语义奖励与距离感知奖励,结合推理校正,在官方挑战中取得83.24分。

Comments 8 pages, 2 figures. Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.20457 2026-09-18 cs.CR cs.AI 新提交

Fingerprinting Multimodal Large Language Models

多模态大语言模型指纹识别

Chao Huang, Meng Tong, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对多模态大语言模型易受非法部署和蒸馏侵权的问题,提出AttnPrint(基于跨模态注意力低频分量的白盒指纹)和DistillTrace(基于输出假设检验的黑盒审计),在154个模型实例上实现强检测性能与鲁棒性。

Comments 10 pages, 3 figures. Accepted to ACM Multimedia 2026 (MM '26) as an oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.20302 2026-09-18 cs.LG cs.MM 新提交

SAGG: Sample-Adaptive Gradient Gating for Robust Multimodal Learning under Heterogeneous Corruption

SAGG:样本自适应梯度门控用于异构损坏下的鲁棒多模态学习

Wentao Zhang, Yifan Zhu, Yutong Zhang, Wentao Mo

机构 * Tsinghua University(清华大学) ; Sichuan University(四川大学)

AI总结 针对多模态学习中样本级异构损坏问题,提出样本自适应梯度门控(SAGG),通过逐样本二值门控与截断机制实现无偏梯度估计,理论保证收敛性,实验在多个数据集上优于现有方法。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
↑