arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

至 收录 136
2608.02214 2026-08-04 cs.CV 新提交

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能

Kaiyuan Pu, Tiantian Yang, Dan Zeng

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)

AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。

Comments ACM MM 2026

URL PDF HTML 收藏
2608.02109 2026-08-04 cs.CV 新提交

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

相同语义,不同路径:面向视觉-文本压缩的自改进对齐

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

机构 * Southeast University(东南大学) Nanjing University(南京大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。

Comments Accepted to ACM Multimedia 2026 (Oral)

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2608.01178 2026-08-04 cs.CV cs.AI 新提交

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments Accepted to ACM Multimedia 2026

URL PDF HTML 收藏
2608.00994 2026-08-04 cs.CV cs.CL 新提交

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

零样本图像描述中合成监督的实体忠实修复

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

机构 * Guangxi University(广西大学) School of Computer, Electronics and Information(计算机与电子信息学院)

AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

URL PDF HTML 收藏
2608.00493 2026-08-04 cs.SD 新提交

Hidden-Domain Routing for All-Type Audio Deepfake Detection

用于全类型音频深度伪造检测的隐藏域路由

Yifan Gao, Yao Tian, Hongbin Suo, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

AI总结 针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.00405 2026-08-04 cs.AI q-bio.GN 新提交

Gene Ontology-Guided Hierarchical Spatial Gene Expression Prediction from Histopathology Images

基于基因本体论(GO)的组织病理图像空间基因表达分层预测

Zhiwen Xu, Xiaoming Yan, Chengkun Wu, Juan Chen, Haoang Chi, Liyang Xu

机构 * National University of Defense Technology(国防科技大学)

AI总结 本研究提出MSGR模型,利用GO的基因功能层级结构作为先验,改进组织病理图像的空间基因表达预测,在9个HEST-1k数据集上验证其性能优于平坦解码方法。

Comments Accepted by ACM MM 2026. Code: https://github.com/NozomiMizore/MSGR

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

URL PDF HTML 收藏
2607.29684 2026-08-03 cs.CV 新提交

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

面向黑暗环境中鲁棒且具备三维感知能力的RGB-NIR成像

Muyao Niu, Mingze Ma, Yifan Zhan, Qingtian Zhu, Zhihang Zhong, Wei Guo, Chang Wen Chen, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Adelaide University(阿德莱德大学) School of Artificial Intelligence (SAI) Shanghai Jiao Tong University(上海交通大学人工智能学院) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对黑暗环境下低光照RGB-NIR成像鲁棒性不足的问题,提出一种无需干净RGB监督、具备三维感知能力的神经模型,可融合含噪RGB与NIR线索恢复干净RGB图像,经合成与真实数据验证效果优越。

Comments ACM Multimedia 2026, Codes and Models: https://github.com/MyNiuuu/3DarkFusion

URL PDF HTML 收藏
2607.29633 2026-08-03 cs.CV 新提交

OASIS: Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting

OASIS:基于3D高斯溅射的遮挡感知单图像手部化身重建

Zhisheng Han, Shiyao Wu, Jiayan Qiu, Yakun Ju, Lu Liu, Le Zhang, Pengfei Feng, Huiyu Zhou, Zheheng Jiang

机构 * University of Leicester(莱斯特大学) University of Exeter(埃克塞特大学) University of Birmingham(伯明翰大学) China University of Geoscience(中国地质大学)

AI总结 本研究提出OASIS框架,通过3D高斯溅射结合可见性条件注意力与网格上特征表示,实现单图像手部化身重建,在视觉保真度、效率及下游应用通用性上优于现有方法。

Comments Accepted to ACM Multimedia 2026. Project page: https://mova-hand.github.io/MOVA/. Code repository: https://github.com/ivyyy77/OASIS

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

URL PDF HTML 收藏
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2607.27761 2026-07-31 cs.LG cs.CV 新提交

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

DAS-PMVC:一种通过双对齐与结构增强实现的部分多视图聚类框架

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

机构 * Dalian University of Technology(大连理工大学) Inspur Group Co., Ltd.(浪潮集团有限公司) China University of Mining and Technology(中国矿业大学) The University of Warwick(华威大学)

AI总结 该研究针对多视图聚类中的部分视图对齐问题,提出DAS-PMVC框架,通过锚点图结构对齐、结构增强特征学习与双对齐策略提升性能,在多数据集上优于现有最先进方法。

Comments 8 pages, 4 figures. Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

URL PDF HTML 收藏
2607.27620 2026-07-31 cs.CV 新提交

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

MedXplore:面向医学成像中可靠且无偏的广义类别发现

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对医学成像中广义类别发现存在的旧类偏差问题,提出MedXplore框架,通过FAAC与ACAM模块优化表征学习,在多基准上实现准确率提升且旧类误报率显著降低。

Comments accepted by ACM MM 26

URL PDF HTML 收藏
2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

URL PDF HTML 收藏
2607.26541 2026-07-30 cs.SD cs.CL 新提交

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

音频大语言模型中基于韵律的越狱:一项对照研究与机制分析

Jiachen Qian, Junyu Li

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。

Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

URL PDF HTML 收藏
2607.25392 2026-07-29 cs.CV 新提交

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试

Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室) College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 介绍用于RGB-D视频显著目标检测的大规模基准测试RDVSv2,其规模大、场景多样。基于SAM2建立强大基线,采用参数高效微调策略联合编码多模态线索,该基线在RDVSv2及现有基准测试中达最优,为相关研究提供资源。

Comments Accepted to ACMMM 2026

URL PDF HTML 收藏
2607.25108 2026-07-29 cs.CV cs.AI cs.LG eess.IV 新提交

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

OPERA:用于通用生物医学图像分析的离线策略引导专家路由与适应

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong

机构 * University of Washington(华盛顿大学) Delft University of Technology(代尔夫特理工大学) Xiamen University(厦门大学)

AI总结 研究针对生物医学图像分析中分布变化阻碍模型部署的问题,提出OPERA多智能体集成框架,通过离线策略学习专家权重分配,结合多种机制协调智能体,经多数据集评估,有效提升性能与校准质量,为可部署生物医学AI提供实用路径。

Comments Accepted by ACM MM 2026. 18 pages

URL PDF HTML 收藏
2607.24607 2026-07-28 cs.IR 新提交

One Graph, Multiple Gains: Single High-Quality Item-Item Graph for Multimodal Recommendation

一图多益:用于多模态推荐的单个高质量物品-物品图

Jinfeng Xu, Zheyu Chen, Ziyue Peng, Shuo Yang, Jinze Li, Zewei Liu, Shujie Li, Yipeng Du, Edith C. H. Ngai

AI总结 研究多模态推荐中物品-物品图构建及应用,提出IIMRec框架构建高质量图,通过融合信号和NCER优化,并在推荐三阶段重用,以RIG、内容引导UI图扩展、INA三种方式使用,实验证明其性能优于基线,冷启动等条件下效果更佳。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.24430 2026-07-28 cs.HC cs.CL eess.AS 新提交

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

让我看着你:用于对话语音合成的高级面部表情建模

Yifan Hu, Shuwei He, Rui Liu, Haizhou Li

AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。

Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

URL PDF HTML 收藏
2607.23245 2026-07-28 cs.MM cs.LG 新提交

FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing Modalities

FedTaste:用于具有缺失模态的多模态联邦学习的拓扑感知结构转移

Haochen Liang, Jie Zhang, Hideya Ochiai

AI总结 针对多模态联邦学习中模态缺失和数据分布问题,提出FedTaste框架,利用冻结基础模型提取联合多模态拓扑,结合模态自适应结构提示等方法,避免显式模态插补,在多数据集和非IID设置下性能优越且通信开销低。

Comments Accepted to ACM Multimedia (ACM MM) 2026

URL PDF HTML 收藏