arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

至 收录 1940
2608.03264 2026-08-05 cs.MM cs.CV cs.SD 新提交

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

听而能视:面向视听实例分割的状态感知聆听

Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

AI总结 本文提出 Hear to See(H2S)模型,通过 ASP 和 ADM 机制解决视听实例分割中重叠声源匹配与异步动态跟踪问题,在 AVISeg 数据集上实现 SOTA 性能,mAP 达 48.54,较此前方法提升 7.8%。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2608.03151 2026-08-05 cs.CR cs.HC 新提交

AirKey: Multimodal Acoustic-Assisted WiFi Sensing for Zero-Training Robust PIN Inference

AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知

BaiChuan Wu, Bin Liu, Xiang Zhang, Zhi Liu, Jie Zhang, Chao Liu, Huan Yan, Meng Li, Fusang Zhang

AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

URL PDF HTML 收藏
2608.03047 2026-08-05 cs.CV cs.MM 新提交

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导

Yoshiki Ito

AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。

Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures

URL PDF HTML 收藏
2608.01823 2026-08-05 cs.CV 版本更新

Detail Continuation over a Trustworthy Coarse Scale for Autoregressive Super-Resolution

面向自回归超分辨率的可信粗尺度细节延续

Hongyi Fang, Jiahui Wu, Yichen Yue, Benjia Zhou, Dan Zeng

机构 * Sun Yat-Sen University(中山大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对生成式超分辨率的幻觉问题,提出K2N将全路径自回归生改为k到N的细节延续,直接由LR建立粗尺度状态,仅自回归恢复精细尺度,在标准指标上与VARSR相当,幻觉评估中优势明显。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2607.26097 2026-08-05 cs.CV 版本更新

Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

面向动作识别的基于原子动作的知识引导解缠

Tianci Wu, Siqi Cao, Guangming Zhu, Jiang Lu, Siyuan Wang, Longfei Zhang, Jincai Huang, Jun Sheng, Liang Zhang

机构 * Xidian University(西安电子科技大学) National University of Defense Technology(国防科技大学) Human Institute of Advanced Technologyy(人类高级技术研究院) Shanghai Road Transport Development Center(上海市道路运输发展中心)

AI总结 本文提出KDA方法,用LLMs分解动作标签为原子动作,经KIM和KDM解缠,在多标签动作识别基准上达SOTA性能,且模块可通用集成。

Comments ACMMM 26

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

URL PDF HTML 收藏
2604.25179 2026-08-05 cs.MM 版本更新

Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis

通过双分支重新平衡缓解共享-私有分支不平衡以实现多模态情感分析

Chunlei Meng, Jiabin Luo, Pengbin Feng, Zhenglin Yan, Chengyin Hu, Zhongxue Gan, Chun Ouyang

AI总结 本文提出双分支重新平衡框架,通过解耦共享与私有分支,缓解多模态情感分析中的分支不平衡问题,提升模型鲁棒性。

Comments This study has been Accepted by ACM MM 2026

URL PDF HTML 收藏
2604.11344 2026-08-05 cs.CR cs.CL 版本更新

Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service

基于几何的局部水印技术用于嵌入即服务的版权保护

Zhimin Chen, Xiaojie Liang, Wenbo Xu, Yuxuan Liu, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

AI总结 本文提出GeoMark框架,通过几何感知的局部水印技术,在嵌入即服务中实现鲁棒的版权保护,实验表明其在对抗攻击下保持了高验证稳定性和低误报率。

Comments Accepted to ACM Multimedia 2026 (ACM MM '26)

URL PDF HTML 收藏
2602.00573 2026-08-05 cs.LG cs.CV 版本更新

When Classes Evolve: A Benchmark and Framework for Stage-Aware Class-Incremental Learning

当类别进化:一种面向阶段感知类增量学习的基准和框架

Zheng Zhang, Tao Hu, Xueheng Li, Yang Wang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Dalian University of Technology(大连理工大学) Hefei Institutes of Physical Science, Chinese Academy of Sciences(合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 STAGE通过学习抽象的进化模式,在类增量学习中有效解决类间区分和类内形态适应问题。

Comments 34th ACM International Conference on Multimedia (ACM MM '26)

URL PDF HTML 收藏
2511.19192 2026-08-05 cs.DC 版本更新

MUSE: A Heterogeneity-Aware Multimedia Search Engine for Mobile SoCs

AME:一种高效的异构代理记忆引擎用于智能手机

Xinkui Zhao, Qingyu Ma, Yifan Zhang, Hengxuan Lou, Sai Liu, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

AI总结 AME是一种为智能手机设计的高效异构代理记忆引擎,通过硬件感知的矩阵流水线和调度方案提升内存处理效率,实现更高吞吐量和更低延迟。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). 9 pages, 11 figures

URL PDF HTML 收藏
2608.02258 2026-08-04 cs.CV cs.AI 新提交

Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow

基于稀疏约束修正流的开放集视觉文本取证

Jiangling Zhang, Shuxuan Gao, Zeyu Chen, Yichao Liu, Yu Zhou

AI总结 针对生成式AI视觉文本篡改的开放集取证问题,提出基于SC-RF的生成式检测器,在三基准上F1、IoU优于亚军,零样本性能强,还可用于漏洞分析。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.02236 2026-08-04 cs.CV 新提交

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

GenPrior:释放文本到动作生成先验用于零样本骨骼-based动作识别

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Purple Mountain Laboratories(紫金山实验室)

AI总结 GenPrior是首个利用预训练T2M模型生成先验的ZSAR框架,通过分散门控特征融合和生成原型细化,在NTU-60等数据集上实现零样本及广义零样本动作识别的SOTA性能。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.02216 2026-08-04 cs.CV 新提交

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

用于视觉-语言模型测试时适应的局部间隔恢复

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

机构 * Guangzhou University(广州大学) The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) Jinan University(暨南大学) Pengcheng Laboratory(鹏城实验室)

AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.02214 2026-08-04 cs.CV 新提交

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能

Kaiyuan Pu, Tiantian Yang, Dan Zeng

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)

AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。

Comments ACM MM 2026

URL PDF HTML 收藏
2608.02109 2026-08-04 cs.CV 新提交

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

相同语义,不同路径:面向视觉-文本压缩的自改进对齐

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

机构 * Southeast University(东南大学) Nanjing University(南京大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。

Comments Accepted to ACM Multimedia 2026 (Oral)

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2608.01178 2026-08-04 cs.CV cs.AI 新提交

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments Accepted to ACM Multimedia 2026

URL PDF HTML 收藏
2608.00994 2026-08-04 cs.CV cs.CL 新提交

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

零样本图像描述中合成监督的实体忠实修复

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

机构 * Guangxi University(广西大学) School of Computer, Electronics and Information(计算机与电子信息学院)

AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

URL PDF HTML 收藏
2608.00493 2026-08-04 cs.SD 新提交

Hidden-Domain Routing for All-Type Audio Deepfake Detection

用于全类型音频深度伪造检测的隐藏域路由

Yifan Gao, Yao Tian, Hongbin Suo, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

AI总结 针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.00405 2026-08-04 cs.AI q-bio.GN 新提交

Gene Ontology-Guided Hierarchical Spatial Gene Expression Prediction from Histopathology Images

基于基因本体论(GO)的组织病理图像空间基因表达分层预测

Zhiwen Xu, Xiaoming Yan, Chengkun Wu, Juan Chen, Haoang Chi, Liyang Xu

机构 * National University of Defense Technology(国防科技大学)

AI总结 本研究提出MSGR模型,利用GO的基因功能层级结构作为先验,改进组织病理图像的空间基因表达预测,在9个HEST-1k数据集上验证其性能优于平坦解码方法。

Comments Accepted by ACM MM 2026. Code: https://github.com/NozomiMizore/MSGR

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

URL PDF HTML 收藏
2607.27902 2026-08-04 cs.CV 版本更新

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

机构 * South China University of Technology(华南理工大学) HiThink Research(海思思考研究院)

AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。

Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

URL PDF HTML 收藏
2607.29684 2026-08-03 cs.CV 新提交

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

面向黑暗环境中鲁棒且具备三维感知能力的RGB-NIR成像

Muyao Niu, Mingze Ma, Yifan Zhan, Qingtian Zhu, Zhihang Zhong, Wei Guo, Chang Wen Chen, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Adelaide University(阿德莱德大学) School of Artificial Intelligence (SAI) Shanghai Jiao Tong University(上海交通大学人工智能学院) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对黑暗环境下低光照RGB-NIR成像鲁棒性不足的问题,提出一种无需干净RGB监督、具备三维感知能力的神经模型,可融合含噪RGB与NIR线索恢复干净RGB图像,经合成与真实数据验证效果优越。

Comments ACM Multimedia 2026, Codes and Models: https://github.com/MyNiuuu/3DarkFusion

URL PDF HTML 收藏
2607.29633 2026-08-03 cs.CV 新提交

OASIS: Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting

OASIS:基于3D高斯溅射的遮挡感知单图像手部化身重建

Zhisheng Han, Shiyao Wu, Jiayan Qiu, Yakun Ju, Lu Liu, Le Zhang, Pengfei Feng, Huiyu Zhou, Zheheng Jiang

机构 * University of Leicester(莱斯特大学) University of Exeter(埃克塞特大学) University of Birmingham(伯明翰大学) China University of Geoscience(中国地质大学)

AI总结 本研究提出OASIS框架,通过3D高斯溅射结合可见性条件注意力与网格上特征表示,实现单图像手部化身重建,在视觉保真度、效率及下游应用通用性上优于现有方法。

Comments Accepted to ACM Multimedia 2026. Project page: https://mova-hand.github.io/MOVA/. Code repository: https://github.com/ivyyy77/OASIS

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

URL PDF HTML 收藏