arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-09-01 至 2026-09-01 共收录 16
2608.29021 2026-09-01 eess.AS 新提交

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

超越语音:用于统一全类型音频深度伪造检测的双域自监督学习融合方法

Cunhang Fan, Junqin Cao, Tian Gao, Zhipeng Xie, Jun Xue, Zhao Lv, Xin Fang

AI总结 针对未知音频类型的全类型音频深度伪造检测难题,本文提出双域SSL融合方法,结合EAT-large与wav2vec 2.0 XLS-R-300M特征,在AT-ADD挑战赛赛道2获95.58%宏F1值且排名第二。

Comments 8 pages, 5 figures; accepted to the AT-ADD Grand Challenge at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30870 2026-09-01 cs.CV 新提交

VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement

VCAR:基于视图完整性和轴感知边界优化的无需训练的3D高斯溅射(3DGS)分割方法

Kun Cao, Di Wang, Haibin Zhu, Haozhi Huang, Xu Wang, Zheng Shi, Guanghua Yang

机构 * Jinan University(暨南大学)

AI总结 VCAR是一种无需训练的3DGS分割策略,通过粗阶段的可见性加权多视图投票、细阶段的球形螺旋采样补充视角及轴感知边界优化,在NVOS和LERF数据集上实现了最优的分割精度与效率。

Comments Accepted to the 34th ACM International Conference on Multimedia (MM '26). 16 pages, 11 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30672 2026-09-01 cs.AI cs.MA cs.MM 新提交

HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

HiRS-Agent:用于可靠长时程遥感任务解决的分层多智能体系统

Boyang Mu, Zhiwei Wei, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

AI总结 本文提出HiRS-Agent分层多智能体系统,通过两层协作架构与优化策略,在Earth-Agent Benchmark和ThinkGeo上提升了长时程遥感任务的工具使用能力与正确性。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30233 2026-09-01 cs.CV 新提交

Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

面向通用视觉 grounding 的语义-空间判别性增强

Kaiyan Lei, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文针对通用视觉 grounding 任务中易混淆相似目标的问题,提出 SSDE 框架,含 SeDE 与 SpDE 模块,在十个数据集上取得优异性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29220 2026-09-01 cs.CV 新提交

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29121 2026-09-01 cs.CV 新提交

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

基于声学接地代价学习的开放词汇视听语义分割

Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Cardiff University(卡迪夫大学) University of Macau(澳门大学)

AI总结 针对开放词汇视听语义分割的现有方法缺陷,提出AGCL框架及AMCG、AGTA、SDM模块,在AVSBench-OV数据集上显著优于现有SOTA方法,尤其在未见类别上表现突出。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29054 2026-09-01 cs.AI 新提交

Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL

让提示桥接防御知识:通过漏洞感知GPL实现可迁移图净化

Shuomin Xue, Jingyuan Li, Ju Jia, Jingxuan Yu, Xiaojun Jia

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有图对抗净化方法领域受限的缺陷,提出ProGAP方案,通过漏洞感知图提示学习实现可迁移图净化,性能提升1%-9%且时间消耗最多减少2.2倍。

Comments To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 7 figures, and 4 tables. Shuomin Xue and Jingyuan Li contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28802 2026-09-01 cs.CV cs.AI 新提交

A Large-scale Evaluation of Text-guided Models for Facial Editing

文本引导的人脸编辑模型的大规模评估

Rahul Nair, Saurav Pandit, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Prelight Inc(普雷莱特公司)

AI总结 本研究对6种文本引导模型开展首次大规模人脸编辑评估,构建含169个属性的Face-Edit-Attributes数据集,发现多数模型头发配饰编辑表现好但姿态编辑差,存在过度编辑及针对深色皮肤男性和老年面孔的偏差。

Comments ACM Multimedia (ACMMM) 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28630 2026-09-01 cs.CL cs.AI cs.SD 新提交

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

通过广义风格感知全双工框架实现主动口语话轮

Tianrui Pan, Qinglin Zhang, Chong Deng, Luyao Cheng, Qian Chen, Wen Wang, Jie Tang, Gangshan Wu, Jie Liu

机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)

AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-09-01 cs.CV 版本更新

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures, accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24622 2026-09-01 cs.CV cs.AI 版本更新

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang

机构 * Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) United Nova Technology(联合Nova技术) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。

Comments Accepted to ACM Multimedia (ACM MM) 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23947 2026-09-01 cs.SD cs.AI cs.MM 版本更新

Variable-Length Audio Fingerprinting

可变长度音频指纹识别

Hongjie Chen, Hanyu Meng, Huimin Zeng, Ryan A. Rossi, Lie Lu, Josh Kimball

机构 * Dolby Laboratory(Dolby实验室) The University of New South Wales(新南威尔士大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出可变长度音频指纹识别方法,解决传统固定长度音频指纹的局限性,提升实时音频识别与检索性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏