arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-09-01 至 2026-09-01 共收录 11
2608.29021 2026-09-01 eess.AS 新提交

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

超越语音:用于统一全类型音频深度伪造检测的双域自监督学习融合方法

Cunhang Fan, Junqin Cao, Tian Gao, Zhipeng Xie, Jun Xue, Zhao Lv, Xin Fang

AI总结 针对未知音频类型的全类型音频深度伪造检测难题,本文提出双域SSL融合方法,结合EAT-large与wav2vec 2.0 XLS-R-300M特征,在AT-ADD挑战赛赛道2获95.58%宏F1值且排名第二。

Comments 8 pages, 5 figures; accepted to the AT-ADD Grand Challenge at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30870 2026-09-01 cs.CV 新提交

VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement

VCAR:基于视图完整性和轴感知边界优化的无需训练的3D高斯溅射(3DGS)分割方法

Kun Cao, Di Wang, Haibin Zhu, Haozhi Huang, Xu Wang, Zheng Shi, Guanghua Yang

机构 * Jinan University(暨南大学)

AI总结 VCAR是一种无需训练的3DGS分割策略,通过粗阶段的可见性加权多视图投票、细阶段的球形螺旋采样补充视角及轴感知边界优化,在NVOS和LERF数据集上实现了最优的分割精度与效率。

Comments Accepted to the 34th ACM International Conference on Multimedia (MM '26). 16 pages, 11 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30672 2026-09-01 cs.AI cs.MA cs.MM 新提交

HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

HiRS-Agent:用于可靠长时程遥感任务解决的分层多智能体系统

Boyang Mu, Zhiwei Wei, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

AI总结 本文提出HiRS-Agent分层多智能体系统,通过两层协作架构与优化策略,在Earth-Agent Benchmark和ThinkGeo上提升了长时程遥感任务的工具使用能力与正确性。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30233 2026-09-01 cs.CV 新提交

Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

面向通用视觉 grounding 的语义-空间判别性增强

Kaiyan Lei, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文针对通用视觉 grounding 任务中易混淆相似目标的问题,提出 SSDE 框架,含 SeDE 与 SpDE 模块,在十个数据集上取得优异性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29220 2026-09-01 cs.CV 新提交

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29121 2026-09-01 cs.CV 新提交

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

基于声学接地代价学习的开放词汇视听语义分割

Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Cardiff University(卡迪夫大学) University of Macau(澳门大学)

AI总结 针对开放词汇视听语义分割的现有方法缺陷,提出AGCL框架及AMCG、AGTA、SDM模块,在AVSBench-OV数据集上显著优于现有SOTA方法,尤其在未见类别上表现突出。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29054 2026-09-01 cs.AI 新提交

Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL

让提示桥接防御知识:通过漏洞感知GPL实现可迁移图净化

Shuomin Xue, Jingyuan Li, Ju Jia, Jingxuan Yu, Xiaojun Jia

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有图对抗净化方法领域受限的缺陷,提出ProGAP方案,通过漏洞感知图提示学习实现可迁移图净化,性能提升1%-9%且时间消耗最多减少2.2倍。

Comments To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 7 figures, and 4 tables. Shuomin Xue and Jingyuan Li contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28802 2026-09-01 cs.CV cs.AI 新提交

A Large-scale Evaluation of Text-guided Models for Facial Editing

文本引导的人脸编辑模型的大规模评估

Rahul Nair, Saurav Pandit, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Prelight Inc(普雷莱特公司)

AI总结 本研究对6种文本引导模型开展首次大规模人脸编辑评估,构建含169个属性的Face-Edit-Attributes数据集,发现多数模型头发配饰编辑表现好但姿态编辑差,存在过度编辑及针对深色皮肤男性和老年面孔的偏差。

Comments ACM Multimedia (ACMMM) 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28630 2026-09-01 cs.CL cs.AI cs.SD 新提交

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

通过广义风格感知全双工框架实现主动口语话轮

Tianrui Pan, Qinglin Zhang, Chong Deng, Luyao Cheng, Qian Chen, Wen Wang, Jie Tang, Gangshan Wu, Jie Liu

机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)

AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏