arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-29 至 2026-07-29 共收录 3
2607.17761 2026-07-29 cs.SD cs.AI 版本更新

Time-Frequency Consistency Learning for Robust Speech Deepfake Detection

用于鲁棒语音深度伪造检测的时频一致性学习

Jun Xue, Zhuolin Yi, Yanzhen Ren, Yihuan Huang, Jiayu Xiong, Yi Chai, Guanxiang Feng, Jiajun Liu, Tong Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) Tongji university(同济大学)

AI总结 研究语音深度伪造检测在实际部署中因声学前端处理管道失真导致鲁棒性不足的问题,提出时频一致性学习框架,通过注意力驱动软对齐机制和频域结构一致性约束,提升检测模型在实际场景中的鲁棒性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏