arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1940
2512.11301 2025-12-15 cs.CV

MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction

MultiEgo: 一种多视角第一人称视频数据集用于4D场景重建

Bate Li, Houqiang Zhong, Zhengxue Cheng, Qiang Hu, Qiang Wang, Li Song, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) VisionStar Information Technology (Shanghai) Co., Ltd.(VisionStar信息科技(上海)有限公司)

AI总结 MultiEgo是首个多视角第一人称视频数据集,用于4D动态场景重建,包含五个社交互动场景,提供高精度姿态标注和亚毫秒级时间同步,适用于自由视角视频应用。

Comments ACM MM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09335 2025-12-12 cs.CV cs.MM

Relightable and Dynamic Gaussian Avatar Reconstruction from Monocular Video

可重照明和动态高斯人偶重建从单目视频

Seonghwa Choi, Moonkyeong Choi, Mingyu Jang, Jaekyung Kim, Jianfei Cai, Wen-Huang Cheng, Sanghoon Lee

机构 * Yonsei University(延世大学) Monash University(莫纳什大学) National Taiwan University(国立台湾大学)

AI总结 本文提出了一种基于3DGS的人偶建模框架RnD-Avatar,通过动态皮肤权重和新的正则化方法实现高保真几何细节,支持在任意光照条件下进行逼真渲染和重照明。

Comments 8 pages, 9 figures, published in ACM MM 2025

Journal ref In Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p. 7405-7414

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07005 2025-12-09 cs.SD cs.AI

Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition

多语调普通话干声唱Dataset:歌唱语调识别基准

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学) Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学)

AI总结 本文提出多语调普通话干声唱语料库,用于评估语音模型在歌唱场景中的表现,并探讨方言和元音对语调变化的影响。

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12714-12721, October 27, 2025. Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03540 2025-12-08 cs.CV cs.AI

CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation

CookAnything: 一个灵活且一致的多步骤食谱图像生成框架

Ruoxuan Zhang, Bin Wen, Hongxia Xie, Yi Yao, Songhan Zuo, Jian-Yu Jiang-Lin, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

AI总结 CookAnything通过引入步骤式区域控制、灵活RoPE和跨步骤一致性控制,实现了灵活且一致的多步骤食谱图像生成,提升复杂烹饪指令的视觉合成质量。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19051 2025-12-05 cs.CV cs.AI cs.MM

Multimodal Markup Document Models for Graphic Design Completion

多模态标记文档模型用于图形设计完成

Kotaro Kikuchi, Ukyo Honda, Naoto Inoue, Mayu Otani, Edgar Simo-Serra, Kota Yamaguchi

机构 * Waseda University(早稻田大学)

AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。

Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18751 2025-12-04 cs.CL

Robust Multimodal Sentiment Analysis of Image-Text Pairs by Distribution-Based Feature Recovery and Fusion

基于分布的特征恢复与融合的鲁棒多模态图像-文本对情感分析

Daiqing Wu, Dongbao Yang, Yu Zhou, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) TMCC, College of Computer Science, Nankai University(TMCC,南开大学计算机学院)

AI总结 本文提出DRF方法,通过特征队列和分布估计,实现对图像-文本对中低质量和缺失模态的鲁棒情感分析。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03566 2025-12-04 cs.CV cs.MM

GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models

通过文本引导的扩散模型生成拟人化物体:GAOT

Hao Sun, Lei Fan, Donglin Di, Shaohui Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

AI总结 GAOT通过文本引导的扩散模型和超图学习,实现从文本提示到拟人化物体的生成,取得优于现有方法的性能。

Comments Accepted by ACM MM Asia2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05068 2025-12-02 cs.CV cs.AI cs.CR

ICAS: Detecting Training Data from Autoregressive Image Generative Models

ICAS: 从自回归图像生成模型中检测训练数据

Hongyao Yu, Yixiang Qiu, Yiheng Yang, Hao Fang, Tianqu Zhuang, Jiaxin Hong, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) Shenzhen ShenNong Information Technology Co., Ltd.(深圳深农信息技术有限公司)

AI总结 ICAS通过隐含分类和自适应得分聚合策略,从自回归图像生成模型中检测训练数据,揭示了大型模型的脆弱性,并展示了在不同场景下的有效性。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16267 2025-12-01 cs.CV

Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space

红外与可见图像融合中的语言驱动损失在CLIP嵌入空间中

Yuhao Wang, Lingjuan Miao, Zhiqiang Zhou, Lei Zhang, Yajun Qiao

机构 * School of Automation\ Institute of Technology Beijing China School of Automation\ Institute of Technology

AI总结 本文提出一种基于语言驱动损失的IVIF方法,利用CLIP嵌入空间实现融合目标与输入图像模态的关系建模,提升融合性能。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22033 2025-12-01 cs.AI

Pathology-Aware Prototype Evolution via LLM-Driven Semantic Disambiguation for Multicenter Diabetic Retinopathy Diagnosis

基于LLM驱动语义消歧的病理感知原型演化用于多中心糖尿病视网膜病变诊断

Chunzheng Zhu, Yangfang Lin, Jialin Shao, Jianxin Lin, Yijun Wang

机构 * Hunan University(湖南大学)

AI总结 本文提出HAPM框架,通过整合细粒度病理描述和临床知识,提升多中心糖尿病视网膜病变诊断的准确性。

Comments ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21977 2025-12-01 cs.CV

Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition

动作至关重要:用于基于骨骼的微动作识别的运动引导调制网络

Jihao Gu, Kun Li, Fei Wang, Yanyan Wei, Zhiliang Wu, Hehe Fan, Meng Wang

机构 * University College London(伦敦大学学院) ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院、合肥综合性国家科学中心) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)

AI总结 本文提出运动引导调制网络MMN,通过骨骼和帧级运动线索调制提升微动作识别的准确性。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17103 2025-11-24 cs.CV

Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs

弥合视觉情感差距:通过学习噪声图像-文本对借用文本知识

Daiqing Wu, Dongbao Yang, Yu Zhou, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) TMCC, College of Computer Science, Nankai University(TMCC,南开大学计算机学院)

AI总结 本文提出通过学习噪声图像-文本对中的文本知识,弥合视觉情感识别中的情感差距,提升预训练视觉模型的情感感知能力。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00998 2025-11-18 cs.CV cs.AI

FBSDiff: Plug-and-Play Frequency Band Substitution of Diffusion Features for Highly Controllable Text-Driven Image Translation

Xiang Gao, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

Comments Accepted conference paper of ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10112 2025-11-14 cs.SD

FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features

Wenyu Wang, Zhetao Hu, Yiquan Zhou, Jiacheng Xu, Zhiyu Wu, Chen Li, Shihao Li

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) AI Platform Department, bilibili(bilibili人工智能平台部) School of Software Engineering, East China Normal University(华东师范大学软件工程学院) School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Division of Music and Audio, Union Wheatland Culture and Media Ltd.(Union Wheatland Culture and Media Ltd.音乐与音频部)

Comments Accepted by ACMMM-Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09878 2025-11-14 cs.CV

RWKV-PCSSC: Exploring RWKV Model for Point Cloud Semantic Scene Completion

Wenzhe He, Xiaojun Chen, Wentang Chen, Hongyu Wang, Ying Liu, Ruihui Li

机构 * Hunan University College of Computer Science(湖南大学计算机科学学院) Hunan Normal University College of Information Science(湖南师范大学信息科学学院) Hunan University(湖南大学) Hunan Normal University(湖南师范大学)

Comments 13 pages, 8 figures, published to ACM MM

Journal ref Proc. 33rd ACM Int. Conf. Multimedia (MM '25), Dublin, Ireland, 2025, pp. 161-170

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11171 2025-11-12 cs.CV

SPHERE: Semantic-PHysical Engaged REpresentation for 3D Semantic Scene Completion

Zhiwen Yang, Yuxin Peng

机构 * Peking University(北京大学)

Comments 10 pages, 6 figures, accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23755 2025-11-11 cs.CV

Slot Attention with Re-Initialization and Self-Distillation

Rongzhen Zhao, Yi Zhao, Juho Kannala, Joni Pajarinen

机构 * Department of Electrical Engineering and Automation(电气工程与自动化系) Aalto University(阿尔托大学) Department of Computer Science(计算机科学系) Center for Machine Vision and Signal Analysis(机器视觉与信号分析中心) University of Oulu(奥卢大学)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20263 2025-11-11 cs.CV

Vector-Quantized Vision Foundation Models for Object-Centric Learning

Rongzhen Zhao, Vivienne Wang, Juho Kannala, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Oulu(奥卢大学)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14245 2025-11-10 cs.CV cs.CL

Towards Explainable Fake Image Detection with Multi-Modal Large Language Models

Yikun Ji, Yan Hong, Jiahui Zhan, Haoxing Chen, jun lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

Comments Accepted to ACM MM 2025; 14 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05034 2025-11-10 cs.CV cs.AI

Dynamic Residual Encoding with Slide-Level Contrastive Learning for End-to-End Whole Slide Image Representation

Jing Jin, Xu Liu, Te Gao, Zhihong Shi, Yixiong Liang, Ruiqing Zheng, Hulin Kuang, Min Zeng, Shichao Kan

机构 * School of Computer Science and Enginecring, Central South University(计算机科学与工程学院,中南大学) School of Computer Science(计算机科学学院) Enginecring, Central South University(工程学院,中南大学)

Comments 8pages, 3figures, published to ACM Digital Library

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21529 2025-11-07 cs.CV

Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance

Mengling Xu, Ming Tao, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03425 2025-11-06 cs.SD cs.LG cs.MM

SyMuPe: Affective and Controllable Symbolic Music Performance

Ilya Borovik, Dmitrii Gavrilev, Vladimir Viro

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Peachnote GmbH(Peachnote公司)

Comments ACM Multimedia 2025. Extended version with supplementary material

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland, pp. 10699-10708

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13220 2025-11-06 eess.AS cs.SD

MEDIC: Zero-shot Music Editing with Disentangled Inversion Control

Huadai Liu, Jialei Wang, Xiangtai Li, Wen Wang, Qian Chen, Rongjie Huang, Yang Liu, Jiayang Xu, Zhou Zhao

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) ByteDance Inc.(字节跳动公司)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12932 2025-11-05 cs.SD cs.MM

Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuwen Pu, Qingming Li, Tianyu Du, Shouling Ji

机构 * College of Computer Science Technology, Zhejiang University Hangzhou China School of Big Data \& Software Engineering, Chongqing University Chongqing China Technology, Zhejiang University School of Big Data \& Software Engineering, Chongqing University

Comments Accepted by ACM MM 2025, Open-sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06534 2025-11-05 cs.RO cs.AI

MetAdv: A Unified and Interactive Adversarial Testing Platform for Autonomous Driving

Aishan Liu, Jiakai Wang, Tianyuan Zhang, Hainan Li, Jiangfan Liu, Siyuan Liang, Yilong Ren, Xianglong Liu, Dacheng Tao

机构 * Beihang University, Beijing, China(北航大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Institute of Dataspace, Hefei, China(数据空间研究所,合肥,中国) Nanyang Technological University, Singapore, Singapore(南洋理工大学,新加坡,新加坡)

Comments ACM MM 2025 Most Popular Demo Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09451 2025-11-05 cs.CV

FractalForensics: Proactive Deepfake Detection and Localization via Fractal Watermarks

Tianyi Wang, Harry Cheng, Ming-Hui Liu, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Shandong University(山东大学)

Comments ACM Multimedia 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16800 2025-11-04 cs.CV

Phys4DGen: Physics-Compliant 4D Generation with Multi-Material Composition Perception

Jiajing Lin, Zhenzhong Wang, Dejun Xu, Shu Jiang, YunPeng Gong, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

Comments Accepted by ACM MM 2025. Project Page: https://jiajinglin.github.io/Phys4DGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05227 2025-11-04 cs.RO cs.CV cs.LG cs.MM cs.SY eess.SY

NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving

Qucheng Peng, Chen Bai, Guoxiang Zhang, Bo Xu, Xiaotong Liu, Xiaoyin Zheng, Chen Chen, Cheng Lu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26759 2025-10-31 eess.IV cs.CV cs.MM

MORE: Multi-Organ Medical Image REconstruction Dataset

Shaokai Wu, Yapan Guo, Yanbiao Ji, Jing Tong, Yuxiang Lu, Mei Li, Suizhi Huang, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Suzhou Xiangcheng People’s Hospital(苏州湘城人民医院)

Comments Accepted to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏