arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1940
2509.00859 2025-09-09 cs.CV

Quantization Meets OOD: Generalizable Quantization-aware Training from a Flatness Perspective

Jiacheng Jiang, Yuan Meng, Chen Tang, Han Yu, Qun Li, Zhi Wang, Wenwu Zhu

机构 * SIGS, Tsinghua University(清华大学信息科学技术系) Key Laboratory of Pervasive Computing, Ministry of Education(教育部 pervasive 计算重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) MMLab, The Chinese University of Hong Kong(香港中文大学 MMLab)

Journal ref Proc. of the 33rd ACM International Conference on Multimedia (MM '25), Dublin, Ireland, October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18977 2025-09-09 cs.CV cs.LG

CGCOD: Class-Guided Camouflaged Object Detection

Chenxi Zhang, Qing Zhang, Jiayun Wu, Youwei Pang

机构 * Shanghai Institute of Technology(上海理工大学) Dalian University of Technology(大连理工大学)

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), 2025, Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04844 2025-09-08 cs.MM cs.AI cs.IR

REMOTE: A Unified Multimodal Relation Extraction Framework with Multilevel Optimal Transport and Mixture-of-Experts

Xinkui Lin, Yongxiu Xu, Minghao Tang, Shilong Zhang, Hongbo Xu, Hao Xu, Yubin Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04159 2025-09-05 cs.AI cs.CL

Towards an Action-Centric Ontology for Cooking Procedures Using Temporal Graphs

Aarush Kumbhakern, Saransh Kumar Gupta, Lipika Dey, Partha Pratim Das

机构 * Ashoka University(阿什oka大学)

Comments 6 pages, 3 figures, 1 table, 11 references, ACM International Conference on Multimedia 2025 - Multi-modal Food Computing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04118 2025-09-05 eess.IV cs.AI

EHVC: Efficient Hierarchical Reference and Quality Structure for Neural Video Coding

Junqi Liao, Yaojun Wu, Chaoyi Lin, Zhipin Deng, Li Li, Dong Liu, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学)

Comments 9 pages, 8 figures, Accepted to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04051 2025-09-05 eess.IV cs.AI

Neural Video Compression with In-Loop Contextual Filtering and Out-of-Loop Reconstruction Enhancement

Yaojun Wu, Chaoyi Lin, Yiming Wang, Semih Esenlik, Zhaobin Zhang, Kai Zhang, Li Zhang

机构 * Hohai University(河海大学) Bytedance Inc.(字节跳动公司)

Comments 9 pages, 8 figures, Accepted to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03565 2025-09-05 cs.CL cs.MM

ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference

Qi Chen, Jingxuan Wei, Zhuoya Yao, Haiguang Wang, Gaowei Wu, Bihui Yu, Siyuan Li, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03536 2025-09-05 cs.AI cs.HC

PG-Agent: An Agent Powered by Page Graph

Weizhi Chen, Ziwei Wang, Leyang Yang, Sheng Zhou, Xiaoxuan Tang, Jiajun Bu, Yong Li, Wei Jiang

机构 * Zhejiang Key Lab of Accessible Perception \& Intelligent Systems, Zhejiang University Hangzhou China Zhejiang University

Comments Paper accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16117 2025-09-05 cs.AI cs.CL cs.IR

Extending FKG.in: Towards a Food Claim Traceability Network

Saransh Kumar Gupta, Rizwan Gulzar Mir, Lipika Dey, Partha Pratim Das, Anirban Sen, Ramesh Jain

机构 * Ashoka University(阿什瓦克大学) UCI Institute for Future Health(加州未来健康研究所)

Comments 10 pages, 3 figures, 1 table, 45 references, ACM International Conference on Multimedia 2025 - Multi-modal Food Computing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09885 2025-09-05 cs.SD cs.CV eess.AS

Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis

Zihao Liu, Mingwen Ou, Zunnan Xu, Jiaqi Huang, Haonan Han, Ronghui Li, Xiu Li

机构 * Tsinghua University(清华大学)

Comments 15 pages, 7 figures, Accepted to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03409 2025-09-04 cs.SD cs.AI cs.MM

Multi-level SSL Feature Gating for Audio Deepfake Detection

Hoan My Tran, Damien Lolive, Aghilas Sini, Arnaud Delhay, Pierre-François Marteau, David Guennec

机构 * Univ Rennes, IRISA, CNRS(里昂大学、IRISA、CNRS) Univ Bretagne Sud, IRISA, CNRS(布列塔尼南大学、IRISA、CNRS)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06656 2025-09-04 cs.CV cs.LG

Enhancing Diffusion Model Stability for Image Restoration via Gradient Management

Hongjie Wu, Mingqin Zhang, Linchao He, Ji-Zhe Zhou, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(合成视觉基础科学国家重点实验室(四川大学)) Engineering Research Center of Machine Learning(机器学习工程研究中心)

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11128 2025-09-04 cs.CL cs.SD eess.AS

FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching

Hui Wang, Shujie Liu, Lingwei Meng, Jinyu Li, Yifan Yang, Shiwan Zhao, Haiyang Sun, Yanqing Liu, Haoqin Sun, Jiaming Zhou, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19475 2025-09-04 cs.CV astro-ph.GA cs.AI cs.LG

GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis

Ruoqi Wang, Haitao Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院)

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02357 2025-09-03 cs.CV

Category-Aware 3D Object Composition with Disentangled Texture and Shape Multi-view Diffusion

Zeren Xiong, Zikun Chen, Zedong Zhang, Xiang Li, Ying Tai, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学) Nankai University(南开大学) Nanjing University(南京大学)

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01259 2025-09-03 cs.CV

ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization

Thinh-Phuc Nguyen, Thanh-Hai Nguyen, Gia-Huy Dinh, Lam-Huy Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17439 2025-09-03 cs.CV

Investigating Domain Gaps for Indoor 3D Object Detection

Zijing Zhao, Zhu Xu, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03735 2025-09-03 cs.CV

Multi-Agent System for Comprehensive Soccer Understanding

Jiayuan Rao, Zifeng Li, Haoning Wu, Ya Zhang, Yanfeng Wang, Weidi Xie

Comments Accepted by ACM MM 2025; Project Page: https://jyrao.github.io/SoccerAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09012 2025-09-03 cs.CV cs.AI cs.CL cs.MM

Multimodal LLMs Can Reason about Aesthetics in Zero-Shot

Ruixiang Jiang, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

Comments ACM MM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00843 2025-09-03 cs.CV cs.AI

Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion

Xueyang Kang, Zhengkang Xiang, Zezheng Zhang, Kourosh Khoshelham

机构 * University of Melbourne(墨尔本大学)

Comments 26 pages, 30 figures, 2025 ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00752 2025-09-03 cs.CV

Multi-Level CLS Token Fusion for Contrastive Learning in Endoscopy Image Classification

Y Hop Nguyen, Doan Anh Phan Huu, Trung Thai Tran, Nhat Nam Mai, Van Toi Giap, Thao Thi Phuong Dao, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Thong Nhat Hospital(通纳特医院)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00751 2025-09-03 cs.CV

EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions

Dinh-Khoi Vo, Van-Loc Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国家大学科学学院)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08340 2025-09-01 cs.CV cs.AI

Single Domain Generalization for Multimodal Cross-Cancer Prognosis via Dirac Rebalancer and Distribution Entanglement

Jia-Xuan Jiang, Jiashuai Liu, Hongtao Wu, Yifeng Wu, Zhong Wang, Qi Bi, Yefeng Zheng

机构 * Lanzhou University \& Westlake University Lanzhou China Xi'an Jiaotong University Xi'an China Westlake University \& Chinese University of Hong Kong University Hang Zhou, China Southern University of Science Lanzhou University Lanzhou China University of Amsterdam Amsterdam Netherland Westlake University Hangzhou China Lanzhou University \& Westlake University Xi'an Jiaotong University Westlake University \& Chinese University of Hong Kong University Lanzhou University University of Amsterdam Westlake University

Comments Accepted by ACMMM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04061 2025-09-01 cs.CV cs.MM

Consistent and Invariant Generalization Learning for Short-video Misinformation Detection

Hanghui Guo, Weijie Shi, Mengze Li, Juncheng Li, Hao Chen, Yue Cui, Jiajie Xu, Jia Zhu, Jiawei Shen, Zhangze Chen, Sirui Han

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent(腾讯) Soochow University(苏州大学)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21539 2025-09-01 cs.CV

HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones

Hao Ruan, Jinliang Lin, Yingxin Lai, Zhiming Luo, Shaozi Li

机构 * Department of Artificial Intelligence, Xiamen University(人工智能学院,厦门大学)

Comments Accepted by ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20750 2025-08-29 cs.CL

Specializing General-purpose LLM Embeddings for Implicit Hate Speech Detection across Datasets

Vassiliy Cheremetiev, Quang Long Ho Ngo, Chau Ying Kot, Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

Comments Paper accepted at the DHOW Workshop at ACM Multimedia 2025. Code available at https://github.com/idiap/implicit-hsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20546 2025-08-29 cs.MM cs.AI

MM-HSD: Multi-Modal Hate Speech Detection in Videos

Berta Céspedes-Sarrias, Carlos Collado-Capell, Pablo Rodenas-Ruiz, Olena Hrynenko, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(日内瓦研究所)

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20530 2025-08-29 cs.CV

Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection

Mingqian Ji, Jian Yang, Shanshan Zhang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(PCA实验室,计算机科学与工程学院,南京理工大学)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17232 2025-08-29 cs.MM cs.AI cs.CL

A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task

Mashiro Toyooka, Kiyoharu Aizawa, Yoko Yamakata

机构 * The University of Tokyo(东京大学)

Comments Accepted to ACM Multimedia 2025. The dataset are publicly available at: https://huggingface.co/datasets/mashi6n/nhkrecipe-100-anno-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10977 2025-08-29 cs.HC cs.CV

SMARTe-VR: Student Monitoring and Adaptive Response Technology for e-Learning in Virtual Reality

Roberto Daza, Lin Shengkai, Aythami Morales, Julian Fierrez, Katashi Nagao

机构 * BiDA Lab(BiDA实验室) Universidad Autonoma de Madrid(马德里自治大学) Nagao Laboratory(Nagao实验室) Nagoya University(名古屋大学)

Comments 10 pages, 3 figures. Published in ACM Intl. Conf. on Multimedia Workshops (ACM MM Workshops 2025, I2M-MM 25). Also presented at IEEE/CVF Conf. on Computer Vision and Pattern Recognition Workshops (CVPRW) and AAAI Workshop on Artificial Intelligence for Education (AI4EDU)

详情

展开后加载摘要…

URL PDF HTML 收藏