arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2411.11435 2025-08-05 cs.CV

GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts

Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Chenyang Li, Hanyuan Chen, Jin-Peng Lan, Bin Luo, Yifeng Geng

机构 * Dalian University of Technology(大连理工大学) Alibaba Group(阿里巴巴集团)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00507 2025-08-04 cs.LG

Court of LLMs: Evidence-Augmented Generation via Multi-LLM Collaboration for Text-Attributed Graph Anomaly Detection

Yiming Xu, Jiarun Chen, Zhen Peng, Zihan Chen, Qika Lin, Lan Ma, Bin Shi, Bo Dong

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(计算机科学与技术学院,西安交通大学) Department of Electrical and Computer Engineering, University of Virginia(电气与计算机工程系,弗吉尼亚大学) Saw Swee Hock School of Public Health, National University of Singapore(Saw Swee Hock 公共卫生学院,新加坡国立大学) China Telecom Corporation Ltd. Shaanxi Branch(中国电信股份有限公司陕西分公司) School of Distance Education, Xi'an Jiaotong University(继续教育学院,西安交通大学)

Comments Accepted by ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00497 2025-08-04 cs.SI

From Individuals to Crowds: Dual-Level Public Response Prediction in Social Media

Jinghui Zhang, Kaiyang Wan, Longwei Xu, Ao Li, Zongfang Liu, Xiuying Chen

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00421 2025-08-04 cs.CV

UIS-Mamba: Exploring Mamba for Underwater Instance Segmentation via Dynamic Tree Scan and Hidden State Weaken

Runmin Cong, Zongji Yu, Hao Fang, Haoyan Sun, Sam Kwong

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) School of Data Science, Lingnan University(数据科学学院,岭南大学)

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00308 2025-08-04 cs.CV

Exploring Fourier Prior and Event Collaboration for Low-Light Image Enhancement

Chunyan She, Fujun Han, Chengyu Fang, Shukai Duan, Lidan Wang

机构 * College of Artificial Intelligence, Southwest University(西南大学人工智能学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23382 2025-08-01 cs.CL cs.AI cs.CV

MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models

Yiyan Ji, Haoran Chen, Qiguang Chen, Chengyue Wu, Libo Qin, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Central South University(中南大学)

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23362 2025-08-01 cs.CV

Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室)

Comments Accepted By ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23307 2025-08-01 cs.CV

ST-SAM: SAM-Driven Self-Training Framework for Semi-Supervised Camouflaged Object Detection

Xihang Hu, Fuming Sun, Jiazhe Liu, Feilong Xu, Xiaoli Zhang

机构 * Jilin University(吉林大学) Dalian Minzu University(大连民族大学)

Comments 10 pages, 6 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23219 2025-08-01 eess.IV cs.CV

Learning Arbitrary-Scale RAW Image Downscaling with Wavelet-based Recurrent Reconstruction

Yang Ren, Hai Jiang, Wei Li, Menglong Yang, Heng Zhang, Zehua Sheng, Qingsheng Ye, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空宇航学院) Xiaomi Inc.(小米公司) University of Electronic Science and Technology of China(电子科技大学)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22477 2025-08-01 cs.CV cs.AI

LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mengfei Shi, Xia Xie, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Hainan University(海南大学)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13373 2025-08-01 cs.CV

Butter: Frequency Consistency and Hierarchical Fusion for Autonomous Driving Object Detection

Xiaojian Lin, Wenxin Zhang, Yuchu Jiang, Wangyu Wu, Yiran Guo, Kangxu Wang, Zongzheng Zhang, Guijin Wang, Lei Jin, Hao Zhao

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学) University of Liverpool(利物浦大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

Comments 10 pages, 6 figures. Supplementary material: 8 pages, 7 figures. Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10006 2025-08-01 cs.MM cs.AI cs.CV cs.LG

HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction

Jie Qin, Wei Yang, Yan Su, Yiran Zhu, Weizhen Li, Yunyue Pan, Chengchang Pan, Honggang Qi

机构 * School of Computer Science and Technology, University of the Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

Comments 8 pages,6 figures,3 tables,accepted by the 33rd ACM International Conference on Multimedia(ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18659 2025-08-01 cs.CV cs.AI

DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Yiqing Huang, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Tsinghua University, Tencent(清华大学、腾讯) Tencent(腾讯) Tencent, University of Macau(腾讯、澳门大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09186 2025-08-01 cs.HC cs.AI

EEG-SCMM: Soft Contrastive Masked Modeling for Cross-Corpus EEG-Based Emotion Recognition

Qile Liu, Weishan Ye, Lingli Zhang, Zhen Liang

机构 * Shenzhen University(深圳大学)

Comments 18 pages, 10 figures, 14 tables. Accepted in ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09392 2025-08-01 cs.CV eess.IV

UIF: An Objective Quality Assessment for Underwater Image Enhancement

Yannan Zheng, Weiling Chen, Rongfu Lin, Tiesong Zhao

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

Comments This paper was submitted to ACMMM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22668 2025-07-31 cs.CV

Graph-Guided Dual-Level Augmentation for 3D Scene Segmentation

Hongbin Lin, Yifan Jiang, Juangui Xu, Jesse Jiaxi Xu, Yi Lu, Zhengyu Hu, Ying-Cong Chen, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Toronto(多伦多大学)

Comments 15 pages, 11 figures, to be published in ACMMM 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22501 2025-07-31 cs.CV eess.IV

DACA-Net: A Degradation-Aware Conditional Diffusion Network for Underwater Image Enhancement

Chang Huang, Jiahang Cao, Jun Ma, Kieren Yu, Cong Li, Huayong Yang, Kaishun Wu

机构 * The Hong Kong University of Science and Technology (Guangzhou), Southern Marine Science and Engineering Guangdong Laboratory (Guangzhou)(香港科学与技术大学(广州)、广东海洋工程科学实验室(广州)) The Hong Kong University of Science(香港科学与技术大学) Engineering Guangdong Laboratory (Guangzhou)(广东工程实验室(广州))

Comments accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22465 2025-07-31 cs.CV cs.AI

Shallow Features Matter: Hierarchical Memory with Heterogeneous Interaction for Unsupervised Video Object Segmentation

Zheng Xiangyu, He Songcheng, Li Wanyun, Li Xiaoqiang, Zhang Wei

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学) The School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

Comments Accepted to ACM MM'25: The 33rd ACM International Conference on Multimedia Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22367 2025-07-31 cs.CL cs.MM

Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors

Jia Li, Yichao He, Jiacheng Xu, Tianhao Luo, Zhenzhen Hu, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学)

Comments 8 pages, 3 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14326 2025-07-31 cs.LG cs.CY

Rethinking Individual Fairness in Deepfake Detection

Aryana Hou, Li Lin, Justin Li, Shu Hu

机构 * Clarkstown High School South(Clarkstown 高中南分校) Purdue University(普渡大学) Carmel High School(Carmel 高中)

Comments This paper has been accepted by ACM MM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21646 2025-07-31 cs.CV

Diffusion-based Adversarial Identity Manipulation for Facial Privacy Protection

Liqin Wang, Qianyue Hu, Wei Lu, Xiangyang Luo

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China State Key Laboratory of Mathematical Engineering Engineering, Sun Yat-sen University

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20128 2025-07-31 cs.CV

Differential Contrastive Training for Gaze Estimation

Lin Zhang, Yi Tian, XiYun Wang, Wanru Xu, Yi Jin, Yaping Huang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) School of Computer Science and Technology(计算机科学与技术学院)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21637 2025-07-30 cs.AI

Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models

Wanying Wang, Zeyu Ma, Han Zheng, Xin Tan, Mingang Chen

机构 * Shanghai Key Laboratory of Computer Software Testing and Evaluating(上海软件测试与评估 key laboratory) Shanghai Normal University(上海Normal University) TrustAI Pte. Ltd. East China Normal University(东华师范大学)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19847 2025-07-30 cs.CV

Knowledge Regularized Negative Feature Tuning of Vision-Language Models for Out-of-Distribution Detection

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东部技术研究所) Stanford University(斯坦福大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴堡研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

Comments accepted by ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09242 2025-07-30 cs.CV

PPJudge: Towards Human-Aligned Assessment of Artistic Painting Process

Shiqi Jiang, Xinpeng Li, Xi Mao, Changbo Wang, Chenhui Li

机构 * School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(东华师范大学) School of Design(设计学院)

Comments ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20738 2025-07-29 cs.MM

Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Haoze Zhu, Jeff Z. Pan, Xiaojie Yuan

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20627 2025-07-29 cs.MM cs.AI cs.SD eess.AS

Controllable Video-to-Music Generation with Multiple Time-Varying Conditions

Junxian Wu, Weitao You, Heda Zuo, Dengming Zhang, Pei Chen, Lingyun Sun

机构 * Zhejiang University(浙江大学)

Comments Accepted by the 33rd ACM International Conference on Multimedia (ACMMM 2025). The project page is available at https://kita-wjx.github.io/MCV2M/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20623 2025-07-29 cs.CV cs.AI

Lightweight Remote Sensing Scene Classification on Edge Devices via Knowledge Distillation and Early-exit

Yang Zhao, Shusheng Li, Xueshang Feng

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

Comments 9 pages, 5 figures, to be published in ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20342 2025-07-29 cs.AI cs.RO

VLMPlanner: Integrating Visual Language Models with Motion Planning

Zhipeng Tang, Sha Zhang, Jiajun Deng, Chenjie Wang, Guoliang You, Yuting Huang, Xinrui Lin, Yanyong Zhang

机构 * University of Science and Technology of China(科学技术大学) University of Adelaide(阿德莱德大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

Comments 8 pages, 3 figures, this paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏