arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2025-08-01 至 2025-08-01 共收录 10
2507.23382 2025-08-01 cs.CL cs.AI cs.CV

MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models

Yiyan Ji, Haoran Chen, Qiguang Chen, Chengyue Wu, Libo Qin, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Central South University(中南大学)

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23362 2025-08-01 cs.CV

Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室)

Comments Accepted By ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23307 2025-08-01 cs.CV

ST-SAM: SAM-Driven Self-Training Framework for Semi-Supervised Camouflaged Object Detection

Xihang Hu, Fuming Sun, Jiazhe Liu, Feilong Xu, Xiaoli Zhang

机构 * Jilin University(吉林大学) Dalian Minzu University(大连民族大学)

Comments 10 pages, 6 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23219 2025-08-01 eess.IV cs.CV

Learning Arbitrary-Scale RAW Image Downscaling with Wavelet-based Recurrent Reconstruction

Yang Ren, Hai Jiang, Wei Li, Menglong Yang, Heng Zhang, Zehua Sheng, Qingsheng Ye, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空宇航学院) Xiaomi Inc.(小米公司) University of Electronic Science and Technology of China(电子科技大学)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22477 2025-08-01 cs.CV cs.AI

LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mengfei Shi, Xia Xie, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Hainan University(海南大学)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13373 2025-08-01 cs.CV

Butter: Frequency Consistency and Hierarchical Fusion for Autonomous Driving Object Detection

Xiaojian Lin, Wenxin Zhang, Yuchu Jiang, Wangyu Wu, Yiran Guo, Kangxu Wang, Zongzheng Zhang, Guijin Wang, Lei Jin, Hao Zhao

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学) University of Liverpool(利物浦大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

Comments 10 pages, 6 figures. Supplementary material: 8 pages, 7 figures. Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10006 2025-08-01 cs.MM cs.AI cs.CV cs.LG

HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction

Jie Qin, Wei Yang, Yan Su, Yiran Zhu, Weizhen Li, Yunyue Pan, Chengchang Pan, Honggang Qi

机构 * School of Computer Science and Technology, University of the Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

Comments 8 pages,6 figures,3 tables,accepted by the 33rd ACM International Conference on Multimedia(ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18659 2025-08-01 cs.CV cs.AI

DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Yiqing Huang, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Tsinghua University, Tencent(清华大学、腾讯) Tencent(腾讯) Tencent, University of Macau(腾讯、澳门大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09186 2025-08-01 cs.HC cs.AI

EEG-SCMM: Soft Contrastive Masked Modeling for Cross-Corpus EEG-Based Emotion Recognition

Qile Liu, Weishan Ye, Lingli Zhang, Zhen Liang

机构 * Shenzhen University(深圳大学)

Comments 18 pages, 10 figures, 14 tables. Accepted in ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09392 2025-08-01 cs.CV eess.IV

UIF: An Objective Quality Assessment for Underwater Image Enhancement

Yannan Zheng, Weiling Chen, Rongfu Lin, Tiesong Zhao

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

Comments This paper was submitted to ACMMM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏