arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2407.12322 2024-07-31 cs.CV

Frequency Guidance Matters: Skeletal Action Recognition by Frequency-Aware Mixed Transformer

Wenhan Wu, Ce Zheng, Zihao Yang, Chen Chen, Srijan Das, Aidong Lu

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05688 2024-07-31 cs.CV cs.AI

Learning with Alignments: Tackling the Inter- and Intra-domain Shifts for Cross-multidomain Facial Expression Recognition

Yuxiang Yang, Lu Wen, Xinyi Zeng, Yuanyuan Xu, Xi Wu, Jiliu Zhou, Yan Wang

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20099 2024-07-30 cs.CV

RSC-SNN: Exploring the Trade-off Between Adversarial Robustness and Accuracy in Spiking Neural Networks via Randomized Smoothing Coding

Keming Wu, Man Yao, Yuhong Chou, Xuerui Qiu, Rui Yang, Bo Xu, Guoqi Li

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19514 2024-07-30 cs.CV cs.MM

Detached and Interactive Multimodal Learning

Yunfeng Fan, Wenchao Xu, Haozhao Wang, Junhong Liu, Song Guo

Comments Accepted by ACM MM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19370 2024-07-30 cs.CV

ClickDiff: Click to Induce Semantic Contact Map for Controllable Grasp Generation with Diffusion Models

Peiming Li, Ziyi Wang, Mengyuan Liu, Hong Liu, Chen Chen

Comments ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19302 2024-07-30 cs.CL cs.MM

IBMEA: Exploring Variational Information Bottleneck for Multi-modal Entity Alignment

Taoyu Su, Jiawei Sheng, Shicheng Wang, Xinghua Zhang, Hongbo Xu, Tingwen Liu

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19192 2024-07-30 cs.CL cs.CV cs.MM

Harmfully Manipulated Images Matter in Multimodal Misinformation Detection

Bing Wang, Shengsheng Wang, Changchun Li, Renchu Guan, Ximing Li

Comments Accepted by ACM MM 2024. Code: https://github.com/wangbing1416/HAMI-M3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13891 2024-07-30 cs.CV cs.AI

DPO: Dual-Perturbation Optimization for Test-time Adaptation in 3D Object Detection

Zhuoxiao Chen, Zixin Wang, Yadan Luo, Sen Wang, Zi Huang

Comments To appear in ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12826 2024-07-30 cs.CV

JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement

Yuhui Wu, Guoqing Wang, Zhiwen Wang, Yang Yang, Tianyu Li, Malu Zhang, Chongyi Li, Heng Tao Shen

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15308 2024-07-30 cs.CV

AV-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset

Zhixi Cai, Shreya Ghosh, Aman Pankaj Adatia, Munawar Hayat, Abhinav Dhall, Tom Gedeon, Kalin Stefanov

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16977 2024-07-29 cs.CV cs.MM

Selective Vision-Language Subspace Projection for Few-shot CLIP

Xingyu Zhu, Beier Zhu, Yi Tan, Shuo Wang, Yanbin Hao, Hanwang Zhang

Comments Accepted as an Oral Paper at ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09554 2024-07-29 cs.CV

Embodied Laser Attack:Leveraging Scene Priors to Achieve Agent-based Robust Non-contact Attacks

Yitong Sun, Yao Huang, Xingxing Wei

Comments 9 pages, 7 figures, Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18656 2024-07-29 cs.CV

Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner

Pengxiang Cai, Zhiwei Liu, Guibo Zhu, Yunfang Niu, Jinqiao Wang

Comments This paper has been accepted as a poster paper for ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18244 2024-07-26 cs.CV

RefMask3D: Language-Guided Transformer for 3D Referring Segmentation

Shuting He, Henghui Ding

Comments ACM MM 2024, Code: https://github.com/heshuting555/RefMask3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17911 2024-07-26 cs.MM cs.AI cs.CV

ReCorD: Reasoning and Correcting Diffusion for HOI Generation

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Lo, Yi-Ning Huang, Terence Lin, Jhih-Ciang Wu, Hong-Han Shuai, Wen-Huang Cheng

Comments Accepted by ACM MM 2024. Project website: https://alberthkyhky.github.io/ReCorD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17854 2024-07-26 cs.AI cs.CL cs.MM

Shapley Value-based Contrastive Alignment for Multimodal Information Extraction

Wen Luo, Yu Xia, Shen Tianshu, Sujian Li

Comments Accepted at ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17689 2024-07-26 cs.CV

SAM-MIL: A Spatial Contextual Aware Multiple Instance Learning Approach for Whole Slide Image Classification

Heng Fang, Sheng Huang, Wenhao Tang, Luwen Huangfu, Bo Liu

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05989 2024-07-26 cs.CV

QE-BEV: Query Evolution for Bird's Eye View Object Detection in Varied Contexts

Jiawei Yao, Yingxin Lai, Hongrui Kou, Tong Wu, Ruixi Liu

Comments Accepted by ACM MM 2024, project page: https://github.com/Jiawei-Yao0812/QE-BEV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05483 2024-07-26 cs.CV

HarmonicNeRF: Geometry-Informed Synthetic View Augmentation for 3D Scene Reconstruction in Driving Scenarios

Xiaochao Pan, Jiawei Yao, Hongrui Kou, Tong Wu, Canran Xiao

Comments Accepted by ACM MM 2024, project page: https://github.com/Jiawei-Yao0812/HarmonicNeRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17035 2024-07-25 cs.CV

Q-Ground: Image Quality Grounding with Large Multi-modality Models

Chaofeng Chen, Sensen Yang, Haoning Wu, Liang Liao, Zicheng Zhang, Annan Wang, Wenxiu Sun, Qiong Yan, Weisi Lin

Comments ACM Multimedia 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16863 2024-07-25 cs.LG cs.AI cs.SI

Balanced Multi-Relational Graph Clustering

Zhixiang Shen, Haolan He, Zhao Kang

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16670 2024-07-24 cs.CV cs.CY cs.MM

FakingRecipe: Detecting Fake News on Short Video Platforms from the Perspective of Creative Process

Yuyan Bu, Qiang Sheng, Juan Cao, Peng Qi, Danding Wang, Jintao Li

Comments Will appear at ACM Multimedia 2024 (MM 2024), 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16638 2024-07-24 cs.CV

Unveiling and Mitigating Bias in Audio Visual Segmentation

Peiwen Sun, Honggang Zhang, Di Hu

Comments Accepted by ACM MM 24 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16554 2024-07-24 cs.MM cs.CV cs.SD eess.AS

Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization

Junyan Wu, Wei Lu, Xiangyang Luo, Rui Yang, Qian Wang, Xiaochun Cao

Comments 9pages, 3figures. This paper has been accepted for ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16394 2024-07-24 cs.CV

SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval

Longtao Jiang, Min Wang, Zecheng Li, Yao Fang, Wengang Zhou, Houqiang Li

Comments Accepted to ACM International Conference on Multimedia (MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16244 2024-07-24 cs.CV cs.AI cs.MM

HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification

Shuyi Ouyang, Hongyi Wang, Ziwei Niu, Zhenjia Bai, Shiao Xie, Yingying Xu, Ruofeng Tong, Yen-Wei Chen, Lanfen Lin

Comments 10 pages, 6 figures

Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 4768-4777

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15613 2024-07-24 cs.CV

Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning

Xiangyan Qu, Jing Yu, Keke Gai, Jiamin Zhuang, Yuanmin Tang, Gang Xiong, Gaopeng Gou, Qi Wu

Comments Accepted to ACM International Conference on Multimedia (MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09640 2024-07-24 cs.CV

CREST: Cross-modal Resonance through Evidential Deep Learning for Enhanced Zero-Shot Learning

Haojian Huang, Xiaozhen Qiao, Zhuo Chen, Haodong Chen, Bingyu Li, Zhe Sun, Mulin Chen, Xuelong Li

Comments Accepted by ACM MM 2024; 10 pages, 2 Tables, 9 Figures; Repo is available at: https://github.com/JethroJames/CREST

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11469 2024-07-24 cs.CV cs.GR

Generative Motion Stylization of Cross-structure Characters within Canonical Motion Space

Jiaxu Zhang, Xin Chen, Gang Yu, Zhigang Tu

Comments ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10711 2024-07-24 cs.CV cs.AI cs.CL

Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering

Haibo Wang, Chenghang Lai, Yixuan Sun, Weifeng Ge

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏