arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2311.16511 2024-10-29 cs.CV

GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation

Zhanyu Wang, Longyue Wang, Zhen Zhao, Minghao Wu, Chenyang Lyu, Huayang Li, Deng Cai, Luping Zhou, Shuming Shi, Zhaopeng Tu

Comments ACM MM 2024, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19239 2024-10-28 cs.CV

Prompting Continual Person Search

Pengcheng Zhang, Xiaohan Yu, Xiao Bai, Jin Zheng, Xin Ning

Comments ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17802 2024-10-24 cs.CV cs.GR

GenUDC: High Quality 3D Mesh Generation with Unsigned Dual Contouring Representation

Ruowei Wang, Jiaqi Li, Dan Zeng, Xueqi Ma, Zixiang Xu, Jianwei Zhang, Qijun Zhao

Comments ACMMM 2024, code:https://github.com/TrepangCat/GenUDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15582 2024-10-22 cs.CV

ARTS: Semi-Analytical Regressor using Disentangled Skeletal Representations for Human Mesh Recovery from Videos

Tao Tang, Hong Liu, Yingxuan You, Ti Wang, Wenhao Li

Comments Accepted by ACM MM 2024. Project page: https://github.com/TangTao-PKU/ARTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15075 2024-10-22 cs.CV cs.AI

SLIC: Secure Learned Image Codec through Compressed Domain Watermarking to Defend Image Manipulation

Chen-Hsiu Huang, Ja-Ling Wu

Comments accepted by ACM Multimedia Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15007 2024-10-22 cs.CV cs.MM

DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer

Ying Hu, Chenyi Zhuang, Pan Gao

Comments Accepted to ACMMM Asia 2024. Code is available at https://github.com/I2-Multimedia-Lab/DiffuseST

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14965 2024-10-22 eess.IV cs.CV

Non-Invasive to Invasive: Enhancing FFA Synthesis from CFP with a Benchmark Dataset and a Novel Network

Hongqiu Wang, Zhaohu Xing, Weitong Wu, Yijun Yang, Qingqing Tang, Meixia Zhang, Yanwu Xu, Lei Zhu

Comments ACMMM 24 MCHM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03302 2024-10-21 cs.CV

Action Selection Learning for Multi-label Multi-view Action Recognition

Trung Thanh Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide

Comments ACM Multimedia Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13598 2024-10-18 cs.CV

Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding

Jongbhin Woo, Hyeonggon Ryu, Youngjoon Jang, Jae Won Cho, Joon Son Chung

Comments Accepted by ACMMM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05771 2024-10-18 cs.CV

Cefdet: Cognitive Effectiveness Network Based on Fuzzy Inference for Action Detection

Zhe Luo, Weina Fu, Shuai Liu, Saeed Anwar, Muhammad Saqib, Sambit Bakshi, Khan Muhammad

Comments The paper has been accepted by ACM MM. If you find this work helpful, please consider citing our paper. Zhe Luo, Weina Fu, Shuai Liu, Saeed Anwar, Muhammad Saqib, Sambit Bakshi, Khan Muhammad (2024) Cefdet: Cognitive Effectiveness Network Based on Fuzzy Inference for Action Detection, 32nd ACM International Conference on Multimedia, online first, 10.1145/3664647.3681226

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16872 2024-10-18 cs.IR

NFT1000: A Cross-Modal Dataset for Non-Fungible Token Retrieval

Shuxun Wang, Yunfei Lei, Ziqi Zhang, Wei Liu, Haowei Liu, Li Yang, Wenjuan Li, Bing Li, Weiming Hu

Comments 11 pages,12figures to be published in ACM Multimedia 2024, see https://openreview.net/forum?id=xUtNrKH8iB&noteId=xUtNrKH8iB

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12700 2024-10-17 cs.CV cs.AI cs.CY cs.LG cs.MM

Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization

Xingqi Wang, Xiaoyuan Yi, Xing Xie, Jia Jia

Comments Accepted by ACM Multimedia 2024. The dataset and code can be found at https://github.com/achernarwang/LiVO

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09408 2024-10-17 cs.CV

VrdONE: One-stage Video Visual Relation Detection

Xinjie Jiang, Chenxi Zheng, Xuemiao Xu, Bangzhen Liu, Weiying Zheng, Huaidong Zhang, Shengfeng He

Comments 12 pages, 8 figures, accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03888 2024-10-16 cs.CV

Dual-Modeling Decouple Distillation for Unsupervised Anomaly Detection

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

Comments 10 pages, 8 figures, Accepted to ACM MM '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00297 2024-10-16 cs.CV

Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning

Minghao Zhu, Xiao Lin, Ronghao Dang, Chengju Liu, Qijun Chen

Comments ACM MM 2023 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10227 2024-10-15 cs.CV

KNN Transformer with Pyramid Prompts for Few-Shot Learning

Wenhao Li, Qiangchang Wang, Peng Zhao, Yilong Yin

Comments 10 pages, 5 figures, accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14750 2024-10-15 cs.CV cs.AI

Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation

Zhiyuan Li, Dongnan Liu, Heng Wang, Chaoyi Zhang, Weidong Cai

Comments Accepted by ACM Multimedia Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13284 2024-10-15 cs.IR

Semantic-aware Representation Learning for Homography Estimation

Yuhan Liu, Qianxin Huang, Siqi Hui, Jingwen Fu, Sanping Zhou, Kangyi Wu, Pengna Li, Jinjun Wang

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08620 2024-10-14 cs.CR cs.CV cs.MM

Natural Language Induced Adversarial Images

Xiaopei Zhu, Peiyang Xu, Guanning Zeng, Yingpeng Dong, Xiaolin Hu

Comments Carmera-ready version. To appear in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19931 2024-10-14 cs.LG cs.AI

Decoupling General and Personalized Knowledge in Federated Learning via Additive and Low-Rank Decomposition

Xinghao Wu, Xuefeng Liu, Jianwei Niu, Haolin Wang, Shaojie Tang, Guogang Zhu, Hao Su

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08530 2024-10-14 cs.CV cs.MM

Ego3DT: Tracking Every 3D Object in Ego-centric Videos

Shengyu Hao, Wenhao Chai, Zhonghan Zhao, Meiqi Sun, Wendi Hu, Jieyang Zhou, Yixian Zhao, Qi Li, Yizhou Wang, Xi Li, Gaoang Wang

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08470 2024-10-14 cs.HC cs.CV

DAT: Dialogue-Aware Transformer with Modality-Group Fusion for Human Engagement Estimation

Jia Li, Yangchen Yu, Yin Chen, Yu Zhang, Peng Jia, Yunbo Xu, Ziqiang Li, Meng Wang, Richang Hong

Comments 1st Place on the NoXi Base dataset in the Multi-Domain Engagement Estimation Challenge held by MultiMediate 24, accepted by ACM Multimedia 2024. The source code is available at \url{https://github.com/MSA-LMC/DAT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07226 2024-10-14 cs.SD eess.AS

Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm

Yuning Wu, Jiatong Shi, Yifeng Yu, Yuxun Tang, Tao Qian, Yueqian Lin, Jionghao Han, Xinyi Bai, Shinji Watanabe, Qin Jin

Comments Accepted by ACMMM 2024 demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07757 2024-10-11 cs.CV

MMHead: Towards Fine-grained Multi-modal 3D Facial Animation

Sijing Wu, Yunhao Li, Yichao Yan, Huiyu Duan, Ziwei Liu, Guangtao Zhai

Comments Accepted by ACMMM 2024. Project page: https://wsj-sjtu.github.io/MMHead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06699 2024-10-10 cs.CV cs.AI cs.LG

Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models

Yubo Wang, Chaohu Liu, Yanqiu Qu, Haoyu Cao, Deqiang Jiang, Linli Xu

Comments Accepted to ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06149 2024-10-10 cs.CV cs.MM eess.IV

Toward Scalable Image Feature Compression: A Content-Adaptive and Diffusion-Based Approach

Sha Guo, Zhuo Chen, Yang Zhao, Ning Zhang, Xiaotong Li, Lingyu Duan

Journal ref in Proceedings of the 31st ACM International Conference on Multimedia, pp. 1431-1442, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05935 2024-10-10 cs.CV cs.MM

Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga

Takara Taniguchi, Ryosuke Furuta

Comments Accepted to ACM Multimedia Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03382 2024-10-10 cs.CV

Guided Image Synthesis via Initial Image Editing in Diffusion Model

Jiafeng Mao, Xueting Wang, Kiyoharu Aizawa

Comments ACM MM 23

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04402 2024-10-08 cs.CV cs.GR

Deformable NeRF using Recursively Subdivided Tetrahedra

Zherui Qiu, Chenqu Ren, Kaiwen Song, Xiaoyi Zeng, Leyuan Yang, Juyong Zhang

Comments Accepted by ACM Multimedia 2024. Project Page: https://ustc3dv.github.io/DeformRF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04342 2024-10-08 cs.CV

Accelerating Inference of Networks in the Frequency Domain

Chenqiu Zhao, Guanfang Dong, Anup Basu

Comments accepted by ACM Multimedia Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏