arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1940
2409.14878 2026-03-10 cs.HC

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12760 2026-03-10 cs.CV cs.AI

Unified Medical Image Segmentation with State Space Modeling Snake

基于状态空间建模的统一医学图像分割蛇

Ruicheng Zhang, Haowei Guo, Kanghui Tian, Jun Zhou, Mingliang Yan, Zeyu Zhang, Shen Zhao

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing University of Posts and Telecommunications(北京邮电大学) The Australian National University(澳大利亚国立大学)

AI总结 基于状态空间建模的Mamba Snake框架通过改进的蛇模型实现统一医学图像分割,有效处理多尺度结构异质性,提升分割精度。

Comments This paper has been accepted by ACM MM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), Pages 7825-7834

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19509 2026-03-09 cs.CV cs.LG cs.SD eess.AS

Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis

Ditto:用于可控实时说话头合成的运动空间扩散

Tianqi Li, Ruobing Zheng, Minghui Yang, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

AI总结 Ditto通过运动空间扩散模型实现可控实时说话头合成,优化架构与训练策略以提升生成质量与实时性能。

Comments Project Page: https://digital-avatar.github.io/ai/Ditto/

Journal ref ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14206 2026-02-26 eess.SP cs.AI cs.LG stat.ML

A Comprehensive Benchmark for Electrocardiogram Time-Series

一种用于心电图时间序列的全面基准

Zhijiang Tang, Jiaxin Qi, Yuhua Zheng, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

AI总结 本文提出了一种全面的ECG时间序列基准,涵盖四个评估任务、新指标和新架构,验证了其有效性。

Comments ACM MM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19319 2026-02-24 cs.MM cs.AI cs.CR cs.DB cs.DC

Health+: Empowering Individuals via Unifying Health Data

Health+: 通过统一健康数据赋能个体

Sujaya Maiyya, Shantanu Sharma, Avinash Kumar

机构 * University of Waterloo(滑铁卢大学) New Jersey Institute of Technology(新泽西理工学院) Independent Researcher(独立研究者)

AI总结 Health+ 是一个以用户为中心的多模态健康数据管理系统,通过统一数据和智能推荐,提升个体对健康信息的控制与管理能力。

Comments This paper has been accepted in ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08179 2026-02-20 cs.CV cs.MM

PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation

PP-Motion: 人类运动生成的物理-感知保真度评估

Sihan Zhao, Zixuan Wang, Tianyu Luan, Jia Jia, Wentao Zhu, Jiebo Luo, Junsong Yuan, Nan Xi

机构 * Tsinghua University(清华大学) University at Buffalo(布法罗大学) BNRist, Tsinghua University(清华大学BNRist研究所) Key Laboratory of Pervasive Computing, Ministry of Education(教育部 pervasive 计算重点实验室) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) University of Rochester(罗切斯特大学)

AI总结 PP-Motion是一种新的数据驱动度量,通过物理和感知保真度评估提升人类运动生成的准确性与真实性。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20630 2026-02-17 eess.AS cs.MM cs.SD

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10546 2026-02-12 cs.CV cs.AI

RealHD: A High-Quality Dataset for Robust Detection of State-of-the-Art AI-Generated Images

RealHD:一个高质量数据集,用于鲁棒检测最新AI生成图像

Hanzhe Yu, Yun Ye, Jintao Rong, Qi Xuan, Chen Ma

机构 * Institute of Cyberspace Security, Zhejiang University of Technology(网络安全研究院,浙江工业大学) Intel Corporation(英特尔公司) College of Information Engineering, Zhejiang University of Technology(信息工程学院,浙江工业大学) Binjiang Institute of Artificial Intelligence, ZJUT(滨江人工智能研究所,浙江工业大学)

AI总结 RealHD数据集通过高质量图像和先进生成方法,提升AI生成图像检测的鲁棒性和泛化能力,并提出基于噪声熵的轻量级检测方法。

Comments Published in the Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025)

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025, pp. 11394--11403

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04195 2026-02-10 cs.CV cs.CL

Cross-Modal Retrieval for Motion and Text via DropTriple Loss

通过DropTriple损失实现动与文本的跨模态检索

Sheng Yan, Yang Liu, Haoqiang Wang, Xin Du, Mengyuan Liu, Hong Liu

机构 * School of Artificial Intelligence, Chongqing University of Technology, China(重庆理工大学人工智能学院) College of Computer Science, Sichuan University, China(四川大学计算机学院) Key Laboratory of Machine Perception, Shenzhen Graduate School, Peking University, China(北京大学深圳研究生院机器感知重点实验室)

AI总结 本文提出DropTriple损失,用于提升人类动作与文本之间的跨模态检索性能,实验表明在HumanML3D数据集上实现了较高的检索准确率。

Comments This paper has been accepted by ACM MM Asia 2023 (Best Paper Candidate)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00734 2026-02-09 eess.SP cs.AI cs.LG

EEG-MACS: Manifold Attention and Confidence Stratification for EEG-based Cross-Center Brain Disease Diagnosis under Unreliable Annotations

EEG-MACS: 用于基于EEG的跨中心脑部疾病诊断的流形注意力与置信度分层

Zhenxi Song, Ruihan Qin, Huixia Ren, Zhen Liang, Yi Guo, Min Zhang, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen People's Hospital(深圳人民医院) Shenzhen University(深圳大学) Shenzhen Bay Laboratory(深圳湾实验室)

AI总结 EEG-MACS通过流形注意力与置信度分层技术,提升跨中心脑部疾病诊断的准确性与鲁棒性。

Comments 15 pages, 9 figures. Oral presentation at ACM MM 2024

Journal ref In Proceedings of the 32nd ACM International Conference on Multimedia (ACM MM '24), pp. 340-349, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13745 2026-02-04 cs.CV cs.DC

FedVSR: Towards Model-Agnostic Federated Learning in Video Super-Resolution

FedVSR:迈向视频超分辨率中模型无关的联邦学习

Ali Mollaahmadi Dehaghi, Hossein KhademSohi, Reza Razavi, Steve Drew, Mohammad Moshirpour

机构 * University of Calgary(卡尔加里大学) Userful Corporation(Userful公司) University of California, Irvine(加州大学尔湾分校)

AI总结 FedVSR是一种专为视频超分辨率设计的模型无关联邦学习框架,通过轻量级损失函数和损失感知聚合策略提升视频质量,实现高效隐私保护的低级视觉任务解决方案。

Comments Final version. Accepted at ACM Multimedia Systems (MMSys) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20042 2026-02-03 cs.CV cs.AI

Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval

超越视觉:基于多模态检索的上下文丰富图像描述

Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Dao Sy Duy Minh, Nguyen Hoang Minh Ngoc, Huynh Trung Kiet

机构 * University of Science - VNUHCM(越南胡志明市大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种多模态检索方法,通过整合外部文本知识生成更丰富的上下文图像描述,提升视觉-文本理解能力。

Comments 7 pages, 5 figures. System description for the EVENTA Grand Challenge (Track 1) at ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00484 2026-02-03 cs.CV cs.MM

GTATrack: Winner Solution to SoccerTrack 2025 with Deep-EIoU and Global Tracklet Association

GTATrack: 2025 SoccerTrack 挑战赛中采用深度EIoU和全局轨迹关联的胜出方案

Rong-Lin Jian, Ming-Chi Luo, Chen-Wei Huang, Chia-Ming Lee, Yu-Fan Lin, Chih-Chung Hsu

机构 * Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University Tainan Taiwan Department of Computer Science , National Yang Ming Chiao Tung University Hsinchu Taiwan Technology National Central University Taoyuan Taiwan Institute of Data Science\ Cheng Kung University Tainan Taiwan Miin Wu School of Computing\ Cheng Kung University Tainan Taiwan Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University Department of Computer Science , National Yang Ming Chiao Tung University Technology National Central University Institute of Data Science\ Cheng Kung University Miin Wu School of Computing\ Cheng Kung University

AI总结 GTATrack通过深度EIoU和全局轨迹关联技术,在2025 SoccerTrack挑战赛中以高HOTA得分和低假阳性率实现足球跟踪的最优性能。

Comments Winner Solution of SoccerTrack in ACM Multimedia 2025 Workshop MMSports

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11030 2026-01-19 cs.CV cs.AI

IDDR-NGP: Incorporating Detectors for Distractor Removal with Instant Neural Radiance Field

IDDR-NGP: 结合检测器去除干扰物的瞬时神经辐射场

Xianliang Huang, Jiajie Gou, Shuhang Chen, Zhizhou Zhong, Jihong Guan, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tongji University(同济大学)

AI总结 IDDR-NGP通过结合检测器与隐式3D表示,实现对多种干扰物的高效去除,具有端到端训练和高鲁棒性。

Comments 8 pages, 7 figures, accepted by ACM-MM23

Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 1343-1351

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17116 2026-01-16 cs.MM cs.AI cs.CV cs.IR

The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding

CASTLE 2024数据集:推动多模态理解艺术的发展

Luca Rossetto, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Björn Þór Jónsson, Onanong Kongmeesub, Hoang-Bao Le, Stevan Rudinac, Klaus Schöffmann, Florian Spiess, Allie Tran, Minh-Triet Tran, Quang-Linh Tran, Cathal Gurrin

机构 * Dublin City University(都柏林城市大学) JOANNEUM RESEARCH(JOANNEUM研究机构) University of Bergen(卑尔根大学) Reykjavik University(雷克雅未克大学) University of Amsterdam(阿姆斯特丹大学) Klagenfurt University(克雷克夫特大学) University of Basel(巴塞尔大学) VNU Ho Chi Minh University of Science(越南胡志明国家科学大学)

AI总结 CASTLE 2024数据集通过提供多视角视频和音频数据,推动多模态理解技术的发展。

Comments 7 pages, 6 figures, dataset available via https://castle-dataset.github.io/

Journal ref 2025 MM'25: Proceedings of the 33rd ACM International Conference on Multimedia (pp. 12629-12635)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11013 2026-01-09 cs.CV cs.MM

Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion

面向鲁棒且可控的文本到运动的掩码自回归扩散

Zongye Zhang, Bohan Kong, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute(杭州创新院) Beihang University(北京航空航天大学)

AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02107 2026-01-06 cs.CV

MagicFight: Personalized Martial Arts Combat Video Generation

MagicFight: 个性化武术战斗视频生成

Jiancheng Huang, Mingfu Yan, Songyan Chen, Yi Huang, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) Shenzhen University of Advanced Technology(深圳大学)

AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14921 2026-01-05 cs.CV

Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction

Stereo-GS:用于通用3D高斯点云重建的多视角立体视觉模型

Xiufeng Huang, Ka Chun Cheung, Runmin Cong, Simon See, Renjie Wan

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) NVIDIA AI Technology Center, NVIDIA(NVIDIA 人工智能技术中心) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

AI总结 Stereo-GS通过立体视觉和解耦框架实现高效通用3D高斯点云重建,无需依赖相机参数,提升鲁棒性和实用性。

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24645 2026-01-01 cs.SD

AudioFab: Building A General and Intelligent Audio Factory through Tool Learning

通过工具学习构建通用且智能的音频工厂

Cheng Zhu, Jing Han, Qianshuai Xue, Kehan Wang, Huan Zhao, Zixing Zhang

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 AudioFab通过工具学习构建通用智能音频处理框架,提供模块化设计和自然语言接口,提升音频任务的效率和准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22603 2025-12-30 cs.CL

Structured Prompting and LLM Ensembling for Multimodal Conversational Aspect-based Sentiment Analysis

结构化提示与大语言模型集成用于多模态对话基于方面的情感分析

Zhiqiang Gao, Shihao Gao, Zixing Zhang, Yihao Guo, Hongyu Chen, Jing Han

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 本文提出结构化提示与大语言模型集成方法,用于多模态对话基于方面的情感分析,有效提升情感识别与翻转检测的准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22602 2025-12-30 cs.CV

PTalker: Personalized Speech-Driven 3D Talking Head Animation via Style Disentanglement and Modality Alignment

PTalker: 通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画

Bin Wang, Yang Xu, Huan Zhao, Hao Zhang, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering(计算机科学与电子工程学院) Hunan University(湖南大学) School of Electronic Information(电子信息学院) Central South University(中南大学)

AI总结 PTalker通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画,提升唇同步精度与真实感。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22601 2025-12-30 cs.AI

Tyee: A Unified, Modular, and Fully-Integrated Configurable Toolkit for Intelligent Physiological Health Care

Tyee:面向智能生理健康护理的统一、模块化和完全集成的可配置工具包

Tao Zhou, Lingyu Shu, Zixing Zhang, Jing Han

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 Tyee提出了一种统一、模块化且可配置的工具包,用于提升智能生理健康护理中深度学习的实用性与可重现性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11781 2025-12-29 cs.CV cs.AI cs.LG

ACMamba: Fast Unsupervised Anomaly Detection via An Asymmetrical Consensus State Space Model

ACMamba: 通过非对称共识状态空间模型实现快速无监督异常检测

Guanchun Wang, Xiangrong Zhang, Yifei Zhang, Zelin Peng, Tianyang Zhang, Xu Tang, Licheng Jiao

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

AI总结 ACMamba通过非对称共识状态空间模型实现快速无监督异常检测,利用区域级实例替代密集像素样本,降低计算成本并提升性能。

Comments 15 pages, 9 figures

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21221 2025-12-25 cs.CV cs.AI

Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval

利用轻量级实体提取实现可扩展的基于事件的图像检索

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Tran Chi Nguyen

机构 * University of Science - VNUHCM(越南胡志明市科学大学)

AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。

Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21053 2025-12-25 cs.CV

Optical Flow-Guided 6DoF Object Pose Tracking with an Event Camera

基于事件相机的光学流引导的6自由度物体姿态跟踪

Zibin Liu, Banglei Guan, Yang Shang, Shunkun Liang, Zhenbao Yu, Qifeng Yu

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学)

AI总结 本文提出基于事件相机的光学流引导的6自由度物体姿态跟踪方法,通过混合特征提取和光流优化提升跟踪精度与鲁棒性。

Comments 9 pages, 5 figures. In Proceedings of the 32nd ACM International Conference on Multimedia (MM '24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14225 2025-12-17 cs.CV

OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving

OmniGen:面向自动驾驶的统一多模态传感器生成

Tao Tang, Enhui Ma, xia zhou, Letian Wang, Tianyi Yan, Xueyang Zhang, Kun Zhan, Peng Jia, XianPeng Lang, Jia-Wang Bian, Kaicheng Yu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Westlake University(西湖大学) Li Auto Inc.(Li汽车公司) The University of Toronto(多伦多大学) University of Macau(澳门大学)

AI总结 OmniGen通过统一框架生成对齐的多模态传感器数据,结合共享BEV空间和UAE方法,实现高效且灵活的传感器生成。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02792 2025-12-16 cs.CV cs.MM

HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval

HUD: 用于组合视频检索的层次不确定性感知网络

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Haokun Wen, Weili Guan

机构 * School of Software Shandong University Jinan China(软件学院 山东大学 济南 中国) School of Data Science City University of Hong Kong Hong Kong China(数据科学学院 香港城市大学 香港 中国) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

AI总结 HUD通过层次不确定性感知网络提升组合视频检索的多模态查询理解与特征学习精度。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏