InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
基于状态空间建模的统一医学图像分割蛇
机构 * Sun Yat-sen University(中山大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; The Australian National University(澳大利亚国立大学)
AI总结 基于状态空间建模的Mamba Snake框架通过改进的蛇模型实现统一医学图像分割,有效处理多尺度结构异质性,提升分割精度。
Comments This paper has been accepted by ACM MM 2025
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), Pages 7825-7834
Ditto:用于可控实时说话头合成的运动空间扩散
机构 * Ant Group(蚂蚁集团)
AI总结 Ditto通过运动空间扩散模型实现可控实时说话头合成,优化架构与训练策略以提升生成质量与实时性能。
Comments Project Page: https://digital-avatar.github.io/ai/Ditto/
Journal ref ACM MM 2025
AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; Nanyang Technological University(南洋理工大学)
AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。
Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace
EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架
机构 * Alibaba Cloud(阿里云)
AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。
Comments 10 pages, 8 figures, ACM MM 2025
FiLo:通过细粒度描述和高质量定位实现零样本异常检测
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Objecteye Inc., Beijing, China(Objecteye公司) ; Central South University, Hunan, China(中南大学)
AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。
Comments Accepted by ACM MM 2024
一种用于心电图时间序列的全面基准
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) ; Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
AI总结 本文提出了一种全面的ECG时间序列基准,涵盖四个评估任务、新指标和新架构,验证了其有效性。
Comments ACM MM 2025
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025
Health+: 通过统一健康数据赋能个体
机构 * University of Waterloo(滑铁卢大学) ; New Jersey Institute of Technology(新泽西理工学院) ; Independent Researcher(独立研究者)
AI总结 Health+ 是一个以用户为中心的多模态健康数据管理系统,通过统一数据和智能推荐,提升个体对健康信息的控制与管理能力。
Comments This paper has been accepted in ACM Multimedia 2025
PP-Motion: 人类运动生成的物理-感知保真度评估
机构 * Tsinghua University(清华大学) ; University at Buffalo(布法罗大学) ; BNRist, Tsinghua University(清华大学BNRist研究所) ; Key Laboratory of Pervasive Computing, Ministry of Education(教育部 pervasive 计算重点实验室) ; Eastern Institute of Technology, Ningbo(宁波东部技术研究所) ; University of Rochester(罗切斯特大学)
AI总结 PP-Motion是一种新的数据驱动度量,通过物理和感知保真度评估提升人类运动生成的准确性与真实性。
Comments Accepted by ACM Multimedia 2025
ISDrama: 通过多模态提示生成沉浸式空间戏剧
机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) ; Zhejiang University(浙江大学)
AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。
Comments Accepted by ACM Multimedia 2025
Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627
RealHD:一个高质量数据集,用于鲁棒检测最新AI生成图像
机构 * Institute of Cyberspace Security, Zhejiang University of Technology(网络安全研究院,浙江工业大学) ; Intel Corporation(英特尔公司) ; College of Information Engineering, Zhejiang University of Technology(信息工程学院,浙江工业大学) ; Binjiang Institute of Artificial Intelligence, ZJUT(滨江人工智能研究所,浙江工业大学)
AI总结 RealHD数据集通过高质量图像和先进生成方法,提升AI生成图像检测的鲁棒性和泛化能力,并提出基于噪声熵的轻量级检测方法。
Comments Published in the Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025)
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025, pp. 11394--11403
通过DropTriple损失实现动与文本的跨模态检索
机构 * School of Artificial Intelligence, Chongqing University of Technology, China(重庆理工大学人工智能学院) ; College of Computer Science, Sichuan University, China(四川大学计算机学院) ; Key Laboratory of Machine Perception, Shenzhen Graduate School, Peking University, China(北京大学深圳研究生院机器感知重点实验室)
AI总结 本文提出DropTriple损失,用于提升人类动作与文本之间的跨模态检索性能,实验表明在HumanML3D数据集上实现了较高的检索准确率。
Comments This paper has been accepted by ACM MM Asia 2023 (Best Paper Candidate)
EEG-MACS: 用于基于EEG的跨中心脑部疾病诊断的流形注意力与置信度分层
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen People's Hospital(深圳人民医院) ; Shenzhen University(深圳大学) ; Shenzhen Bay Laboratory(深圳湾实验室)
AI总结 EEG-MACS通过流形注意力与置信度分层技术,提升跨中心脑部疾病诊断的准确性与鲁棒性。
Comments 15 pages, 9 figures. Oral presentation at ACM MM 2024
Journal ref In Proceedings of the 32nd ACM International Conference on Multimedia (ACM MM '24), pp. 340-349, 2024
FedVSR:迈向视频超分辨率中模型无关的联邦学习
机构 * University of Calgary(卡尔加里大学) ; Userful Corporation(Userful公司) ; University of California, Irvine(加州大学尔湾分校)
AI总结 FedVSR是一种专为视频超分辨率设计的模型无关联邦学习框架,通过轻量级损失函数和损失感知聚合策略提升视频质量,实现高效隐私保护的低级视觉任务解决方案。
Comments Final version. Accepted at ACM Multimedia Systems (MMSys) 2026
超越视觉:基于多模态检索的上下文丰富图像描述
机构 * University of Science - VNUHCM(越南胡志明市大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出一种多模态检索方法,通过整合外部文本知识生成更丰富的上下文图像描述,提升视觉-文本理解能力。
Comments 7 pages, 5 figures. System description for the EVENTA Grand Challenge (Track 1) at ACM MM'25
GTATrack: 2025 SoccerTrack 挑战赛中采用深度EIoU和全局轨迹关联的胜出方案
机构 * Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University Tainan Taiwan ; Department of Computer Science , National Yang Ming Chiao Tung University Hsinchu Taiwan ; Technology National Central University Taoyuan Taiwan ; Institute of Data Science\ Cheng Kung University Tainan Taiwan ; Miin Wu School of Computing\ Cheng Kung University Tainan Taiwan ; Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University ; Department of Computer Science , National Yang Ming Chiao Tung University ; Technology National Central University ; Institute of Data Science\ Cheng Kung University ; Miin Wu School of Computing\ Cheng Kung University
AI总结 GTATrack通过深度EIoU和全局轨迹关联技术,在2025 SoccerTrack挑战赛中以高HOTA得分和低假阳性率实现足球跟踪的最优性能。
Comments Winner Solution of SoccerTrack in ACM Multimedia 2025 Workshop MMSports
IDDR-NGP: 结合检测器去除干扰物的瞬时神经辐射场
机构 * Fudan University(复旦大学) ; Tongji University(同济大学)
AI总结 IDDR-NGP通过结合检测器与隐式3D表示,实现对多种干扰物的高效去除,具有端到端训练和高鲁棒性。
Comments 8 pages, 7 figures, accepted by ACM-MM23
Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 1343-1351
CASTLE 2024数据集:推动多模态理解艺术的发展
机构 * Dublin City University(都柏林城市大学) ; JOANNEUM RESEARCH(JOANNEUM研究机构) ; University of Bergen(卑尔根大学) ; Reykjavik University(雷克雅未克大学) ; University of Amsterdam(阿姆斯特丹大学) ; Klagenfurt University(克雷克夫特大学) ; University of Basel(巴塞尔大学) ; VNU Ho Chi Minh University of Science(越南胡志明国家科学大学)
AI总结 CASTLE 2024数据集通过提供多视角视频和音频数据,推动多模态理解技术的发展。
Comments 7 pages, 6 figures, dataset available via https://castle-dataset.github.io/
Journal ref 2025 MM'25: Proceedings of the 33rd ACM International Conference on Multimedia (pp. 12629-12635)
面向鲁棒且可控的文本到运动的掩码自回归扩散
机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Hangzhou Innovation Institute(杭州创新院) ; Beihang University(北京航空航天大学)
AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。
Comments Accepted by ACM MM 2025
MagicFight: 个性化武术战斗视频生成
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) ; China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) ; Shenzhen University of Advanced Technology(深圳大学)
AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。
Comments Accepted by ACM MM 2024
Stereo-GS:用于通用3D高斯点云重建的多视角立体视觉模型
机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; NVIDIA AI Technology Center, NVIDIA(NVIDIA 人工智能技术中心) ; School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
AI总结 Stereo-GS通过立体视觉和解耦框架实现高效通用3D高斯点云重建,无需依赖相机参数,提升鲁棒性和实用性。
Comments ACM Multimedia 2025
通过工具学习构建通用且智能的音频工厂
机构 * Hunan University(湖南大学) ; University of Cambridge(剑桥大学)
AI总结 AudioFab通过工具学习构建通用智能音频处理框架,提供模块化设计和自然语言接口,提升音频任务的效率和准确性。
Journal ref ACM Multimedia 2025
结构化提示与大语言模型集成用于多模态对话基于方面的情感分析
机构 * Hunan University(湖南大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出结构化提示与大语言模型集成方法,用于多模态对话基于方面的情感分析,有效提升情感识别与翻转检测的准确性。
Journal ref ACM Multimedia 2025
PTalker: 通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画
机构 * College of Computer Science and Electronic Engineering(计算机科学与电子工程学院) ; Hunan University(湖南大学) ; School of Electronic Information(电子信息学院) ; Central South University(中南大学)
AI总结 PTalker通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画,提升唇同步精度与真实感。
Journal ref ACM Multimedia 2025
Tyee:面向智能生理健康护理的统一、模块化和完全集成的可配置工具包
机构 * Hunan University(湖南大学) ; University of Cambridge(剑桥大学)
AI总结 Tyee提出了一种统一、模块化且可配置的工具包,用于提升智能生理健康护理中深度学习的实用性与可重现性。
Journal ref ACM Multimedia 2025
ACMamba: 通过非对称共识状态空间模型实现快速无监督异常检测
机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)
AI总结 ACMamba通过非对称共识状态空间模型实现快速无监督异常检测,利用区域级实例替代密集像素样本,降低计算成本并提升性能。
Comments 15 pages, 9 figures
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia, ACM MM 2025
利用轻量级实体提取实现可扩展的基于事件的图像检索
机构 * University of Science - VNUHCM(越南胡志明市科学大学)
AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。
Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables
基于事件相机的光学流引导的6自由度物体姿态跟踪
机构 * National University of Defense Technology(国防科技大学) ; Wuhan University(武汉大学)
AI总结 本文提出基于事件相机的光学流引导的6自由度物体姿态跟踪方法,通过混合特征提取和光流优化提升跟踪精度与鲁棒性。
Comments 9 pages, 5 figures. In Proceedings of the 32nd ACM International Conference on Multimedia (MM '24)
OmniGen:面向自动驾驶的统一多模态传感器生成
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Westlake University(西湖大学) ; Li Auto Inc.(Li汽车公司) ; The University of Toronto(多伦多大学) ; University of Macau(澳门大学)
AI总结 OmniGen通过统一框架生成对齐的多模态传感器数据,结合共享BEV空间和UAE方法,实现高效且灵活的传感器生成。
Comments ACM MM 2025
HUD: 用于组合视频检索的层次不确定性感知网络
机构 * School of Software Shandong University Jinan China(软件学院 山东大学 济南 中国) ; School of Data Science City University of Hong Kong Hong Kong China(数据科学学院 香港城市大学 香港 中国) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; City University of Hong Kong(香港城市大学)
AI总结 HUD通过层次不确定性感知网络提升组合视频检索的多模态查询理解与特征学习精度。
Comments Accepted by ACM MM 2025