Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments 9 pages, 6 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments 9 pages, 6 figures
专题命中 多模态生成 :multi-modal(abstract)
Comments This nine pages paper has been accepted for publication in Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025). This is the author's version which has not been fully edited and content may change prior to final publication. Citation information: DOI https://doi.org/10.1145/3746027.3755828
专题命中 多模态生成 :multimodal(abstract)
Comments 10 pages, 6 figures, 1 table
Journal ref Nature Communications 16, 7213 (2025)
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICCV 2025. arXiv admin note: text overlap with arXiv:2311.06602 by other authors
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI
机构 * School of Software Technology Zhejiang University Hangzhou Zhejiang China(软件技术学院浙江大学杭州浙江中国) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
Comments Accepted at ACM MM 2025 Main Conference
机构 * Edinburgh Napier University(爱丁堡纳皮尔大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract)
Comments 17 pages, 3 figures, 5 tables
机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院健康科学与技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Clinical Center for Sports Medicine, Department of Orthopaedics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院骨科临床中心) ; School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学学院) ; Department of Hematology, The First Affiliated Hospital, College of Medicine, Zhejiang University(浙江大学医学院第一附属医院血液科) ; MoE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) ; Department of Public Health and Primary Care, University of Cambridge(剑桥大学公共卫生与初级保健学院) ; Department of Medicine, Faculty of Health Sciences, Universidad CEU Cardenal Herrera(CEU卡德纳尔-赫尔曼大学健康科学学院医学系) ; Faculty of Medicine, University of Helsinki(赫尔辛基大学医学院) ; X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院X-LANCE实验室) ; Department of Hepatobiliary Surgery, National Cancer Center / National Clinical Research Center for Cancer / Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院肿瘤医院肝胆外科) ; Department of Surgery, The Ohio State University Wexner Medical Center, The James Comprehensive Cancer Center(俄亥俄州立大学韦克斯纳医学中心外科部,詹姆斯综合癌症中心) ; Ningbo Institute of Technology, Beihang University(北航宁波理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) ; Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by ACL 2025 Findings
机构 * Purdue University(普渡大学) ; Toyota InfoTech Labs(丰田信息技术实验室)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
Comments 9pages, 2figures
专题命中 多模态评测 :multimodal(title,abstract)
机构 * Key Laboratory of Network Data Science and Technology(网络数据科学与技术重点实验室) ; Institute of Computing Technology(计算技术研究所) ; Chinese Academy of Sciences(中国科学院) ; State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; University of Chinese Academy of Science(中国科学院大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments Accepted by CCIR25 and published by Springer LNCS or LNAI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Microsoft Research(微软研究院) ; National University of Singapore(新加坡国立大学) ; Binghamton University(布ingham顿大学)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) ; School of Artificial Intelligence, Anhui University(人工智能学院,安徽大学)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(comments)
Comments The First Benchmark Dataset for RGB-Event Multimodal Pedestrian Attribute Recognition Task
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华大学) ; University of International Relations(国际关系大学) ; Central China Normal University(华中师范大学) ; Lingxin AI(灵心AI) ; Yuquan Hospital, Tsinghua University(清华大学友谊医院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * Xi’an Jiaotong University(西安交通大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; City University of Hongkong(香港城市大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Harvard University(哈佛大学) ; vivo Mobile Communication Co.(vivo移动通信公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 22 pages, 16 figures
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学AI研究院) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) ; MoE Key Lab of AI, School of Computer Science, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学计算机学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Lenovo(联想公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
Comments Accepted to ICCV 2025. Project Page: https://liangxuy.github.io/InterVLA/
机构 * Meituan(美团) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
Comments ICCV 2025
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
机构 * Jaypee University of Information Technology(杰伊佩大学信息科技学院) ; CortexTor Labs(CortexTor实验室) ; Amity Center for Artificial Intelligence(阿米蒂人工智能中心) ; Indian Institute of Technology Jodhpur(印度理工学院朱道尔)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
机构 * College of Computer Science, Sichuan University(四川大学计算机学院) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Department of Radiology, West China Hospital, Sichuan University(四川大学华西医院放射科) ; College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) ; Department of Mathematics, Sichuan University(四川大学数学系) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院) ; Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore and the Singapore Eye Research Institute, Singapore National Eye Centre(新加坡国立大学 Yong Loo Lin 医学院眼科系及新加坡眼科研所、新加坡国家眼科中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
Comments 17 pages, 6 figures
专题命中 多模态评测 :multi-modal(abstract)
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; OPPO AI Center(OPPO AI中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL 2025 (Oral)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI;multi-modal(comments)
Comments Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence