VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
机构 * ByteDance(字节跳动)
专题命中 多模态生成 :omni-modal(abstract);分类 cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * ByteDance(字节跳动)
专题命中 多模态生成 :omni-modal(abstract);分类 cs.CL、cs.AI
机构 * KAIST(韩国科学技术院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 20 pages
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 3 figures, and published to ICCV2025
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系) ; National University of Singapore(新加坡国立大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments WiCV @ ICCV 2025
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Labs(麻省理工-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer and Information Technology, Purdue University(普渡大学计算机与信息科技系) ; School of Software, Nanchang University(南昌大学软件学院) ; Amazon Prime Video(亚马逊Prime视频) ; Department of Epidemiology and Biostatistics, School of Public Health(公共卫生学院流行病学与生物统计学系) ; Department of Computer Science, College of Nanotechnology, Science, and Engineering(纳米技术、科学与工程学院计算机科学系) ; University at Albany, SUNY(阿尔巴尼大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、cs.MM
机构 * Harvard College(哈佛学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Università degli Studi di Catania(卡塔尼亚大学) ; Università degli Studi di Messina(梅斯纳大学) ; University College London(伦敦大学学院)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science and Engineering, Department of Chemical and Biological Engineering and Division of Life Science, Hong Kong University of Science and Technology(计算机科学与工程系、化学与生物工程系及生命科学分校,香港科学与技术大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by IEEE TMI
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究院,中国科学院大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学) ; Gradiant
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
Comments This work has been accepted for presentation at the 24nd Portuguese Conference on Artificial Intelligence (EPIA 2025) and will be published in the proceedings by Springer in the Lecture Notes in Computer Science (LNCS) series. Please cite the published version when available
机构 * University of Science and Technology Beijing(北京科技大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments ACMMM2025 Accepted
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) ; Department of Radiology, Peking University Third Hospital(北京大学第三医院放射科)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(埃尔摩家庭电气与计算机工程学院,普渡大学) ; Toyota Research Institute(丰田研究院)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Project website is available at https://imagineforme.github.io/
专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI-25
机构 * Synechron
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * China Agricultural University(中国农业大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Ant Group(蚂蚁集团) ; School of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science and Technology and the Ministry of Education Key Lab for Intelligent Networks and Network Security, Xi’an Jiaotong University(计算机科学与技术学院和教育部智能网络与网络安全重点实验室,西安交通大学) ; Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) ; Space Engineering University(航天工程大学) ; School of Mathematics and Statistics, Guangdong University of Technology(数学与统计学院,广东工业大学) ; Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍兹中心)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Sorbonne University(索邦大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted as a non-archival paper at the CVPR 2025 Humanoid Agents Workshop. Project page: https://groundedgestures.github.io
机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted by BioNLP@ACL 2024
Journal ref Proceedings of the 23rd Workshop on Biomedical Natural Language Processing, ACL 2024, pp. 624-634
机构 * Joyspace AI
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门理工学院) ; Netherlands Cancer Institute, Department of Radiology(荷兰癌症研究所,放射科) ; Radboud University Medical Centre, Department of Radiology and Nuclear Medicine(拉德堡德大学医学中心,放射科和核医学科) ; College of Aerospace Science and Engineering, National University of Defense Technology(航空航天科学与工程学院,国防科技大学) ; Medical Department of Breast Cancer, Hunan Cancer Hospital(乳腺癌医学部,湖南癌症医院) ; the Affiliated Cancer Hospital of Xiangya School of Medicine, Central South University(湘雅医学院附属肿瘤医院,中南大学) ; Faculty of Biomedical Engineering, Eindhoven University of Technology(生物医学工程学院,埃因霍温理工大学) ; Laboratory of Advanced Theranostic Materials and Technology, University of Chinese Academy of Sciences(先进诊疗材料与技术实验室,中国科学院大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI
机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) ; Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) ; Department of Magnetic Resonance Imaging, The First Affiliated Hospital of Zhengzhou University(郑州大学第一附属医院磁共振成像科) ; Department of Electronic Science, Xiamen University(厦门大学电子科学系)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Drexel University(德雷塞尔大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI