What do vision-language models see in the context? Investigating multimodal in-context learning
机构 * Instituto de Computação, Universidade Estadual de Campinas (UNICAMP)(计算机学院,Campinas州立大学(UNICAMP))
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Instituto de Computação, Universidade Estadual de Campinas (UNICAMP)(计算机学院,Campinas州立大学(UNICAMP))
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) ; University Ss Cyril and Methodius(西里尔与美多西乌斯大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
机构 * Dept. of Informatics (DISI) University of Bologna(信息学院(DISI)博洛尼亚大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Journal ref Proceedings of IEEE International Conference on Content-Based Multimedia Indexing (IEEE CBMI 2025), Dublin, Ireland, 22-24 October 2025
机构 * Department of Horticultural Sciences(园艺科学系) ; Gulf Coast Research and Education Center(墨西哥湾沿岸研究与教育中心) ; University of Florida(佛罗里达大学) ; Department of Agricultural and Biological Engineering(农业与生物工程系) ; Department of Soil, Water, and Ecosystem Sciences(土壤、水与生态系统科学系) ; Citrus Research and Education Center(柑橘研究与教育中心)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
Comments 26 pages, 8 figures, and 2 tables
机构 * University of Chinese Academy of Science, Beijing,100190, China(中国科学院大学) ; Macquarie University(麦考瑞大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Published in Pattern Recognition
机构 * Department of Computer Science(计算机科学系)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 23 pages, 10 figures, 14 tables
机构 * Korea University(韩国大学) ; The Catholic University of Korea(韩国天主大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted to ICCV 2025. Code is available at: https://github.com/QuIIL/ICCV2025_Ano-NAViLa
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 9 figures
机构 * LY Corporation(LY公司) ; Keio University(庆应大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments under review
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
机构 * KAIST, South Korea(韩国釜山国立大学) ; NWPU, China(中国西北工业大学) ; UNIST, South Korea(韩国全南国立大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
Comments accepted by NeurIPS 2025
机构 * ALMAnaCH, INRIA Paris(ALMAnaCH,INRIA巴黎) ; Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS(Télécom巴黎,SES,巴黎高等理工学院,I3-CNRS) ; Télécom Paris, LTCI, Institut Polytechnique de Paris(Télécom巴黎,LTCI,巴黎高等理工学院) ; CNRS, ISIR, Sorbonne University(CNRS,ISIR,索邦大学) ; ISIR, Sorbonne University(ISIR,索邦大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 9 pages
机构 * University of Western Brittany(西部布列塔尼大学) ; Psychiatry Department, CHU Brest(布列塔尼大学精神科部门)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments Preprint version of a manuscript submitted to the Journal of Affective Disorders
专题命中 音频语音多模态 :multimodal(abstract)
机构 * LTIMindTree
专题命中 音频语音多模态 :audio-visual(abstract)
机构 * NVIDIA
专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Technical Report. Code: https://github.com/NVlabs/OmniVinci
机构 * Zhejiang University(浙江大学)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract)
机构 * School of Computing Technologies, RMIT University(计算技术学院,皇家墨尔本理工大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频多模态 :cross-modal(title,abstract);分类 eess.AS
Comments 16 pages, 5 figures, accepted by "IEEE Journal of Selected Topics in Signal Processing"
专题命中 视频多模态 :multimodal(title,abstract)
机构 * International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) ; University of Nottingham Ningbo(诺丁汉大学宁波校区)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * Université Claude Bernard Lyon 1(克莱尔伯恩大学里昂1分校) ; CNRS(国家科学研究中心) ; Ecole Centrale de Lyon(里昂中央理工学院) ; INSA Lyon(里昂工业高等学院) ; Université Lumière Lyon 2(里昂2大学卢米埃尔分校) ; LIRIS(图像研究所)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
机构 * Xiucheng Zhang(未知) ; Yang Jiang(未知) ; Jiashuo Bai(未知)
专题命中 视频多模态 :multimodal(abstract)
Comments 8 pages
专题命中 视频多模态 :multimodal(abstract)
机构 * Ho Chi Minh City Open University, Ho Chi Minh, Vietnam Insight Centre for Data Analytics \& School of Computing, Dublin City University, Dublin, Ireland
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments The paper has been accepted for presentation at the MEDES 2025 conference
机构 * MSR(微软研究院) ; UCAS(中国科学院自动化研究所) ; CASIA(中国科学院自动化研究所) ; Cambridge(剑桥大学) ; NJU(南京大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments Accepted in NeurIPS 2025
专题命中 多模态生成 :multimodal(abstract)
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen University(深圳大学) ; West China Hospital of Sichuan University(四川大学华西医院) ; IHPC, Agency for Science, Technology and Research(科技研究局IHPC)
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACM MM 2025 (also known as GEMeX-ThinkVG)