VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity Control
专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICCV 2023 (17 pages, 6 figures, 22 tables)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICCV 2023 (17 pages, 6 figures, 22 tables)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted to ICCV 2023. Code and models: https://github.com/JacobYuan7/RLIPv2
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 4 pages, 1 figure
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 35 pages, 14 figures. This work has been accepted by Machine Intelligence Research. The arxiv version is kept updating by adding more novel methods, datasets and insights. The official video interpretation of this paper can be referred at https://youtu.be/2lfNaTkcTHI
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 8 pages
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by AAAI 2023 (Student Abstract)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI、cs.MM
Comments Accepted at AACL-IJCNLP 2022 main conference. 9 Pages (main content); 6 Figures; 5 Tables and an Appendix
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)
Comments This work has been accepted to ICRA 2022
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
Comments Accepted to ACM Multimedia 2022 as Poster
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To be published at ACM FAccT 2022
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted at CONSTRAINT 2022 (Colocated with ACL-2022), disinformation, misinformation, factuality, harmfulness, fake news, propaganda, multimodality, text, images, videos, network structure, temporality
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Paper accepted at 2nd International Conference on Machine Learning Techniques and Data Science (MLDS 2021)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)
Comments submitted to IJCAI2022
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 18 pages, 13 figures
专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022 (15 pages; with new video-text and CLIP-ViL experiments)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted for ICASSP 2022
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Camera ready for Findings of EMNLP 2021
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 10 Pages, 1 Figure, 3 Tables, Accepted in 12th Machine Learning in Medical Imaging (MLMI 2021) workshop
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To appear in the British Machine Vision Conference (BMVC), September 2018
Journal ref Proceedings of the British Machine Vision Conference (250) 2018
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments To be published in AAAI2021
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted for publication as a long paper in EMNLP2020
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)
Comments 7 pages, 4 figures, Small fixes on Eqation. (9) and (19)
Journal ref 2019 International Conference on Robotics and Automation (ICRA), Montreal, QC, Canada, 2019, pp. 3151-3157
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学
机构 * Johnson & Johnson Innovative Medicine(强生创新医药)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI;multi-modal(comments)
AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。
Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL;MLLM(comments)
Comments Long Video MLLM; work in progress
GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。
迭代微调对复杂历史梵文手稿转录准确率的影响
机构 * Centre for Inter-disciplinary Artificial Intelligence (CAI)(跨学科人工智能中心(CAI)) ; FLAME University(火焰大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对复杂历史梵文手稿的OCR挑战,提出可在布局与外观层级迭代微调的传统OCR流水线,构建含精细标注的数据集,验证了迭代微调的性能提升并完成多模态大模型基准测试。
代码作为表示:学术文档的可编译解析范式
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。
Comments Accepted by ACM MM 2026
AI对语言的表征中,虚假与不可能是不同的方向
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过对Gemma 3 4B IT模型的激活分析,发现其内部能区分语言的不可能性与虚假,但将偶然虚假混同于矛盾,且不可能性表征与真值、语义异常表征方向不同。