Self-Guiding Multimodal LSTM - when we do not have a perfect training dataset for image captioning
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments The paper is under consideration at Computer Vision and Image Understanding
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments The paper is under consideration at Computer Vision and Image Understanding
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments 7 pages, EMNLP 2017
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Add a simple strategy to boost the performance of image captioning task significantly. More details are shown in Section 8 of the paper. The code and related data are available at https://github.com/mjhucla/mRNN-CR ;. arXiv admin note: substantial text overlap with arXiv:1410.1090
Journal ref ICLR 2015
FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。
Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.MM
Journal ref C. Li, Q. Yan, M. Kim, Z. Li, Y. Xu and L. -F. Yu, "Crafting Dynamic Virtual Activities with Advanced Multimodal Models," 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), pp. 120-130
机构 * Ghent University–imec(根特大学–imec)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
Comments Accepted at the workshop "Human - Foundation Models Interaction: A Focus On Multimodal Information" (FoMo-HRI) at IEEE RO-MAN 2025 (Camera-ready version)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments Accepted for publication, Multimodal Learning and Applications Workshop (MULA 2025) @ IEEE/CVF CVPR 2025, Nashville, TN, USA, June 2025. This is the authors' "accepted version"
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments ICME 2024 Camera Ready. Code is available at https://github.com/zhuokaizhao/multimodal-guidance-network
奠基效应塑造了开放大语言模型家族中多模态的进化动态
机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。
Comments 7 pages, 4 figures, 2 tables
机构 * George Mason University(乔治·马歇尔大学) ; Lancaster University(兰卡斯特大学) ; University of Surrey(萨里大学)
专题命中 图文多模态 :multimodal(title,abstract)
Comments Accepted to ICDMW 2025 Workshop on Multimodal AI (MMAI). Full workshop info: https://icdmw25mmai.github.io/
Journal ref Proc. IEEE International Conference on Data Mining Workshops (ICDMW 2025), Workshop on Multimodal AI (MMAI 2025), Los Angeles, USA, December 2025
机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究所) ; Department of Computer Science, Harvard University(哈佛大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments COLM 2025
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Website: https://vpgtrans.github.io Code: https://github.com/VPGTrans/VPGTrans NeurIPS 2023
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments CVPR 2023 accept
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 19 pages
GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Aristotle University(亚里士多德大学) ; Dashub(达舒布)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。
RedDiffuser:通过强化扩散审计多模态安全故障
机构 * Fudan University(复旦大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 研究多模态系统在有害上下文暴露下的安全审计,提出RedDiffuser框架通过扩散模型生成视觉输入,揭示隐藏的安全漏洞,实验显示VLMs在部分有毒文本与视觉上下文结合时存在广泛安全问题。
XSA-MAD:用于变形攻击检测的跨模态语义对齐
机构 * RIKEN AIP(理化学研究所人工智能项目)
专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV
AI总结 针对现有图像型变形攻击检测方法泛化性差的问题,提出基于CLIP的多模态框架XSA-MAD,通过对齐图像与语义空间实现对不同变形攻击的检测,在高保真攻击下性能优于现有方法
Comments accepted to ICIP2026
观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐
机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。
VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?
机构 * York University(约克大学) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。
CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合
机构 * University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.AI
AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。
ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; CITIC Securities(中信证券) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。
基于视觉-语言表示学习的场景变化检测
机构 * New York University(纽约大学)
专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV
AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。
Comments 9 pages, 6 figures, 6 tables
LocAnyMed:面向多模态医学图像的视觉-语言定位
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究构建多模态医学视觉定位数据集LocAnyMed-200K及理由增强子集LocAnyMed-CoT-20K,通过微调LocateAnything-3B提升医学定位性能,为相关研究提供统一基础。
Comments Technical report; work in progress. 28 pages, 5 figures, and 16 tables. Code: https://github.com/MiliLab/LocAnyMed
MIRROR:从其他视角学习以进行多模态推理
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI
AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。
用于遥感图像理解的多模态大语言模型:领域特定还是通用?
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) ; Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文针对遥感图像理解的多模态大语言模型展开研究,通过系统调查和评估,比较其与通用模型在不同任务上的表现,发现当前模型存在局限,进而给出未来方向,为开发相关模型提供系统参考。
Comments 27 pages, 11 figures
随机元遗忘:连接语言主干与多模态遗忘
机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) ; Cisco Research(思科研究院) ; Michigan State University(密歇根州立大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。
Comments 15 pages
AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV
AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。
Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures
RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) ; Nanyang Technological University(南洋理工大学) ; Chongqing University(重庆大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ
多模态焦点的潮起潮落:为基于视觉的语言模型推理调度视觉中继窗口
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; School of Fashion and Textiles, The Hong Kong Polytechnic University(香港理工大学纺织及制衣学院) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 研究视觉语言模型视觉证据不稳定问题,通过剖析其内部多模态注意力焦点的三阶段分布,提出TRACE框架,该框架能自适应控制推理,在多模型和多基准测试中显著提升基于证据的多模态推理能力。