arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2608.30563 2026-09-01 cs.CV 新提交 83%

Modality Disentangled Learning for Incomplete Multimodal Emotion Recognition: A Primitive Memory Distillation Perspective

面向不完整多模态情感识别的模态解耦学习:一种原语记忆蒸馏视角

Jiaqi Zhang, Zheng Pang, Mengting Li, Yiqi Wang, Guangyuan Dong, Chao Xue, Yusen Wu, Zihao Li, Huy Phan, Sicheng Zhao, Björn W. Schuller, Jiachen Luo

机构 * Jiangsu University(江苏大学) Griffith University(格里菲斯大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) Fujian University of Technology(福建理工大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Imperial College London(伦敦帝国学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文针对不完整多模态情感识别中现有方法忽略模态异质性的问题,提出PriMD框架,通过解耦语义与原语构建记忆库,在多数据集上实现SOTA性能与更强鲁棒性。

Comments 19 Pages, 8 Figures, 13 Tables. Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30649 2026-09-01 cs.CL cs.CV 新提交 81%

Where Identity Lives: Localized, Retain-Free Identity Unlearning in Multimodal Large Language Models

身份信息的留存位置:多模态大语言模型中无保留集的本地化身份遗忘

Kangwook Ko, Jaehyuk Jang, Wonjun Lee, Hee-Seon Kim, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究针对多模态大语言模型身份遗忘需依赖难获取保留集的问题,提出PAVA方法,定位解码器早期到中期MLPs并结合遗忘损失与视觉属性锚定,在基准上取得良好遗忘-保留权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15858 2026-09-01 cs.IR cs.LG 78%

Optimizing Product Deduplication in E-Commerce with Multimodal Embeddings

利用多模态嵌入优化电子商务中的产品去重

Aysenur Kulunk, Berk Taskin, M. Furkan Eseoglu, H. Bahadir Sahin

机构 * Data Analytics Department Hepsiburada Istanbul, Turkey(数据分析师部门 赫斯伯达 特拉布宗 土耳其)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出了一种基于多模态嵌入的电子商务产品去重方法,结合BERT和MaskedAutoEncoders,利用Milvus数据库实现高效高精度的相似性搜索,F1分数达0.90,优于现有解决方案。

Comments 8 pages, accepted to 2025 IEEE International Conference on Big Data, Industrial and Goverment Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-09-01 cs.CV cs.AI 版本更新 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30233 2026-09-01 cs.CV 新提交 57%

Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

面向通用视觉 grounding 的语义-空间判别性增强

Kaiyan Lei, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对通用视觉 grounding 任务中易混淆相似目标的问题,提出 SSDE 框架,含 SeDE 与 SpDE 模块,在十个数据集上取得优异性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-09-01 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11635 2026-09-01 cs.CR cs.AI 版本更新 57%

FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations

FAA框架:一种基于大语言模型的信用卡欺诈调查方法

Shaun Shuster, Eyal Zloof, Asaf Shabtai, Rami Puzis

机构 * Ben-Gurion University of the Negev(贝纳尔吉翁内盖夫大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出首个基于大语言模型的欺诈调查助手FIA框架,利用LLM能力自动化信用卡欺诈调查关键步骤,在Sparkov和CCTD数据集上经1500次额外调查后F1分数提升8%,可辅助解决模糊警报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00580 2026-09-01 cs.LG stat.ML 版本更新 50%

GFlowNets and variational inference

GFlowNets与变分推断

Esmeralda S. Whitammer, Salem Lahlou, Tristan Deleu, Xu Ji, Edward Hu, Katie Everett, Dinghuai Zhang, Yoshua Bengio

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文建立变分推断与生成流网络的联系,证明特定情形下VI等价于GFlowNets特例,指出GFlowNets更适合离策略训练且利于捕获多模态分布多样性。

Comments ICLR 2023 final version; code: https://github.com/GFNOrg/GFN_vs_HVI

详情

展开后加载摘要…

URL PDF HTML 收藏