arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2608.20944 2026-08-24 cs.CV 新提交 83%

SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection

SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强

Xin Wu, Zhenyu Gao, Qiankun Zhang, Shaoyong Guo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20905 2026-08-24 cs.CV 新提交 83%

EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

EmotionDialogCN:面向普通话情感对话的自发多模态数据集

Yi Zheng, Yifan Xu, Yan Zhou, Hejia Chen, Chunyu Qiang, Xiaoqiang Liu, Xiaohan Li, Shenze Huang, Yue Zhang, Guoying Zhao, Pengfei Wan

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究推出EmotionDialogCN数据集,其规模大、情感分布贴合真实情况,采用新型采集框架减少设备干扰,可支撑多模态情感相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16633 2026-08-24 cs.CL cs.AI cs.MM 版本更新 82%

GeoExplain: Multimodal Reasoning based on Hierarchy of Visual Information in Street View

GeoExplain:基于街景图像视觉信息层次的多模态推理

Fenghua Cheng, Jinxiang Wang, Sen Wang, Zi Huang, Xue Li

机构 * The University of Queensland(昆士兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20874 2026-08-24 cs.CV cs.RO 新提交 79%

Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving

面向自动驾驶的结合语义属性的多模态交通标志检测

Meda Lazar, Sourab Sridhar, Shashwata Gupta, Alexandra Tripcea, Varun Ravi, Senthil Yogamani

机构 * Arriver System Software S.r.l.(Arriver系统软件有限责任公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司) Qualcomm Auto Ltd.(高通汽车有限公司) Qualcomm Technologies, Inc(高通技术公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中交通标志检测的跨区域泛化差、远距离小目标检测弱、跟踪易受透视畸变影响的问题,提出多模态框架,结合LiDAR与相机,引入强度感知可变形融合模块、双运动模型跟踪器及语义属性分类流水线,在多国数据集上取得低漏检率,实现全球可泛化的商用级交通标志感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20384 2026-08-24 cs.AI 新提交 79%

Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles

基于线性判别树集成的可解释多模态分类

Mojtaba Moattari

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态分类器需平衡准确率与可解释性的需求,提出基于线性判别树集成的框架,在多模态情感行为分类任务中实现了优于基线模型的性能与更高的人类标注一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-08-24 cs.DB 版本更新 78%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 62%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21360 2026-08-24 cs.CV 新提交 57%

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

机构 * Nankai University(南开大学) University of Waterloo(滑铁卢大学) Nanjing University(南京大学)

专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV

AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。

Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 57%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 57%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20807 2026-08-24 cs.AI cs.HC cs.LG 新提交 57%

Neuro-Geospatial Modelling of EEG Affective States Using Literature-Informed Environmental Context

基于文献先验环境上下文的脑电情感状态神经地理空间建模

Utsav Poudel, Jagannath Aryal, Subramaniyaswamy Vairavasundaram

机构 * The University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出双塔式架构融合EEG-Conformer与图环境编码器,利用文献先验环境上下文提升EEG情感分类性能,在EAV基准上准确率达76.2%,为相关联合研究提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 57%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13400 2026-08-24 cs.CV 版本更新 57%

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 50%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏