arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2512.23565 2026-01-29 cs.CV cs.AI 84%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 79%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 79%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17045 2026-01-29 cs.CV cs.AI cs.MM 75%

RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis

RacketVision: 一种多 racket 运动基准数据集用于统一的球和 racket 分析

Linfeng Dong, Yuchen Yang, Hao Wu, Wei Wang, Yuenan Hou, Zhihang Zhong, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 RacketVision 是一个用于多 racket 运动分析的基准数据集,通过细粒度注释和 CrossAttention 机制提升球轨迹预测性能。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20689 2026-01-29 cs.CV cs.AI 73%

Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework

解耦感知与校准:一种标签高效的图像质量评估框架

Xinyue Li, Zhichao Zhang, Zhiming Xu, Shubo Xu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Baidu(百度)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LEAF通过蒸馏多模态大语言模型的感知先验,实现轻量级图像质量评估,减少对人类标注的依赖,同时保持与人类注释的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10258 2026-01-29 cs.CV cs.MM 62%

XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark

XY-Cut++: 一种基于新型基准的分层遮罩机制的高级布局排序方法

Shuai Liu, Youmeng Li, Jizeng Wei

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 XY-Cut++通过分层遮罩机制在新型基准上实现高级布局排序,提升文档阅读顺序恢复的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 57%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08477 2026-01-29 cs.CL 57%

Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection

读取即可见:引导单模LLM进行低资源可解释有害迷因检测

Fengjun Pan, Xiaobao Wu, Tho Quan, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Ho Chi Minh City University of Technology(胡志明市技术大学) VinUniversity(文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 U-CoT+通过轻量级单模LLM和高保真迷因到文本管道,实现低资源、可解释的有害迷因检测,有效提升模型灵活性和适应性。

Comments Accepted to ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏