arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-11 至 2025-08-11 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 6 篇

2508.06009 2025-08-11 cs.CV 79%

MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models

Jun Feng, Zixin Wang, Zhentao Zhang, Yue Guo, Zhihan Zhou, Xiuyi Chen, Zhenyang Li, Dawei Yin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05669 2025-08-11 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports

Jin Khye Tan, En Jun Choong, Ethan Jeremiah Chitty, Yan Pheng Choo, John Hsin Yang Wong, Chern Eu Cheah

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 14 figures, 5 tables. Evaluation code (LLM-as-a-judge and Markdown TEDS) is available at https://github.com/jinkhye/MyFinMarkdown. The development dataset and evaluation benchmark are available on Hugging Face at https://huggingface.co/datasets/jinkhye/MyFinMarkdown-sample and https://huggingface.co/datasets/jinkhye/MyFinMarkdown-bench respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09105 2025-08-11 cs.CV cs.AI cs.CL cs.LG 67%

INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Chenwei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo

机构 * School of Computer Science Fudan University(复旦大学计算机科学学院) Department of Computer Science University of Rochester(罗切斯特大学计算机科学系) School of Economics Fudan University(复旦大学经济学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear in the International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06345 2025-08-11 cs.CL cs.AI cs.GR cs.LG 62%

Harnessing Adaptive Topology Representations for Zero-Shot Graph Question Answering

Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James T. Kwok, Yu Zhang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06072 2025-08-11 cs.CV cs.AI 62%

Can Large Models Fool the Eye? A New Turing Test for Biological Animation

Zijian Chen, Lirong Deng, Zhengyu Chen, Kaiwei Zhang, Qi Jia, Yuan Tian, Yucheng Zhu, Guangtao Zhai

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09505 2025-08-11 cs.RO 50%

TruckV2X: A Truck-Centered Perception Dataset

Tenghui Xie, Zhiying Song, Fuxi Wen, Jun Li, Guangzhao Liu, Zijian Zhao

专题命中 多模态评测 :multi-modal(abstract)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 9, pp. 9312-9319, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏