arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-15 至 2025-09-15 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 7 篇

2509.09730 2025-09-15 cs.CV cs.AI 84%

MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance

Kaikai Zhao, Zhaoxiang Liu, Peng Wang, Xin Wang, Zhicheng Ma, Yajun Xu, Wenjing Zhang, Yibing Nan, Kai Wang, Shiguo Lian

机构 * organization= Data Science \& Artificial Intelligence Research Institute, China Unicom , city= Beijing , postcode= 100033 , country= PR China

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments accepted by Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10059 2025-09-15 cs.CV cs.AI 81%

Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration

Yue Zhou, Litong Feng, Mengcheng Lan, Xue Yang, Qingyun Li, Yiping Ke, Xue Jiang, Wayne Zhang

机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09683 2025-09-15 cs.IR cs.AI 79%

Forecasting Clicks in Digital Advertising: Multimodal Inputs and Interpretable Outputs

Briti Gangopadhyay, Zhao Wang, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团公司) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13818 2025-09-15 cs.CV cs.LG 79%

Building Age Estimation: A New Multi-Modal Benchmark Dataset and Community Challenge

Nikolaos Dionelis, Alessandra Feliciotti, Mattia Marconcini, Devis Peressutti, Nika Oman Kadunc, JaeWan Park, Hagai Raja Sinulingga, Steve Andreas Immanuel, Ba Tran, Caroline Arnold, Nicolas Longépé

机构 * European Space Agency(欧洲航天局) Φ \Phi -lab(Phi实验室) ESRIN(ESRIN研究所) MindEarth(MindEarth公司) Sinergise/ Planet(Sinergise/Planet公司) TelePIX(TelePIX公司) Axelspace Corporation(Axelspace公司) Helmholtz Institute Hereon(海德堡研究所) German Climate Computing Center DKRZ(德国气候计算中心DKRZ)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments 16 pages, 20 figures, 1 table, Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09722 2025-09-15 cs.CV cs.CL cs.LG 76%

Improving MLLM Historical Record Extraction with Test-Time Image

Taylor Archibald, Tony Martinez

机构 * Brigham Young University

专题命中 多模态评测 :MLLM(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11829 2025-09-15 cs.CL cs.AI 62%

Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation

Julia Kreutzer, Eleftheria Briakou, Sweta Agrawal, Marzieh Fadaee, Kocmi Tom

专题命中 多模态评测 :MLLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09799 2025-09-15 cs.LG cs.HC 50%

Distinguishing Startle from Surprise Events Based on Physiological Signals

Mansi Sharma, Alexandre Duchevet, Florian Daiber, Jean-Paul Imbert, Maurice Rekrut

机构 * German Research Center for Artificial Intelligence (DFKI), Cognitive Assistants Lab, Saarland Informatics Campus(德国人工智能研究中心(DFKI)、认知助理实验室、萨尔兰州信息技术校区) Fédération ENAC ISAE-SUPAERO ONERA, Université de Toulouse(ENAC ISAE-SUPAERO ONERA联合会、图卢兹大学)

专题命中 多模态评测 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏