arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-26 至 2025-09-26 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2509.21050 2025-09-26 cs.LG cs.AI 83%

GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions

Bing Liu, Wenqiang Yv, Xuzheng Yang, Shichang Wang, Junzhuo Liu, Peng Wang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20858 2025-09-26 cs.GR cs.CV cs.MM 81%

ArchGPT: Understanding the World's Architectures with Large Multimodal Models

Yuze Wang, Luo Yang, Junyi Wang, Yue Qi

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) School of Computer Science and Technology(计算机科学与技术学院) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00213 2025-09-26 cs.CV cs.AI 81%

Multimodal Deep Learning for Phyllodes Tumor Classification from Ultrasound and Clinical Data

Farhan Fuad Abir, Abigail Elliott Daly, Kyle Anderman, Tolga Ozmen, Laura J. Brattain

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Massachusetts General Hospital, Department of Surgery, Section of Breast Surgery(麻省总医院,外科部,乳腺外科) Department of Medicine, University of Central Florida College of Medicine(医学系,中央佛罗里达大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments IEEE-EMBS International Conference on Body Sensor Networks (IEEE-EMBS BSN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19096 2025-09-26 cs.CV cs.SE 79%

Investigating Traffic Accident Detection Using Multimodal Large Language Models

Ilhan Skender, Kailin Tong, Selim Solmaz, Daniel Watzenig

机构 * Embedded Systems Group (Dept.-E)(嵌入式系统组) Virtual Vehicle Research GmbH(虚拟车辆研究公司) Control Systems Group (Dept.-E)(控制系统组) Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18157 2025-09-26 cs.CY cs.LG 78%

Learning Progression-Guided AI Evaluation of Scientific Models To Support Diverse Multi-Modal Understanding in NGSS Classroom

Leonora Kaldaras, Tingting Li, Prudence Djagba, Kevin Haudek, Joseph Krajcik

专题命中 多模态评测 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19993 2025-09-26 cs.CL cs.AI cs.HC 76%

MathBuddy: A Multimodal System for Affective Math Tutoring

Debanjana Kar, Leopold Böss, Dacia Braca, Sebastian Maximilian Dennerlein, Nina Christine Hubig, Philipp Wintersberger, Yufang Hou

机构 * IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary Transformation 大学) IBM Research India(印度 IBM 研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21291 2025-09-26 cs.AI cs.CV 62%

VC-Agent: An Interactive Agent for Customized Video Dataset Collection

Yidan Zhang, Mutian Xu, Yiming Hao, Kun Zhou, Jiahao Chang, Xiaoqiang Liu, Pengfei Wan, Hongbo Fu, Xiaoguang Han

机构 * SSE, The Chinese University of Hong Kong, Shenzhen(深圳中文大学香港科技大学 SSE) The Hong Kong University of Science(香港科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Project page: https://allenyidan.github.io/vcagent_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20920 2025-09-26 cs.CV 57%

RIS-LAD: A Benchmark and Model for Referring Low-Altitude Drone Image Segmentation

Kai Ye, YingShi Luan, Zhudi Chen, Guangyue Meng, Pingyang Dai, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01733 2025-09-26 cs.CL 57%

ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art

Qi Jia, Xiang Yue, Shanshan Huang, Ziheng Qin, Yizhu Liu, Bill Yuchen Lin, Yang You, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) Guangzhou University(广州大学) Meituan(美团) University of Washington(华盛顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20486 2025-09-26 cs.RO 50%

Boosting LiDAR-Based Localization with Semantic Insight: Camera Projection versus Direct LiDAR Segmentation

Sven Ochs, Philip Schörner, Marc René Zofka, J. Marius Zöllner

机构 * Department of Technical Cognitive Systems, FZI Research Center for Information Technology(技术认知系统部门,信息技术研究所以暨创新中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄大学)

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏