arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-17 至 2025-12-17 共收录 57 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2410.07553 2025-12-17 cs.AI 79%

COMMA: A Communicative Multimodal Multi-Agent Benchmark

COMMA:一种基于通信的多模态多智能体基准

Timothy Ossowski, Danyal Maqbool, Jixuan Chen, Zefan Cai, Tyler Bradshaw, Junjie Hu

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13573 2025-12-17 cs.CV 79%

MMhops-R1: Multimodal Multi-hop Reasoning

MMhops-R1: 多模态多跳推理

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。

Comments Acceped by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02677 2025-12-17 eess.IV cs.CV 79%

Multimodal Deep Learning for Stroke Prediction and Detection using Retinal Imaging and Clinical Data

基于视网膜成像和临床数据的多模态深度学习用于中风预测与检测

Saeed Shurrab, Aadim Nepal, Terrence J. Lee-St. John, Nicola G. Ghazi, Bartlomiej Piechowski-Jozwiak, Farah E. Shamout

机构 * Division of Engineering, New York University Abu Dhabi(纽约大学阿布扎赫尔分校工程系) Institute for Healthier Living Abu Dhabi(阿布扎赫尔健康生活研究所) Eye Institute at Cleveland Clinic Abu Dhabi(阿布扎赫尔克利夫兰医学中心眼科研究所) Canberra Hospital(堪培拉医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出一种多模态深度学习方法,利用视网膜成像和临床数据预测中风风险,实验结果显示在中风检测和风险预测方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14489 2025-12-17 cs.CV 74%

SignIT: A Comprehensive Dataset and Multimodal Analysis for Italian Sign Language Recognition

SignIT:一个全面的数据集和多模态分析用于意大利手语识别

Alessia Micieli, Giovanni Maria Farinella, Francesco Ragusa

机构 * Computer Science - University of Catania, Italy(计算机科学 - 卡塔尼亚大学,意大利) Next Vision s.r.l., Spin-off of the University of Catania, Italy(2 Next Vision s.r.l.,卡塔尼亚大学分校,意大利)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 SignIT数据集通过多模态分析提升意大利手语识别的性能研究

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14496 2025-12-17 cs.CE 67%

BridgeNet: A Dataset of Graph-based Bridge Structural Models for Machine Learning Applications

BridgeNet: 一种基于图的桥梁结构模型数据集用于机器学习应用

Lazlo Bleker, Mustafa Cem Güneş, Pierluigi D'Acunto

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract)

AI总结 BridgeNet是一个包含20,000个桥梁结构模型的公开数据集,用于促进图机器学习和多模态学习在概念性结构设计中的应用。

Comments GNI Symposium on Artifical Intelligence for the Built World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14574 2025-12-17 cs.CV cs.MM 62%

FoodLogAthl-218: Constructing a Real-World Food Image Dataset Using Dietary Management Applications

FoodLogAthl-218: 通过饮食管理应用构建一个现实世界的食物图像数据集

Mitsuki Watanabe, Sosuke Amano, Kiyoharu Aizawa, Yoko Yamakata

机构 * The University of Tokyo(东京大学) foo.log Inc.(foo.log公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 FoodLogAthl-218数据集通过用户真实餐食照片构建,包含218类食物图像及丰富元数据,提出基于上下文的分类任务和增量微调协议,用于提升饮食管理应用的图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13731 2025-12-17 cs.CV cs.AI 62%

Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline

复杂数学表达式识别:基准测试、大规模数据集和强大基线

Weikang Bai, Yongkun Du, Yuchen Su, Yazhen Xie, Zhineng Chen

机构 * \equalcontrib(机构1)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMER-Bench基准测试和大规模数据集MER-17M和CMER-3M,开发了CMERNet模型,有效提升了复杂数学表达式识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11827 2025-12-17 cs.CY cs.AI cs.CV 62%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14683 2025-12-17 cs.LG 50%

Early Warning Index for Patient Deteriorations in Hospitals

医院患者恶化的早期预警指数

Dimitris Bertsimas, Yu Ma, Kimberly Villalobos Carballo, Gagan Singh, Michal Laskowski, Jeff Mather, Dan Kombert, Howard Haronian

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Operations and Information Management, University of Wisconsin Madison(威斯康星大学麦迪逊分校运营与信息管理系) Technology Management and Innovation, New York University(纽约大学技术管理与创新系) Hartford HealthCare(哈特福德医疗集团) Holistic Hospital Optimization(综合医院优化)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出Early Warning Index模型,通过多模态机器学习预测患者恶化风险,结合SHAP解释提升可解释性,用于医院分诊和资源调度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13903 2025-12-17 cs.RO 50%

PrediFlow: A Flow-Based Prediction-Refinement Framework for Real-Time Human Motion Prediction in Human-Robot Collaboration

PrediFlow: 一种基于流的预测-细化框架,用于人机协作中的实时人体运动预测

Sibo Tian, Minghui Zheng, Xiao Liang

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯农工大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯农工大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 PrediFlow通过整合人类和机器人运动数据,提出了一种基于流的预测-细化框架,以提升实时人机协作中人体运动预测的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2512.06112 2025-12-17 cs.RO cs.AI cs.CV 62%

WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

WAM-Flow:通过离散流匹配实现自动驾驶的并行粗到细路径规划

Yifang Xu, Jiahao Cui, Feipeng Cai, Zhihao Zhu, Hanlin Shang, Shan Luan, Mingwang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(英伟达智能科技有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 WAM-Flow通过离散流匹配实现自动驾驶的并行粗到细路径规划,结合几何感知目标和并行生成,提升闭环性能。

Comments 18 pages, 11 figures. Code & Model: https://github.com/fudan-generative-vision/WAM-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13930 2025-12-17 cond-mat.mtrl-sci cs.AI cs.CL cs.LG cs.MA 62%

Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery

分层多智能体大语言模型推理用于自主功能材料发现

Samuel Rothfarb, Megan C. Davis, Ivana Matanovic, Baikun Li, Edward F. Holby, Wilton J. M. Kort-Kamp

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。

Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG 57%

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17116 2025-12-17 cs.AI 57%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2508.00969 2025-12-17 cs.LG cs.AI 87%

Masked Omics Modeling for Multimodal Representation Learning across Histopathology and Molecular Profiles

掩码组学建模用于病理学与分子特征的多模态表示学习

Lucas Robinet, Ahmad Berjaoui, Elizabeth Cohen-Jonathan Moyal

机构 * Oncopole(奥恩波尔) IRT Saint Exupéry(国际研究与技术圣埃克苏佩里) INSERM Cancer Research Center of Toulouse(里沃利癌症研究中心) Toulouse(图卢兹)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);multimodal foundation model(abstract)

AI总结 MORPHEUS通过整合病理学图像和多组学数据,提出了一种多模态预训练策略,以提升癌症研究中的跨模态表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11160 2025-12-17 cs.CV 79%

A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation

多模态微调的统一框架用于遥感语义分割

Xianping Ma, Xiaokang Zhang, Man-On Pun, Bo Huang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Information Science and Engineering, Wuhan University of Science and Technology(武汉科技大学信息科学与工程学院) Department of Geography, The University of Hong Kong(香港大学地理系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态微调的统一框架,用于改进遥感语义分割的性能,通过引入新的MFNet和DFM模块,显著提升了多模态数据的分割效果。

Comments 15 pages, 11 figures

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 63, pp. 1-15, 2025, Art no. 5405015

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22780 2025-12-17 cs.LG physics.geo-ph 78%

Multimodal Atmospheric Super-Resolution With Deep Generative Models

多模态大气超分辨率与深度生成模型

Dibyajyoti Chakraborty, Haiwen Guan, Jason Stock, Troy Arcomano, Guido Cervone, Romit Maulik

机构 * Information Sciences and Technology(信息科学与技术系) The Pennsylvania State University(宾夕法尼亚州立大学) Environmental Science Division(环境科学部) Argonne National Laboratory(阿贡国家实验室) Department of Geography(地理系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用基于分数的扩散模型进行多模态大气超分辨率,通过结合稀疏观测数据提升高维状态恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13177 2025-12-17 cs.CV cs.RO 70%

MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion

MMDrive: 通过多表示融合超越视觉的交互场景理解

Minghui Hou, Wei-Hsing Huang, Shaofeng Liang, Daizong Liu, Tai-Hao Wen, Gang Wang, Runwei Guan, Weiping Ding

机构 * organization= College of Computer Science Technology, Jilin University , city= Changchun , country= China organization= Georgia Institute of Technology , city= Atlanta , country= USA organization= Qingdao Institute of Software, College of Computer Science Technology, China University of Petroleum (East China) , city= Qingdao , country= China organization= Institute for Math \& AI, Wuhan University , city= Wuhan , country= China organization= University of Michigan, Ann Arbor , country= USA organization= Thrust of Artificial Intelligence, Hong Kong University of Science organization= School of Artificial Intelligence Computer Science, Nantong University , city= Nantong , country= China

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MMDrive通过融合占用图、LiDAR点云和文本描述,实现超越视觉的三维场景理解,提升自动驾驶的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14026 2025-12-17 cs.CV 57%

Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular Barriers

通过打破跨表格障碍释放图像-表格自监督学习的潜力

Yibing Fu, Yunpeng Zhao, Zhitao Zeng, Cheng Chen, Yueming Jin

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CITab框架,通过跨表格学习提升医学图像与表格数据的多模态自监督学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19981 2025-12-17 cs.CV 57%

FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking

FutrTrack: 一种基于相机与激光雷达融合的变压器用于三维多目标跟踪

Martha Teiko Teye, Ori Maoz, Matthias Rottmann

机构 * University of Wuppertal(乌珀塔尔大学) Institute of Computer Science, Osnabrück University(计算机科学研究所,奥斯纳布鲁克大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 FutrTrack通过融合相机与激光雷达数据,利用基于变压器的跟踪框架,在多目标跟踪中实现了高效且鲁棒的跟踪性能。

Comments Accepted to VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14608 2025-12-17 eess.SP 50%

Fusion of Cellular ISAC and Passive RF Sensing for UAV Detection and Tracking

细胞ISAC与被动RF传感的融合用于UAV检测与跟踪

Cole Dickerson, Sean Kearney, Sultan Manjur, Ismail Guvenc, Sevgi Gurbuz, Ali Gurbuz, Ozgur Ozdemir, Mihail Sichitiu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出了一种融合被动RF传感和雷达的无人机检测与跟踪系统,通过卡尔曼滤波器整合异步观测结果,提升跟踪精度和覆盖范围。

Comments Accepted for publication at the 2025 IEEE Asilomar Conference on Signals, Systems, and Computers, Session: UAV Intrusion Detection Using Mobile Communications Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11065 2025-12-17 cs.HC 50%

Immutable Explainability: Fuzzy Logic and Blockchain for Verifiable Affective AI

不可变的可解释性:模糊逻辑与区块链用于可验证的情感人工智能

Marcelo Fransoy, Alejandro Hossian, Hernán Merlino

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出不可变可解释性架构,结合模糊逻辑与区块链,实现情感AI的透明决策和可信审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14019 2025-12-17 cs.LG q-bio.QM 50%

EXAONE Path 2.5: Pathology Foundation Model with Multi-Omics Alignment

EXAONE Path 2.5:多组学对齐的病理基础模型

Juseung Yun, Sunwoo Yu, Sumin Ha, Jonghyun Kim, Janghyeon Lee, Jongseong Jang, Soonyoung Lee

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 EXAONE Path 2.5通过多组学对齐构建病理基础模型,实现更全面的肿瘤生物学建模,展现高效率和适应性,推动精准肿瘤学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2512.14052 2025-12-17 cs.CV cs.CL 81%

HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices

HyperVL: 一种高效的多模态大语言模型用于边缘设备

HyperAI Team, Yuchen Liu, Kaiyang Han, Zhiqiang Xia, Yuhang Dong, Chen Song, Kangyu Tang, Jiaming Xu, Xiushi Feng, WenXuan Yu, Li Peng, Mingyang Wang, Kai Wang, Changpeng Yang, Yang Li, Haoyu Lu, Hao Wang, Bingna Xu, Guangyao Liu, Long Huang, Kaibin Guo, Jinyang Wu, Dan Wu, Hongzhen Wang, Peng Zhou, Shuai Nie, Shande Wang, Runyu Shi, Ying Huang

机构 * HyperAI Team(HyperAI团队) Xiaomi Corporation(小米公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 HyperVL是一种为边缘设备优化的高效多模态大语言模型,通过图像分块、视觉分辨率压缩和双一致性学习技术,实现低延迟、低功耗的多模态推理。

Comments Technical report of Xiaomi HyperAI Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14576 2025-12-17 cs.CL cs.AI 62%

Low-Resource, High-Impact: Building Corpora for Inclusive Language Technologies

低资源、高影响:为包容性语言技术构建语料库

Ekaterina Artemova, Laurie Burchell, Daryna Dementieva, Shu Okabe, Mariya Shmatova, Pedro Ortiz Suarez

机构 * Toloka AI

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本教程提供构建包容性语言技术的实用工具和方法,涵盖多语言和低资源语言的端到端NLP流水线建设。

Comments Tutorial is accepted to LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14082 2025-12-17 cs.CL 57%

A Unified Sparse Attention via Multi-Granularity Compression

一种通过多粒度压缩的统一稀疏注意力机制

Siran Liu, Zane Cao, Yongchao He

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL

AI总结 UniSparse通过多粒度压缩和块级选择,实现高效稀疏注意力机制,提升LLM在长上下文理解和推理中的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14411 2025-12-17 cs.RO 50%

Synthetic Data Pipelines for Adaptive, Mission-Ready Militarized Humanoids

面向适应性、任务导向的军事化人形机器人的合成数据管道

Mohammed Ayman Habib, Aldo Petruzzelli

机构 * Omnia

专题命中 其他多模态 :multimodal(abstract)

AI总结 Omnia提出了一种合成数据管道,用于加速军事化人形机器人的训练、验证和部署准备,通过生成高保真度模拟场景提升感知、导航和决策能力。

Comments 6 pages; xTech Humanoid white paper submission

详情

展开后加载摘要…

URL PDF HTML 收藏