arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-24 至 2025-12-24 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2508.13256 2025-12-24 cs.AI cs.CY cs.MA 79%

CardAIc-Agents: A Multimodal Framework with Hierarchical Adaptation for Cardiac Care Support

CardAIc-Agents: 一种用于心脏护理支持的多模态框架,具有分层适应性

Yuting Zhang, Karina V. Bunting, Asgher Champsi, Xiaoxia Wang, Wenqi Lu, Alexander Thorley, Sandeep S Hothi, Zhaowen Qiu, Baturalp Buyukates, Dipak Kotecha, Jinming Duan

机构 * School of Computer Science, University of Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Cardiovascular Sciences, University of Birmingham, UK(英国伯明翰大学心血管科学系) NIHR Birmingham Biomedical Research Centre and West Midlands NHS Secure Data Environment, University Hospitals Birmingham NHS Foundation Trust, UK(英国伯明翰大学医院 NHS 基础信任机构) Department of Computing and Mathematics, Manchester Metropolitan University, UK(曼彻斯特 Metropolitan 大学计算与数学系) Department of Cardiology, Heart and Lung Centre, Royal Wolverhampton NHS Trust, UK(皇家沃尔夫汉普顿 NHS 委员会心内科部门) College of Computer and Control Engineering, Northeast Forestry University, China(中国东北林业大学计算机与控制工程学院) Julius Center, University Medical Center Utrecht, the Netherlands(荷兰乌得勒支大学医学中心朱利叶斯中心) Division of Informatics, Imaging and Data Sciences, University of Manchester, UK(英国曼彻斯特大学信息学、成像与数据科学系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 CardAIc-Agents通过多模态框架和分层适应性,提升心脏护理支持的效率和灵活性,有效解决传统AI代理在适应性推理、工具支持、知识更新和视觉输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19742 2025-12-24 cs.LG 78%

On-device Large Multi-modal Agent for Human Activity Recognition

用于人体活动识别的设备端大多模态智能体

Md Shakhrul Iman Siam, Ishtiaque Ahmed Showmik, Guanqun Song, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种用于人体活动识别的设备端大多模态智能体,结合大语言模型提升性能与可解释性,实现高分类准确率和用户友好交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19933 2025-12-24 cs.CL 70%

PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation

PRISM: 一种基于个性的多智能体框架用于社交媒体模拟

Zhixiang Lu, Xueyuan Deng, Yiran Liu, Yulong Li, Qiang Yan, Imran Razzak, Jionglong Su

机构 * University of Liverpool(利物浦大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University College London(伦敦大学学院) Xi'an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Chinese Academy of Sciences(中国科学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 PRISM通过结合连续情绪演变与基于个性的决策过程,提供了一种更准确模拟社交媒体中个性驱动意见极化的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 70%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11006 2025-12-24 cs.CV cs.AI 62%

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 57%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08674 2025-12-24 cs.AI cs.MA 57%

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

多智能体智能在胃肠肿瘤多学科决策中的应用

Rongzhao Zhang, Junqiao Wang, Shuyun Yang, Mouxiao Bian, Chihao Zhang, Dongyang Wang, Qiujuan Yan, Yun Zhong, Yuwei Bai, Guanxu Zhu, Kangkun Mao, Miao Wang, Chao Ding, Renjie Lu, Lei Wang, Lei Zheng, Tao Zheng, Xi Wang, Zhuo Fan, Bing Han, Meiling Liu, Luyi Jiang, Dongming Shan, Wenzhong Jin, Jiwei Yu, Zheng Wang, Jie Xu, Meng Luo

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏