arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-27 至 2025-08-27 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2412.18292 2025-08-27 cs.RO 78%

Enhancing Multi-Robot Semantic Navigation Through Multimodal Chain-of-Thought Score Collaboration

Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li

机构 * Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li(作者)

专题命中 多模态Agent :multimodal(title,abstract)

Comments 16 pages, 10 figures, Extended Version of accepted AAAI 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05520 2025-08-27 cs.AI 74%

Architecting Clinical Collaboration: Multi-Agent Reasoning Systems for Multimodal Medical VQA

Karishma Thakrar, Shreyas Basavatia, Akshay Daftardar

机构 * Georgia Institute of Technology Atlanta, GA, USA(佐治亚理工学院)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13810 2025-08-27 cs.CV cs.AI cs.LG cs.RO 62%

CAD-Assistant: Tool-Augmented VLLMs as Generic CAD Task Solvers

Dimitrios Mallis, Ahmet Serdar Karadeniz, Sebastian Cavada, Danila Rukhovich, Niki Foteinopoulou, Kseniya Cherenkova, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(斯诺特研究所,卢森堡大学) Artec3D, Luxembourg(Artec3D,卢森堡)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04447 2025-08-27 cs.CV cs.RO 57%

DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge

Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, Fan Lu, He Wang, Zhizheng Zhang, Li Yi, Wenjun Zeng, Xin Jin

机构 * SJTU(上海交通大学) EIT(欧洲研究所) THU(清华大学) Galbot PKU(北京大学) UIUC(伊利诺伊大学香槟分校) USTC(中国科学技术大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏