arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2511.19417 2025-11-25 cs.CL cs.AI cs.LG 62%

Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration

Be My Eyes: 通过多智能体协作扩展大型语言模型到新模态

James Y. Huang, Sheng Zhang, Qianchu Liu, Guanghui Qin, Tinghui Zhu, Tristan Naumann, Muhao Chen, Hoifung Poon

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 BeMyEyes通过多智能体协作扩展LLMs到多模态推理,利用高效VLMs与强大LLMs的互补优势,实现轻量级开源解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19046 2025-11-25 cs.CV cs.AI 62%

MedSAM3: Delving into Segment Anything with Medical Concepts

MedSAM3:深入探索医学概念中的分割任务

Anglin Liu, Rundong Xue, Xu R. Cao, Yifan Shen, Yi Lu, Xiang Li, Qianqian Chen, Jintai Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM3通过引入可文本提示的医学分割模型,实现了基于开放词汇文本描述的精准解剖结构分割,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15253 2025-11-25 cs.HC cs.AI 57%

PresentCoach: Dual-Agent Presentation Coaching through Exemplars and Interactive Feedback

PresentCoach: 通过典范和交互反馈的双智能体演示指导

Sirui Chen, Jinsong Zhou, Xinli Xu, Xiaoyu Yang, Litao Guo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 PresentCoach通过双智能体系统,结合典范和交互反馈,提供高效的演示技能指导,提升学习者在教育和专业领域的表现能力。

Comments 13pages,6figures

详情

展开后加载摘要…

URL PDF HTML 收藏