arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-14 至 2025-11-14 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2511.10017 2025-11-14 cs.CV 83%

AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models

Xinyi Wang, Xun Yang, Yanlong Xu, Yuchen Wu, Zhen Li, Na Zhao

机构 * University of Science and Technology of China(科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09804 2025-11-14 cs.AI 79%

SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations

Eric Xie, Danielle Waterfield, Michael Kennedy, Aidong Zhang

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);分类 cs.AI

Comments 32 pages, 14 figures, accepted into EAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09727 2025-11-14 cs.RO cs.AI cs.LG 57%

Baby Sophia: A Developmental Approach to Self-Exploration through Self-Touch and Hand Regard

Stelios Zarifis, Ioannis Chalkiadakis, Artemis Chardouveli, Vasiliki Moutzouri, Aggelos Sotirchos, Katerina Papadimitriou, Panagiotis Filntisis, Niki Efthymiou, Petros Maragos, Katerina Pastra

机构 * Robotics Institute, Athena Research Center(机器人研究所,阿提卡研究中心) HERON – Hellenic Robotics Center of Excellence(HERON – 希腊机器人 excellence 中心) Institute for Language and Speech Processing, Athena Research Center(语言和语音处理研究所,阿提卡研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

Comments 5 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏