arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-25 至 2025-09-25 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2509.20021 2025-09-25 cs.AI cs.CL cs.RO 73%

Embodied AI: From LLMs to World Models

Tongtong Feng, Xin Wang, Yu-Gang Jiang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE CASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15275 2025-09-25 cs.CV cs.AI 62%

Challenges and Trends in Egocentric Vision: A Survey

Xiang Li, Heqian Qiu, Lanxiao Wang, Hanwen Zhang, Chenghao Qi, Linfeng Han, Huiyu Xiong, Hongliang Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments This article was accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14480 2025-09-25 cs.RO cs.CL cs.CV cs.LG 62%

GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering

Saumya Saxena, Blake Buchanan, Chris Paxton, Peiqi Liu, Bingqing Chen, Narunas Vaskevicius, Luigi Palmieri, Jonathan Francis, Oliver Kroemer

机构 * Carnegie Mellon University(卡内基梅隆大学) Neya Systems(Neya系统) Agility Robotics(敏捷机器人) Hello Robot Bosch Center for AI(博世人工智能中心)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Project website: https://saumyasaxena.github.io/grapheqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16803 2025-09-25 cs.RO cs.CV cs.NI eess.IV 57%

RG-Attn: Radian Glue Attention for Multi-modality Multi-agent Cooperative Perception

Lantao Li, Kang Yang, Wenqi Zhang, Xiaoxue Wang, Chen Sun

机构 * Sony (China) Limited(索尼(中国)有限公司) Renmin University of China(中国人民大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 DriveX workshop (Final Version)

详情

展开后加载摘要…

URL PDF HTML 收藏