arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2502.17812 2026-02-18 cs.CL cs.LG 79%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15460 2026-02-18 cs.LG cs.CV 74%

On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks

在简单视觉规划任务中多模态大语言模型推理的分布外泛化

Yannic Neuhaus, Nicolas Flammarion, Matthias Hein, Francesco Croce

机构 * Tübingen AI Center -- University of Tübingen(图宾根人工智能中心 -- 图宾根大学) EPFL(瑞士联邦理工学院) ELLIS Institute Finland -- Aalto University(芬兰ELLIS研究所 -- 阿尔托大学)

专题命中 多模态Agent :multimodal(title);分类 cs.CV

AI总结 研究多模态大语言模型在简单视觉规划任务中推理能力的分布外泛化,发现结合多种文本格式的推理方法效果最佳,纯文本模型表现优于图像输入模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15767 2026-02-18 cs.RO cs.AI cs.HC 57%

Robot-Assisted Social Dining as a White Glove Service

机器人辅助社交用餐作为白手套服务

Atharva S Kashyap, Ugne Aleksandra Morkute, Patricia Alves-Oliveira

机构 * University of Michigan(密歇根大学) Leiden University(莱顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究通过参与设计和AI工具,提出机器人辅助社交用餐的白手套服务理念,强调多模态输入、情境敏感行为及角色扩展,以提升残疾人在野外社交用餐中的独立性和尊严。

Comments 20 pages, 9 figures. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15294 2026-02-18 cs.AI 57%

EAA: Automating materials characterization with vision language model agents

EAA: 用视觉语言模型代理自动化材料表征

Ming Du, Yanqi Luo, Srutarshi Banerjee, Michael Wojcik, Jelena Popovic, Mathew J. Cherukara

机构 * Argonne National Laboratory(阿贡国家实验室) Advanced Photon Source(先进光子源) Data Science and Learning Division(数据科学与学习 division) Department of Radiation Oncology(放射肿瘤学系) Northwestern University(西北大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 EAA利用视觉语言模型代理自动化材料表征,通过多模态推理和工具增强操作提升显微镜实验效率,减少操作负担并降低用户专业门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏