arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2 篇

2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 67%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03175 2026-02-23 cs.LG 50%

Probe-then-Commit Multi-Objective Bandits: Theoretical Benefits of Limited Multi-Arm Feedback

探查-然后承诺多目标老虎机:有限多臂反馈的理论优势

Ming Shi

机构 * Department of Electrical Engineering, University at Buffalo(电气工程系,布法罗大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出PtC-P-UCB算法,通过有限探查提升多目标老虎机的性能,实现$1/\sqrt{q}$的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏