arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-26 至 2026-02-26 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2602.21447 2026-02-26 cs.CR cs.AI cs.CL cs.LG 81%

Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG

对抗意图是潜在变量:用于安全多模态代理RAG的状态信任推断

Inderjeet Singh, Vikas Pahuja, Aishvariya Priya Rathina Sabapathy, Chiara Picardi, Amit Giloni, Roman Vainshtein, Andrés Murillo, Hisashi Kojima, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究机构,英国) Fujitsu Limited, Japan(富士通株式会社,日本)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMA-RAG^T框架,通过状态化信任推断提升多模态代理RAG的安全性,实验显示攻击成功率显著降低。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21517 2026-02-26 cs.CV 79%

Which Tool Response Should I Trust? Tool-Expertise-Aware Chest X-ray Agent with Multimodal Agentic Learning

我应该信任哪个工具响应?具有工具-专业知识意识的胸片代理与多模态代理学习

Zheang Huai, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TEA-CXA,一种具有工具-专业知识意识的胸片代理,通过多模态代理学习解决医疗工具冲突问题,提升多轮工具调用的可靠性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21087 2026-02-26 cs.CV 79%

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

MIRA: 多模态迭代推理代理用于图像编辑

Ziyun Zeng, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MIRA通过多模态迭代推理代理提升图像编辑的语义一致性和感知质量,结合自研数据集和训练流程,实现与专有系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 57%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18676 2026-02-26 cs.HC 50%

MagHeart: Exploring Playful Avatar Co-Creation and Shared Heartbeats for Icebreaking in Hybrid Meetings

MagHeart:探索混合会议中的 playful 虚拟角色共创与共享心跳以促进破冰

Black Sun, Haiyang Xu, Ge Kacy Fu, Liyue Da, Eve Hoggan

专题命中 多模态Agent :multimodal(abstract)

AI总结 MagHeart通过playful虚拟角色共创和共享心跳技术,促进混合会议中的对称破冰,探索远程参与者在会议开始时的物质和感知存在,同时揭示隐私和情境适当性等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏