arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2602.20773 2026-02-25 cs.CV 57%

Federated Learning for Cross-Modality Medical Image Segmentation via Augmentation-Driven Generalization

通过增强驱动泛化实现跨模态医学图像分割的联邦学习

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging, Norwegian University of Science and Technology(循环医学成像系,挪威科学与技术大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种联邦学习方法,通过增强驱动泛化实现跨模态医学图像分割,提升模型泛化能力的同时保护数据隐私。

Comments Submitted to IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI 57%

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20923 2026-02-25 cs.RO 50%

ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models

ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测

Jiarong Wei, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE

专题命中 多模态Agent :multi-modal(abstract)

AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。

Comments ICRA 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏