arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 275 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 275 篇

2606.27146 2026-06-26 cs.RO 新提交 50%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27144 2026-06-26 cs.RO 新提交 50%

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 50%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18667 2026-06-18 q-bio.NC q-bio.QM 新提交 50%

Can neurons speak? Semantic narration of vision at single-cell resolution

神经元能说话吗?单细胞分辨率的视觉语义叙述

Arnau Marin-Llobet, Richard Hakim, Sara Matias, Venkatesh N. Murthy, Na Li, Demba Ba

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13435 2026-06-12 cs.RO 新提交 50%

GIVE: Grounding Human Gestures in Vision-Language-Action Models

GIVE:在视觉-语言-动作模型中接地人类手势

Pengfei Liu, Gen Li, Junqiao Fan, Boyu Ma, Jindou Jia, Yang Xiao, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。

Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏