arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-27 至 2026-02-27 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4 篇

2602.21743 2026-02-27 cs.CV 79%

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

通过难度感知分组归一化增强多模态大语言模型推理

Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出难度感知分组归一化方法,通过感知复杂度和推理不确定性表征样本,提升多模态大语言模型的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19709 2026-02-27 cs.RO cs.SY eess.SY 78%

DreamWaQ++: Obstacle-Aware Quadrupedal Locomotion With Resilient Multi-Modal Reinforcement Learning

DreamWaQ++: 基于障碍物感知的四足机器人运动控制与鲁棒多模强化学习

I Made Aswin Nahrendra, Byeongho Yu, Minho Oh, Dongkyu Lee, Seunghyun Lee, Hyeonwoo Lee, Hyungtae Lim, Hyun Myung

机构 * Urban Robotics Lab., School of Electrical Engineering, KAIST(韩国科学技术院电子工程系城市机器人实验室) KRAFTON(KRAFTON公司) URobotics(URobotics公司) Laboratory for Information and Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 DreamWaQ++通过鲁棒多模强化学习融合本体和外源感觉,实现四足机器人在复杂环境中的鲁棒运动控制与敏捷性能。

Comments IEEE Transactions on Robotics 2026. Project site is available at https://dreamwaqpp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22623 2026-02-27 cs.LG cs.AI cs.CL 76%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 其他多模态 :MLLM(title);分类 cs.CL、cs.AI

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22998 2026-02-27 cs.RO 50%

A Perspective on Open Challenges in Deformable Object Manipulation

变形物体操控中的开放性挑战视角

Ryan Paul McKennaa, John Oyekan

机构 * Department of Computer Science, University of York(约克大学计算机科学系)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文探讨了变形物体操控中的关键挑战,包括遮挡处理、任务泛化和实时解决方案,并介绍了多模态感知、物理感知强化学习和生成神经网络等方法,旨在提升机器人在动态环境中的适应性和实用性。

Comments 28 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏