arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19865 2025-11-26 cs.AI 70%

Agentic AI-Empowered Conversational Embodied Intelligence Networks in 6G

基于代理AI的6G时代对话具身智能网络

Mingkai Chen, Zijie Feng, Lei Wang, Yaser Khamayseh

机构 * Key Laboratory of Broadband Wireless Communication and Sensor Network Technology(宽带无线通信与传感网络技术重点实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) College of Technological Innovation(技术创新学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于代理AI的6G时代对话具身智能网络,通过多模态融合、自适应通信和可解释性模块,提升复杂任务执行效率与语义一致性。

Comments 7 pages, 8 figures. Preprint submitted to IEEE Vehicle Technology Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 67%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19654 2025-11-26 cs.CV cs.AI cs.CL cs.RO 67%

From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction

从预测到规划:用于协作状态-动作预测的策略世界模型

Zhida Zhao, Talas Fu, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出策略世界模型(PWM),通过整合世界建模与轨迹规划,并利用无动作未来状态预测提升规划性能,实现更可靠的自主驾驶决策。

Comments Accepted by NuerIPS 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 62%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20156 2025-11-26 cs.CV cs.RO 57%

Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving

Map-World: 遮蔽动作规划与路径积分世界模型用于自动驾驶

Bin Hu, Zijian Lu, Haicheng Liao, Chengran Yuan, Bin Rao, Yongkang Li, Guofa Li, Zhiyong Cui, Cheng-zhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Purdue University(普渡大学) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 MAP-World通过结合遮蔽动作规划和路径加权世界模型,实现了高效的多模式自动驾驶规划,无需强化学习即可达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04042 2025-11-26 cs.RO cs.AI 57%

An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue

基于大语言模型的灾难搜索救援中人-群智能协同认知框架

Kailun Ji, Xiaoyu Hu, Xinyu Zhang, Jun Chen

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子工程学院,西北工业大学) Chongqing Institute for Brain and Intelligence, Guangyang Bay Laboratory(脑科学与智能研究院,广阳湾实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的LLM-CRF系统,通过自然交互捕捉意图并实现任务规划,显著提升灾难救援任务效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20429 2025-11-26 astro-ph.CO astro-ph.GA 50%

Estimating the triaxiality of massive clusters from 2D observables in MillenniumTNG with machine learning

从MillenniumTNG模拟中的2D观测数据利用机器学习估计巨团的三轴性

Ana Maria Delgado, Michelle Ntampaka, Sownak Bose, Fulvio Ferlito, Boryana Hadzhiyska, Lars Hernquist, John Soltis, John F. Wu, Mikaeel Yunus, John ZuHone

专题命中 多模态Agent :multi-modal(abstract)

AI总结 利用机器学习从MillenniumTNG模拟中的2D观测数据估计巨团的三轴性和取向,提升团几何估计精度30%

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12963 2025-11-26 q-bio.NC q-bio.QM 50%

Modeling the subjective perspective of consciousness and its role in the control of behaviours

意识的主观视角建模及其在行为控制中的作用

D. Rudrauf, G. Sergeant-Perthuis, O. Belli, Y. Tisserand, G. Di Marzo Serugendo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于投影意识模型的主观视角建模,揭示其在行为控制中的作用,通过智能体模拟展示适应与非适应性行为的生成。

Journal ref Journal of Theoretical Biology Volume 534, 7 February 2022, 110957

详情

展开后加载摘要…

URL PDF HTML 收藏