arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-23 至 2025-12-23 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 10 篇

2512.18477 2025-12-23 cs.RO cs.CV 95%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19133 2025-12-23 cs.RO cs.CV 90%

WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving

WorldRFT: 通过强化微调的潜在世界模型进行自动驾驶的规划

Pengxuan Yang, Ben Lu, Zhongpu Xia, Chao Han, Yinfeng Gao, Teng Zhang, Kun Zhan, XianPeng Lang, Yupeng Zheng, Qichao Zhang

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 WorldRFT通过强化学习微调提升自动驾驶规划性能,实现安全性和效率的双重优化。

Comments AAAI 2026, first version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08139 2025-12-23 cs.IT cs.LG math.IT 90%

SCA-LLM: Spectral-Attentive LLM-Based Wireless World Modeling for Agentic Communications

SCA-LLM:基于频谱-注意力的LLM无线世界建模用于智能通信

Ke He, Le He, Lisheng Fan, Xianfu Lei, Thang X. Vu, George K. Karagiannidis, Symeon Chatzinotas

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠性与信任跨学科研究中心(SnT),卢森堡大学) School of Computer Science of Guangzhou University(广州大学计算机科学学院) School of Information Science and Technology, Institute of Mobile Communications, Southwest Jiaotong University(信息科学与技术学院,移动通信研究所,西南交通大学) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,塞萨洛尼基阿瑞斯托大学) Cyber Security Systems and Applied AI Research Center, Lebanese American University (LAU)(网络安全与应用人工智能研究中心,黎巴嫩美国大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 SCA-LLM通过频谱-注意力适配器将信道状态信息与LLM结合,实现无线世界建模,提升预测性能和零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18489 2025-12-23 cs.AI 81%

Large Language Models as Discounted Bayesian Filters

大语言模型作为折扣贝叶斯滤波器

Jensen Zhang, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本研究提出了一种贝叶斯过滤框架,揭示大语言模型在动态环境中的信念更新机制,并提出提示策略以优化其先验校准。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17992 2025-12-23 cs.RO 81%

Unifying Deep Predicate Invention with Pre-trained Foundation Models

统一深度谓词发明与预训练基础模型

Qianwei Wang, Bowen Li, Zhanpeng Luo, Yifan Xu, Alexander Gray, Tom Silver, Sebastian Scherer, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Engineering Division, University of Michigan(密歇根大学计算机科学与工程系) Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系) Centaur AI Institute(Centaur人工智能研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 UniPred通过双层学习框架统一深度谓词发明与预训练基础模型,提升机器人任务的可扩展性和灵活性。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 69%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18658 2025-12-23 cs.CL 67%

Does It Tie Out? Towards Autonomous Legal Agents in Venture Capital

是否会平局?迈向风险投资领域的自主法律代理

Pierre Colombo, Malik Boudiaf, Allyn Sweet, Michael Desa, Hongxi Wang, Kevin Candra, Syméon del Marmol

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文提出了一种世界模型架构,旨在实现风险投资领域资本表核对的自动化,为法律智能提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11112 2025-12-23 cs.CL cs.HC cs.IR 67%

Dagstuhl Perspectives Workshop 24352 -- Conversational Agents: A Framework for Evaluation (CAFE): Manifesto

达斯堡视角研讨会 24352 -- 对话代理:评估框架(CAFE):宣言

Christine Bauer, Li Chen, Nicola Ferro, Norbert Fuhr, Avishek Anand, Timo Breuer, Guglielmo Faggioli, Ophir Frieder, Hideo Joho, Jussi Karlgren, Johannes Kiesel, Bart P. Knijnenburg, Aldo Lipani, Lien Michiels, Andrea Papenmeier, Maria Soledad Pera, Mark Sanderson, Scott Sanner, Benno Stein, Johanne R. Trippas, Karin Verspoor, Martijn C Willemsen

机构 * University of Salzburg(萨尔茨堡大学) Hong Kong Baptist University(香港 Baptist 大学) University of Padua(帕多瓦大学) Universität Duisburg-Essen(杜伊斯堡- Essen 大学) TU Delft(代尔夫特理工大学) TH Köln(科隆应用技术大学) Georgetown University(乔治城大学) University of Tsukuba(筑波大学) Silo AI Bauhaus-Universität Weimar(魏玛包豪斯大学) Clemson University(克莱姆斯大学) University College London(伦敦大学学院) imec-SMIT University of Antwerp(安特卫普大学) University of Twente(埃因霍温理工大学) RMIT University(皇家理工学院) University of Toronto(多伦多大学) TU Eindhoven & JADS(埃因霍温理工大学及JADS)

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文提出对话代理评估框架(CAFE),用于评估对话信息访问系统,涵盖六个核心组成部分。

Comments 10 figures; Dagstuhl Manifestos, 11(1), pp 19-67. DOI: 10.4230/DagMan.11.1.19

Journal ref Dagstuhl Manifestos, Volume 11, Issue 1, pp. 19-67, Schloss Dagstuhl - Leibniz-Zentrum fuer Informatik (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17098 2025-12-23 cs.CV 53%

Predictive Modeling of Maritime Radar Data Using Transformer Architecture

使用变换器架构预测海运雷达数据

Bjorna Qesaraku, Jan Steckel

机构 * Cosys-lab, Faculty of applied Engineering, University of Antwerp(Cosys-lab,应用工程学院,安特卫普大学)

专题命中 通用世界模型 :predictive model(title,abstract);分类 cs.CV

AI总结 本文探讨了基于变换器架构的海运雷达数据预测方法,发现现有研究在该领域存在空白,需进一步探索

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18450 2025-12-23 cs.AI cs.CV cs.MA 50%

Agent-Based Output Drift Detection for Breast Cancer Response Prediction in a Multisite Clinical Decision Support System

基于代理的输出漂移检测用于多中心临床决策支持系统中的乳腺癌反应预测

Xavier Rafael-Palou, Jose Munuera, Ana Jimenez-Pastor, Richard Osuala, Karim Lekadir, Oliver Diaz

专题命中 通用世界模型 :分类 cs.AI、cs.CV、cs.MA;predictive model(abstract)

AI总结 本文提出基于代理的多中心临床决策支持系统中的输出漂移检测方法,通过模拟多中心环境验证了其在乳腺癌反应预测中的有效性,展示了自适应方案在漂移检测和严重性分类上的优越性能。

Comments Accepted at MICAD (Medical Imaging and Computer-Aided Diagnosis) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 3 篇

2510.22732 2025-12-23 cs.LG cs.AI cs.CL cs.IR cs.MA cs.RO 67%

WebATLAS: An LLM Agent with Experience-Driven Memory and Action Simulation

WebATLAS: 一种基于经验驱动记忆和动作模拟的LLM代理

Jiali Cheng, Anjishnu Kumar, Roshan Lal, Rishi Rajasekaran, Hani Ramezani, Omar Zia Khan, Oleg Rokhlenko, Sunny Chiu-Webster, Gang Hua, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛威尔分校) Amazon Alexa AI(亚马逊Alexa人工智能)

专题命中 具身与机器人 :world model(comments);world models(comments);分类 cs.AI、cs.LG、cs.RO;world model(comments)

AI总结 WebATLAS通过经验驱动的记忆和前瞻动作模拟,实现无需微调的自主网页导航,成功率达63%。

Comments 9 pages, NeurIPS 2025 Workshop on Language Agents and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 56%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 具身与机器人 :分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12220 2025-12-23 cs.RO 53%

Hybrid Dynamics Modeling and Trajectory Planning for a Cable-Trailer System with a Quadruped Robot

混合动力学建模与电缆-拖车系统四足机器人的轨迹规划

Wentao Zhang, Shaohang Xu, Gewei Zuo, Bolin Li, Jingbo Wang, Lijun Zhu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Data Science, City University of Hong Kong(数据科学系,城市大学) Embodied AI Center of Shanghai AI Lab(上海人工智能实验室具身智能中心)

专题命中 具身与机器人 :dynamics model(title,abstract);分类 cs.RO

AI总结 本文提出了一种混合动力学模型和搜索算法,用于四足机器人与电缆-拖车系统的轨迹规划,通过几何多边形碰撞避免约束实现安全高效的运动控制。

Comments 8 pages, 8 figures, Accept by RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仿真与规划 1 篇

2512.18619 2025-12-23 cs.AI cs.RO 88%

ChronoDreamer: Action-Conditioned World Model as an Online Simulator for Robotic Planning

ChronoDreamer:基于动作的动态世界模型作为机器人规划的在线模拟器

Zhenhao Zhou, Dan Negrut

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 仿真与规划 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO

AI总结 ChronoDreamer通过时空变换器和视觉-语言模型,实现基于动作的动态世界模型,用于机器人规划中的安全动作预测与碰撞检测。

详情

展开后加载摘要…

URL PDF HTML 收藏