arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3146 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3146 篇

2605.25343 2026-05-26 cs.CV 57%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18745 2026-05-26 stat.ML cs.LG cs.NA math.NA math.PR q-fin.MF stat.CO 57%

SURGE: Approximation and Training Free Particle Filter for Diffusion Surrogate

SURGE: 扩散替代模型的近似与免训练粒子滤波

Lifu Wei, Yinuo Ren, Naichen Shi, Yiping Lu

机构 * Department of Mechanical Engineering, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出一种基于扩散模型的无偏粒子滤波方法,通过序列蒙特卡洛对扩散轨迹进行重加权和重采样,融合观测数据与模型模拟,实现状态估计的连续校正。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21072 2026-05-21 cs.CV 57%

Q-ARVD: Quantizing Autoregressive Video Diffusion Models

Q-ARVD: 对自回归视频扩散模型进行量化

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文针对自回归视频扩散模型(ARVD)的量化问题,提出了一种新的框架Q-ARVD,解决了帧间量化敏感度不平衡和权重中异质性异常模式的问题,从而提高了模型效率。

Comments Code: https://github.com/tsa18/Q-ARVD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 57%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18181 2026-05-19 cs.AI cs.CL 57%

Scalable Environments Drive Generalizable Agents

可扩展环境驱动可泛化的智能体

Jiayi Zhang, Fanqi Kong, Guibin Zhang, Maojia Song, Zhaoyang Yu, Jianhao Ruan, Jinyu Xiang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom PKU(北京大学) NUS(新加坡国立大学) SUTD(新加坡科技设计大学) UdeM & Mila(蒙特利尔大学及Mila)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨了可泛化智能体需要通过可扩展环境来适应多样任务和未见环境的问题,提出环境扩展的核心挑战,并提出了统一的分类方法和可扩展环境的构建范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17682 2026-05-19 cs.CV 57%

GEM: Gaussian Evolution Model for Occupancy Forecasting and Motion Planning

GEM:用于占用预测和运动规划的高斯演化模型

Cheng Chen, Hao Huang, Saurabh Bagchi

机构 * Purdue University(普渡大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究提出GEM模型,通过高斯演化模型实现高效的占用预测和运动规划,解决了传统方法在时间灵活性、场景演化和连续时间动态匹配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV 57%

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17058 2026-05-19 cs.LG 57%

Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning

学习多时间尺度抽象以进行分层组合规划

Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen

机构 * Department of Electrical Engineering(电气工程系) Automation, Aalto University, Finland(自动化,艾尔沃斯大学,芬兰)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的分层框架,用于解决序列随机组合决策问题,通过多时间尺度目标结构化潜在动态,实现高效的前瞻规划,并联合学习子目标条件预算策略以支持上下文感知的资源分配。

Comments 34 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16115 2026-05-18 cs.RO 57%

Beyond Collision Avoidance: Multi-Robot Yielding and Spatial Affordance in Emergency Evacuations

超越避障:紧急疏散中的多机器人让路与空间可得性

Ning Zhou, Edmund R. Hunt, Nikolai W. F. Bode

机构 * School of Engineering Mathematics and Technology(工程数学与技术学院)

专题命中 具身推理 :navigation(abstract);分类 cs.RO

AI总结 研究通过虚拟疏散实验探讨多机器人让路策略对人类空间期望的影响,发现主动让路优于冻结和效率优先策略,并揭示环境可得性对认知预期的塑造作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14851 2026-05-15 cs.MA cs.AI 57%

IFPV: An Integrated Multi-Agent Framework for Generative Operational Planning and High-Fidelity Plan Verification

IFPV:一种用于生成性操作规划和高保真计划验证的集成多智能体框架

Zhigao Huang, Zhengqing Hu, Dong Chen, Shaohan Zhang, Zhao Jin, Bo Zhang, Han Wu, Mingliang Xu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) National Supercomputing Center in Zhengzhou(郑州国家超算中心) Henan Research Center for Large Model Technology(河南省大模型技术与新质软件工程研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 IFPV通过多视角分层智能体和对抗认知仿真引擎,提升复杂战场环境下的规划准确性和验证严格性,实验显示其在任务成功率和运营成本上有显著提升。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 57%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 57%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV 57%

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10404 2026-05-12 cs.CV 57%

Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off Inevitable

位置:生命记录视频流使隐私与效用的权衡不可避免

Tianyuan Zou, Liang Yue, Yang Liu, Ya-Qin Zhang, Sijie Cheng

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华大学人工智能产业研究院) RayNeo.AI, Shenzhen, China(深圳RayNeo.AI) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 生命记录视频流虽提升AI系统效用,但暴露敏感信息引发隐私风险,现有保护措施无法兼顾效用与隐私,需进一步研究权衡设计与标准化评估。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG 57%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 57%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04899 2026-05-12 cs.LG 57%

A geometric relation of the error introduced by sampling a language model's output distribution to its internal state

语言模型输出分布采样引入的误差与内部状态的几何关系

Albert F. Modenbach

机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。

Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03490 2026-05-11 cs.LG q-bio.NC 57%

Path Integration and Object-Location Binding Emerge in an Action-Conditioned Predictive Sequence Network

路径整合与物体-位置绑定在动作条件预测序列网络中出现

Linda Ariel Ventura, Victoria Bosch, Tim C Kietzmann, Sushrut Thorat

机构 * Sorbonne University(索邦大学) Institute of Cognitive Science(认知科学研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究探讨了动作条件预测序列网络如何通过上下文学习提升预测准确性,并揭示了路径整合和动态绑定在结构化表示中的作用。

Comments 8 pages, 4 figures; accepted at CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 57%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07516 2026-05-08 cs.AI cs.CL 57%

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM: 一种面向流行路径查询的多智能体方法

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of Utah(犹他大学) Monash University(莫纳什大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 具身推理 :navigation(abstract);分类 cs.AI

AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04212 2026-05-04 cs.CL cs.AI 57%

Language Models Struggle to Use Representations Learned In-Context

语言模型在上下文学习的表示使用上面临困难

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova

机构 * Brown University(布朗大学) Google Research(谷歌研究) New York University(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究探讨了语言模型是否能利用上下文学习的表示完成简单下游任务,发现开放权重模型在处理新语义表示时存在困难,即使它们在潜在表示中编码了这些语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27899 2026-05-01 cs.AI 57%

Simulating clinical interventions with a generative multimodal model of human physiology

用生成式多模态模型模拟临床干预

Guy Lutsker, Gal Sapir, Jordi Merino, Smadar Shilo, Anastasia Godneva, Eli Meirom, Shie Mannor, Hagai Rossman, Gal Chechik, Eran Segal

机构 * Department of Computer Science and Applied Mathematics, Weizmann Institute of Science(魏茨曼科学研究所计算机科学与应用数学系) Department of Molecular Cell Biology, Weizmann Institute of Science(魏茨曼科学研究所分子细胞生物学系) NVIDIA Novo Nordisk Foundation Center for Basic Metabolic Research, University of Copenhagen(诺沃维克基金会基础代谢研究中心,哥本哈根大学) Faculty of Medical and Health Sciences, Tel Aviv University(特拉维夫大学医学与健康科学学院) The Jesse Z and Sara Lea Shafer Institute for Endocrinology and Diabetes, National Center for Childhood Diabetes, Schneider Children’s Medical Center of Israel(杰西Z和索菲亚·李·沙弗内分泌学与糖尿病研究所,以色列儿童糖尿病国家中心,施耐德儿童医学中心) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出HealthFormer模型,通过训练人类表型项目数据,生成人类生理轨迹,实现对个体生理变化的预测和干预模拟,提升临床风险评分和疾病预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27576 2026-05-01 cs.LO cs.LG 57%

BAss: Symbolic Reasoning in Abstract Dialectical Frameworks

BAss:基于BDD的抽象辩证框架符号推理

Samuel Pastva, Van-Giang Trinh

机构 * Faculty of Informatics, Masaryk University(马萨里克大学信息学院) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学计算机科学与工程学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 BAss基于BDD提出新型分析工具,实现抽象辩证框架的所有可接受、完整和优先解释的全符号计算,优于现有工具并在大规模解空间场景中表现优异,推动系统生物学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04978 2026-05-01 cs.AI 57%

Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI

对齐感知、推理、建模与交互:物理AI的综述

Kun Xiang, Terry Jingchen Zhang, Yinya Huang, Jixi He, Zirong Liu, Yueling Tang, Ruizhe Zhou, Lijing Luo, Youpeng Wen, Xiuwei Chen, Bingqian Lin, Jianhua Han, Hang Xu, Hanhui Li, Bin Dong, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25329 2026-04-29 cs.RO 57%

ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution

ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划

Chuyao Fu, Shengzhe Gan, Zhuoli Ouyang, Yuhan Rui, Xiaowei Chi, Sirui Han, Jiankun Wang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。

Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23278 2026-04-28 cs.AI 57%

Active Inference: A method for Phenotyping Agency in AI systems?

主动推断:一种用于AI系统中表型代理的方法?

Philip Wilson, Axel Constant, Mahault Albarracin, Nicolás Hinrichs, Jasmine Moore, Daniel Polani, Karl Friston

机构 * Independent Researcher Laboratoire d'Analyse Cognitive de l'Information, Universit\' e du Qu\' e bec \` a Montr\' e al, Qu\' e bec, Canada Centre of Excellence for AI Robotics, Sheffield Hallam University, Sheffield, UK Methods Statistical Computing, Max Planck Institute for Human Cognitive Brain Sciences, Leipzig, Germany Department of Computer Science, School of Physics, Engineering Computer Science, University of Hertfordshire, Hatfield, UK Wellcome Centre for Human Neuroimaging, University College London, London, UK Department of Engineering Informatics, University of Sussex, Falmer, Brighton, BN1 9RH, UK

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出基于主动推断的表型代理方法,通过变分框架将信念、偏好和自由能最小化结合,以区分不同代理表型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22618 2026-04-27 cs.LG 57%

Beyond Patient Invariance: Learning Cardiac Dynamics via Action-Conditioned JEPAs

超越患者不变性:通过动作条件化JEPAs学习心脏动力学

Jose Geraldo Fernandes, Luiz Facury, Pedro Robles Dutenhefner, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西联邦大学矿务格里斯矿大学) Belo Horizonte, Brazil(巴西伯洛霍内)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出动作条件化世界模型,通过学习疾病进展动力学,区分稳定解剖特征与动态病理力量,提升心电图关键分诊任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 57%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏