arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3146 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3146 篇

2603.03515 2026-03-05 cs.CY cs.AI 57%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 57%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20550 2026-02-25 cs.CV 57%

The Finite Primitive Basis Theorem for Computational Imaging: Formal Foundations of the OperatorGraph Representation

计算成像的有限原始基定理:操作图表示法的正式基础

Chengshuai Yang

机构 * NextGen PlatformAI C Corp, USA(NextGen平台AI公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究提出有限原始基定理,证明所有成像前向模型可表示为由11个标准原语构成的DAG,并通过实验验证其在多种成像模态中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19503 2026-02-24 cs.CV 57%

A Text-Guided Vision Model for Enhanced Recognition of Small Instances

一种基于文本引导的视觉模型,用于提升小实例的识别

Hyun-Ki Jung

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出了一种基于文本引导的改进YOLO-World模型,通过优化主干网络结构提升小物体检测精度和模型轻量化性能。

Comments Accepted for publication in Applied Computer Science (2026)

Journal ref Applied Computer Science, Vol. 22, No. 1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17217 2026-02-20 cs.AI 57%

Continual learning and refinement of causal models through dynamic predicate invention

通过动态谓词发明实现因果模型的持续学习与完善

Enrique Crespo-Fernandez, Oliver Ray, Telmo de Menezes e Silva Filho, Peter Flach

机构 * University of Bristol(布里斯托大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL 57%

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 57%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 57%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03762 2026-01-30 cs.CL cs.AI 57%

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

虚拟大脑:迈向大型语言模型中人工通用智能的缺失部件

Yuxi Ma, Chi Zhang, Song-Chun Zhu

机构 * Beijing Insitute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型中人工通用智能的缺失部件,提出智能代理应具备无限任务执行、任务生成、价值系统和现实世界模型等特征,并强调知与行的统一对智能发展的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 57%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 57%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15946 2026-01-19 cs.LG cs.AR hep-ex 57%

AIE4ML: An End-to-End Framework for Compiling Neural Networks for the Next Generation of AMD AI Engines

AIE4ML:一个端到端框架,用于为下一代AMD AI引擎编译神经网络

Dimitrios Danopoulos, Enrico Lupi, Chang Sun, Sebastian Dittmeier, Michael Kagan, Vladimir Loncar, Maurizio Pierini

机构 * Institute of Physics Belgrade, Serbia(塞尔维亚贝尔格莱物理研究所) Physikalisches Institut, Heidelberg University, Germany(德国海德堡大学物理研究所) SLAC National Accelerator Laboratory, Menlo Park, CA, USA(美国Menlo Park加州SLAC国家加速器实验室)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 AIE4ML是一个端到端框架,用于将AI模型自动转换为优化的固件,以在AMD AIE-ML设备上实现高效神经网络执行,同时支持向前兼容新架构,提供高效率和低延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14981 2026-01-16 cs.CV 57%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 57%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15234 2026-01-06 q-bio.NC cs.AI 57%

Adaptive Intelligence: leveraging insights from adaptive behavior in animals to build flexible AI systems

自适应智能:借鉴动物适应性行为的洞察来构建灵活的AI系统

Mackenzie Weygandt Mathis

机构 * Biological intelligence is inherently adaptive(生物智能本质上是适应性的)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出通过借鉴动物适应性行为的洞察,构建能够在线学习、泛化和快速适应环境变化的自适应AI系统。

Comments 10 pages, 4 figures

Journal ref Nature Neuroscience Dec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22973 2026-01-05 cs.CV 57%

YOLO-IOD: Towards Real Time Incremental Object Detection

YOLO-IOD:朝向实时增量物体检测

Shizhou Zhang, Xueqiang Lv, Yinghui Xing, Qirui Wu, Di Xu, Chen Zhao, Yanning Zhang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 YOLO-IOD通过解决增量学习中的知识冲突问题,提出了一种基于预训练YOLO-World模型的实时增量物体检测框架,有效减少遗忘并提升检测性能。

Comments AAAI 2026 accepted. Code & models are available at: https://github.com/qiangzai-lv/YOLO-IOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18741 2025-12-24 cs.CV 57%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18489 2025-12-23 cs.AI 57%

Large Language Models as Discounted Bayesian Filters

大语言模型作为折扣贝叶斯滤波器

Jensen Zhang, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本研究提出了一种贝叶斯过滤框架,揭示大语言模型在动态环境中的信念更新机制,并提出提示策略以优化其先验校准。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 57%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV 57%

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15621 2025-12-18 cs.CV 57%

OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence

OccSTeP:4D占用率时空持续性基准测试

Yu Zheng, Jie Hu, Kailun Yang, Jiaming Zhang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 OccSTeP提出了一种4D占用率时空持续性基准,通过OccSTeP-WM模型实现对自动驾驶中未来行为的反应和前瞻性预测,实验结果显示其在语义和占用率指标上均有显著提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14020 2025-12-17 cs.CV 57%

Deep Learning Perspective of Scene Understanding in Autonomous Robots

自主机器人场景理解的深度学习视角

Afia Maham, Dur E Nayab Tashfa

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文从深度学习角度综述了自主机器人场景理解中的关键技术,包括目标检测、语义分割、深度估计等,探讨了其在动态环境中的应用与挑战。

Comments 11 pages. Review Paper on Deep Learning Perspective of Scene Understanding in Autonomous Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13707 2025-12-17 physics.bio-ph cs.LG cs.NE stat.ML 57%

Modular connectivity in neural networks emerges from Poisson noise-motivated regularisation, and promotes robustness and compositional generalisation

神经网络中的模块化连接源于受泊松噪声启发的正则化,并促进鲁棒性和组合泛化

Daoyuan Qian, Qiyao Liang, Ila Fiete

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, MA 02139, U.S.A.(麦戈文脑科学研究所,麻省理工学院) K. Lisa Yang Integrative Computational Neuroscience Center in the Yang-Tan Collective(李嘉诚整合计算神经科学中心) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology, MA 02139, U.S.A.(脑科学与认知科学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, MA 02139, U.S.A.(电气工程与计算机科学系,麻省理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本研究通过受泊松噪声启发的正则化方法,揭示了神经网络中模块化连接的形成机制,并展示了其在提升鲁棒性和泛化能力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 57%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 57%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23008 2025-12-09 cs.CV 57%

ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View

ARSS: 通过单视角生成视图的解码器-only 自回归视觉生成的控制

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 ARSS通过单视角生成视图,利用自回归模型和相机轨迹指导提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03418 2025-12-04 cs.CV cs.HC 57%

YOLOA: Real-Time Affordance Detection via LLM Adapter

YOLOA:通过LLM适配器实现实时的可及性检测

Yuqi Ji, Junjie Ke, Lihuo He, Jun Liu, Kaifan Zhang, Yu-Kun Lai, Guiguang Ding, Xinbo Gao

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) School of Software, Tsinghua University(软件学院,清华大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。

Comments 13 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏