arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-24 至 2026-08-24 共收录 23 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 4 篇

2608.20114 2026-08-24 cs.AI cs.RO 版本更新 82%

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云神初科技有限公司(深智机器人))

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出DECOWAM模型,通过解耦全身动作因素提升移动操作的视觉与动作预测性能,在真实机器人数据集ARMDOG上验证了其在协调性和鲁棒性上的优势。

Comments 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21951 2026-08-24 cs.IR cs.CR 版本更新 78%

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

SIREN(诱使大语言模型陷入困境):网页增强型大语言模型推荐系统中基于配对驱动的偏好操纵

Evan Caville, Spencer Kayser, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究网页增强型大语言模型推荐系统中排序推荐的对抗操纵问题,提出SIREN方法,利用23种内容中毒技术迭代编辑检索到的网页,在两个Claude模型上实验,使选定实体多次达排名第1,验证了声明性排名等方式的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07980 2026-08-24 eess.AS cs.CL cs.SD 版本更新 50%

The Voiceprint Fallacy: Why Voices Are Not Unique Biometric Imprints

声纹谬误:为何语音并非独特的生物识别印记

Tianle Yang, Cuiling Zhang, Chengzhe Sun, Siwei Lyu, Phil Rose

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨“声纹谬误”,指出语音并非稳定独特的生物识别印记,通过回顾相关研究,建议用考虑变异性与不确定性的概率框架解读语音证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30854 2026-08-24 cs.PL 版本更新 50%

When Do Staging Annotations Preserve Semantics? Mechanizing Typed Semantics-Preserving Multi-stage Programming with Let-Insertion (Extended Version)

阶段注释何时保持语义?用let插入实现带类型语义保持的多阶段编程(扩展版)

Jun Tan, Guannan Wei

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究带引用的多阶段编程中阶段注释保持语义的条件,提出两个带类型的两阶段演算,通过自动let插入和轻量类型-效应系统实现语义保持,并证明强语义保持定理。

Comments 29 pages; preprint of paper accepted at OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2607.20772 2026-08-24 cs.RO 版本更新 79%

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

使用解耦规划和轨迹协调的社会一致多机器人导航

Matthew M. Sato, Kincho H. Law

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究多机器人在人类环境中的导航,通过解耦规划与轨迹协调,改进A*规划器嵌入社会规范构建社会图,转化轨迹协调为凸规划,实现可预测、符合社会规范的路径规划,简化多机器人协调。

Comments Accepted to Civil Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-24 cs.RO 版本更新 70%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17850 2026-08-24 cs.HC cs.AI cs.CL cs.CY 版本更新 57%

Mind the Style: Impact of Communication Style on Human-Chatbot Interaction

注意风格:沟通风格对人机交互的影响

Erik Derner, Dalibor Kučera, Aditya Gulati, Ayoub Bagheri, Nuria Oliver

机构 * Czech Technical University in Prague(捷克技术大学(布拉格)) University of South Bohemia(南波西米亚大学) Utrecht University(乌得勒支大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究探讨了沟通风格对人机交互的影响,发现友好风格提升女性用户满意度和任务完成率,且用户较少模仿聊天机器人风格。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 4 篇

2607.06640 2026-08-24 cs.LG cs.AI 版本更新 81%

What a World Model Represents Is Three Questions

一阶角:任务从世界模型中需要多少价值等价性?

Donna Vakalis

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究任务从世界模型中所需的价值等价性,通过在DreamerV3堆栈上测量发现,潜在因素代表的闭包由训练目标维度决定,价值等价具维度性,单奖励目标是其一阶角,模型安装的任务结构与预测目标相关。

Comments 24 pages, 12 figures. Substantial rewrite of v1 (title changed). v2 Adds the reachability / admission / assignment split and the assignment experiments / the route-boundary / RSSM-transfer / stochastic-onset and reachability-versus-admission experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07107 2026-08-24 cs.AI 版本更新 79%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-08-24 cs.CV 版本更新 79%

Future Dynamic 3D Reconstruction: Toward 3D World Modeling with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: this https URL (https://fr3d-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-08-24 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT 版本更新 62%

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2506.13583 2026-08-24 cs.HC cs.AI cs.RO 版本更新 73%

Can you see how I learn? Human observers' inferences about Reinforcement Learning agents' learning processes

你能看到我是如何学习的吗?人类观察者对强化学习智能体学习过程的推断

Bernhard Hilpert, Muhan Hou, Kim Baraka, Joost Broekens

机构 * Leiden University(莱顿大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本研究通过两项实验开发了评估人类对强化学习智能体学习推断的范式,明确人类解释智能体学习的核心主题,为设计可解释RL系统及提升人机交互透明度提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-24 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: this https URL (https://zanette-labs.github.io/MaxRL/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 4 篇

2606.18847 2026-08-24 cs.AI 版本更新 79%

WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

WorldLines: 对长时域有状态具身智能体进行基准测试与建模

Yehang Zhang, Jianchong Su, Haojian Huang, Yifan Chang, Tianhao Zhou, Xinli Xu, Yingjie Xu, Yinchuan Li, Zexi Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 提出WorldLines基准,通过构建带时间跨度的家庭轨迹(含对话、动作、状态变化等)评估具身智能体的长时记忆与任务规划能力,并设计ObsMem记忆框架提升状态感知决策。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11381 2026-08-24 cs.CV 版本更新 79%

From Simulation to the Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting

从仿真到现实:面向机器人草莓采摘的实地6D位姿数据集与基线

Woojung Son (1), Won Suk Lee (1), Zijing Huang (1), Daeun Choi (1), Catia Silva (2), Yu She (3), Yan Gu (4) ((1) Department of Agricultural and Biological Engineering, University of Florida, (2) Department of Electrical and Computer Engineering, University of Florida, (3) Edwardson School of Industrial Engineering, Purdue University, (4) School of Mechanical Engineering, Purdue University)

机构 * Department of Agricultural and Biological Engineering, University of Florida(佛罗里达大学农业与生物工程系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 针对机器人草莓采摘中6D位姿估计的仿真到现实差距问题,首次构建了实地草莓6D位姿真值数据集(12,040张图像),并基于NVIDIA Isaac Sim生成具有场景级真实感的合成数据集,通过基线实验量化了差距。

Comments 8 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10282 2026-08-24 cs.RO 版本更新 57%

Update-Free On-Policy Steering via Verifiers

基于验证器的免更新在线策略引导

Maria Attarian, Ian Vyse, Jasper Gerigk, Evgenii Opryshko, Yifan Ruan, Anas Almasri, Sumeet Singh, Yilun Du, Igor Gilitschenski, Claas Voelcker

机构 * University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) University of Alberta(阿尔伯塔大学) UTAustin(得克萨斯大学奥斯汀分校) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出UF-OPS方法,利用策略评估中的验证器函数引导基础策略选择高成功概率动作,无需更新参数即可提升黑箱扩散策略性能,在5个真实任务中平均成功率提升49%。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 6 篇

2505.18930 2026-08-24 cs.CV cs.AI 版本更新 62%

WeedNet: A Foundation Model-Based Global-to-Local AI Approach for Real-Time Weed Species Identification and Classification

WeedNet:一种基于基础模型的全局到局部AI方法,用于实时杂草种类识别与分类

Yanben Shen, Timilehin T. Ayanlade, Venkata Naresh Boddepalli, Mojdeh Saadati, Ashlyn Rairdin, Zi K. Deng, Muhammad Arbab Arshad, Aditya Balu, Daren Mueller, Asheesh K Singh, Wesley Everman, Nirav Merchant, Baskar Ganapathysubramanian, Meaghan Anderson, Soumik Sarkar, Arti Singh

机构 * Department of Agronomy, Iowa State University, Iowa, USA(农业学系,爱荷华州立大学) Department of Computer Science, Iowa State University, Iowa, USA(计算机科学系,爱荷华州立大学) Data Science Institute, University of Arizona, Arizona, USA(数据科学研究所,亚利桑那大学) Department of Mechanical Engineering, Iowa State University, Iowa, USA(机械工程系,爱荷华州立大学) Department of Plant Pathology, Entomology and Microbiology, Iowa State University, Iowa, USA(植物病理学、昆虫学和微生物学系,爱荷华州立大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出基于基础模型的WeedNet全局到局部AI方法,通过自监督学习等技术实现1593种杂草91.02%的识别准确率,可适配区域杂草识别,具备集成至农业机器人及对话式AI咨询工具的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-08-24 cs.AI cs.CR 版本更新 57%

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 其他机器人 :embodied agent(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09024 2026-08-24 cs.RO physics.app-ph 版本更新 57%

Rapid Manufacturing of Lightweight Drone Frames Using Single-Tow Architected Composites

采用单丝束结构复合材料快速制造轻量化无人机机架

Md Habib Ullah Khan, Kaiyue Deng, Ismail Mujtaba Khan, Kelvin Fu

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 本研究采用3DFiT技术制造单丝束FCC晶格结构无人机机架,其比强度为金属和热塑性材料的4至8倍,比商用DJI F450机架轻10%,飞行时间延长3分钟,验证了该方法的可行性。

Comments The authors have withdrawn this preprint due to recently established confidentiality obligations that restrict the public disclosure of material contained in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09431 2026-08-24 cs.CV 版本更新 57%

Vision Foundation Model Driven Foreground-Aware Pseudo-LiDAR Generation for Monocular 3D Object Detection

视觉基础模型驱动的面向前景感知的伪激光雷达生成方法用于单目3D目标检测

Bonan Ding, Jin Xie, Jing Nie, Jiale Cao, Yanwei Pang

专题命中 其他机器人 :robotics(abstract);分类 cs.CV

AI总结 本文提出VFMM3D框架,利用DAM和SAM的先验生成前景感知伪激光雷达,在KITTI、Waymo数据集上实现最优性能,可无缝集成至多种激光雷达3D目标检测器。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-24 cs.CY 版本更新 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 其他机器人 :robotics(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09307 2026-08-24 physics.comp-ph 版本更新 50%

Constitutive Priors for Inverse Design

本构先验用于逆设计

Jinkyo Han, Bahador Bahmani

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出了一种端到端框架,直接在本构行为空间中进行弹性网络的逆设计。通过潜在表示构建本构先验,定义可接受的材料定律流形并保证热力学一致性。逆问题被建模为具有潜在本构变量的PDE约束优化问题,通过同伦策略提高非凸优化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏