arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-11 至 2026-08-11 共收录 182 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 5 篇

2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新 81%

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 机器人基础模型 :embodied AI(title,abstract);分类 cs.RO、cs.CV

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26820 2026-08-11 cs.RO 版本更新 77%

Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?

VLA 模型能否从现实世界数据中持续学习而不遗忘?

Jiarun Zhu, Yijun Hong, Xiaoquan Sun, Zetian Xu, Qijun He, Haijier Chen, Zhiyong Wang, Mingqi Yuan, Wenjun Zeng, Jiayu Chen

机构 * HKU(香港大学) INFIFORCE EIT, Ningbo(宁波工程学院) HUST(华中科技大学) SUSTech(南方科技大学) HITSZ(香港理工大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究通过构建包含四个顺序操作任务的真实世界持续学习数据集,实证发现视觉-语言-动作(VLA)模型在持续学习异构真实世界演示时存在严重灾难性遗忘,并系统评估了经验回放方法的关键实施因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01265 2026-08-11 cs.RO cs.CV 版本更新 73%

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

作为视觉-语言-动作模型轨迹先验的埃尔米特曲线

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏赛克德智能科技有限公司) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作模型动作块的弱结构化问题,提出埃尔米特轨迹先验,其中埃尔米特正则化变体在仿真与真实机器人任务中显著提升了操纵成功率且无额外推理开销。

Comments Project page is available at https://aopolin-lv.github.io/Hermite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 62%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 10 篇

2608.09467 2026-08-11 cs.CV cs.AI 新提交 81%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02953 2026-08-11 cs.CV 版本更新 79%

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models

RealWeather:基于驾驶世界模型的逼真且场景忠实的天气转换

Yuwei Ning, Liangzhi Wang, Yi Xiao, Zhenhua Wu, Yun Pang, Mingkun Chang, Jichang Li, Guanbin Li

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 RealWeather是一种驾驶世界模型,通过渐进式逼真度引导和场景忠实度强化学习优化实现逼真且场景忠实的天气转换,在视觉逼真度、结构保留等方面优于现有方法,支持长尾天气场景生成与零样本泛化。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 77%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 62%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07870 2026-08-11 cs.LG cs.RO 新提交 62%

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

V-Simba:释放强化学习在视觉连续控制中的架构潜力

Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron, Byungkun Lee, Aaron Courville, Pablo Samuel Castro, Jaegul Choo, Clare Lyle

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 该研究针对视觉RL样本效率低的问题,提出受Simba架构启发的V-Simba视觉RL架构,基于SAC改进后在多个基准测试中性能优于或媲美现有方法,且计算效率更高。

Comments Accepted at RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 61%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI;embodied AI(comments)

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09258 2026-08-11 cs.RO 新提交 57%

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

面向任务的编队决策:通过强化学习实现对攻击型集群的驱赶

Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对攻击型集群驱赶任务,提出基于强化学习的编队决策方法,通过参数化编队形状缓解防御者机动性劣势,在仿真与物理平台上验证了方法的可行性与扩展性。

Comments Accepted for publication in IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 57%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 57%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新 50%

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 4 篇

2511.05033 2026-08-11 cs.RO 版本更新 83%

Epically Powerful: An open-source software and mechatronics infrastructure for wearable robotic systems

强大非凡:用于可穿戴机器人系统的开源软件与机电一体化基础设施

Jennifer K. Leestma, Siddharth R. Nathella, Christoph P. O. Nuesslein, Snehil Mathur, Gregory S. Sawicki, Aaron J. Young

专题命中 人机交互与遥操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 Epically Powerful是一款开源机器人基础设施,可简化可穿戴机器人系统的底层框架,支持QDD执行器等硬件对接,降低定制化可穿戴机器人开发门槛,还适用于其他相关机器人领域。

Comments 12 pages, 5 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09015 2026-08-11 cs.RO 新提交 57%

Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization

基于偏好的贝叶斯优化实现个性化下肢外骨骼助力

Xiao-Yin Liu, Guotao Li, Weiqun Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Macau University of Science and Technology(澳门科技大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出偏好贝叶斯优化(PbBO)方法,结合分层控制器,实现个性化下肢外骨骼助力,经20次迭代以90.7%准确率收敛最优参数,实验显示可显著降低用户代谢率、心率及肌肉激活度。

Comments 20 pages, 15 figures, https://youtu.be/8X1SFqUU4G4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08263 2026-08-11 cs.HC 新提交 50%

Underwater MMG-Based Muscle State Monitoring with Integrated Emergency Buoyancy Assistance

基于水下肌动电流图(MMG)的肌肉状态监测及集成式紧急浮力辅助系统

Xiao Jin, Yixian Fan, Zefeng Yuan, Zhenhua Yu

专题命中 人机交互与遥操作 :robotic(abstract)

AI总结 该研究开发了基于水下MMG的可穿戴紧急辅助系统,采用防水MMG传感器与MiniRocket分类器实现泳姿识别,可快速触发浮力部署,为水生环境下的肌肉状态监测与应急提供支撑。

Comments 8 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07942 2026-08-11 cond-mat.soft cond-mat.mtrl-sci 新提交 50%

Reactive polar mesogenic self-assembly approach enables domain-programmable polymer ferroelectrics

反应性极性介晶自组装方法实现可区域编程的聚合物铁电体

Fan Ye, Minghui Deng, Yuyang Zheng, Xiujuan Liu, Xiuhu Zhao, Haowei Jiang, Yanyun Hou, Bingyu Zou, Neng-Ang Peng, Shuo Zhao, Kutay Sağdıç, Danqing Liu, Yang Shen, Yan-Qing Lu, Satoshi Aya, Mingjun Huang

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 本研究提出反应性极性介晶自组装方法,制备不含多氟烷基的柔性铁电液晶聚合物,通过光取向实现可编程极性畴结构,为柔性电子等领域拓展了自适应材料设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 29 篇

2608.07533 2026-08-11 cs.AI cs.SE 新提交 85%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09891 2026-08-11 cs.RO 新提交 81%

RoSE: A Robotic Soft Esophagus for Endoprosthetic Stent Testing

RoSE:用于腔内支架测试的机器人软食管

Dipankar Bhattacharya, Sherine Jesna V. A., Leo K. Cheng, Weiliang Xu

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本研究开发了仿生机器人软食管RoSE作为腔内支架体外测试装置,通过测试两种不同径向刚度支架的径向力、迁移情况及对吞咽功能的影响,为支架评估提供创新平台。

Comments Author accepted manuscript. 31 pages, 13 figures, 3 tables. Published in Soft Robotics (2021). Project page: https://bhattner143.github.io/rose-stent.github.io/

Journal ref Soft Robotics, Vol. 8, No. 4 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08281 2026-08-11 cs.AI cs.RO 新提交 81%

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

探索大语言模型(LLM)在现实世界海事航行场景中的情境理解与《国际海上避碰规则》(COLREG)遵从能力

Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究探索LLM在海事航行中的应用,构建含50个真实场景的AIS数据集,评估不同LLM的理解与推理能力,发现不微调则难以解决海事航行任务。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08523 2026-08-11 cs.AI 新提交 79%

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08036 2026-08-11 cs.RO 新提交 79%

Compiling and Benchmarking Task-State Horizons for Embodied Agents

面向具身智能体的任务状态视界的编译与基准测试

Meiqi Wang, Shichao Li

专题命中 机器人数据与评测 :embodied agent(title);robotic(abstract);分类 cs.RO

AI总结 该研究定义任务状态视界(TSH),推出RoboGraph编译器并发布含588个情节的基准,发现多数先进智能体模型在高TSH下维护、更新任务相关状态存在差距。

Comments 32 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 79%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07033 2026-08-11 cs.RO 版本更新 79%

$\mathcal{P}^3$: Toward Versatile Embodied Agents

$\mathcal{P}^3$:迈向通用具身智能体

Shengli Zhou, Xiangchen Wang, Jinrui Zhang, Ruozai Tian, Jianzheng Huang, Rongtao Xu, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Spatialtemporal AI(时空AI) MBZUAI

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO

AI总结 研究针对具身智能体面临的动态环境感知、工具使用和多任务规划挑战,提出$\mathcal{P}^3$统一框架,集成实时感知与动态调度,经实验验证能打造高迁移性通用具身智能体。

Comments Accepted by RSS 2026 Workshop ExWBC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09528 2026-08-11 cs.RO 新提交 74%

Robotic Fabric Alignment System for Sewing Using Global Local Weighted ICP

采用全局局部加权迭代最近点(GLW-ICP)的缝纫用机器人布料对位系统

Wenbo Dong, Dipankar Bhattacharya Member, Kai Tang, Akinari Kobayashi, Fuyuki Tokuda, Akira Seino, Norman C. Tien, Kazuhiro Kosuge

机构 * The University of Hong Kong(香港大学) Imperial College London(帝国理工学院) Tohoku University(东北大学) Fukushima University(福岛大学) City University of Hong Kong(香港城市大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 该研究提出采用GLW-ICP方法的机器人布料对位系统,可实现布料全局边缘与局部缝纫线的精准对齐,在有无遮挡下均达毫米级精度,适用于自动缝纫场景。

Comments 16 pages, 10 figures, https://bhattner143.github.io/rfas-glwicp.github.io/

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 23, pp. 13391-13406, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 73%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08016 2026-08-11 cs.CV 新提交 70%

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking

EgoTrack3D:一种用于第一人称视角三维目标跟踪的模块化框架

Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang, Boyang Sun, Marc Pollefeys, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft Research(微软研究院) TUM(慕尼黑工业大学) MCML(慕尼黑计算与机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 EgoTrack3D是一种模块化框架,可从第一人称视角RGB视频重建动态三维场景,在ADT数据集上较基线提升11% PCL,还能在退化观测下维持准确空间表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新 67%

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07905 2026-08-11 cs.AI cs.RO 新提交 62%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏