arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 503 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 503 篇

2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 75%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20033 2026-08-21 cs.RO 版本更新 74%

HOST:Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 74%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29285 2026-08-07 cs.RO 版本更新 74%

TRACT: Temporally Routed Action Chunks with Chronological Phase Authority for Contact-Rich Manipulation

TRACT:面向接触丰富型操作的、具有时间相位权限的时序路由动作块

Jiahao Liu, Kento Kawaharazuka, Tasuku Makabe, Kei Okada

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 针对接触丰富型操作的时间不匹配问题,提出TRACT方法,通过时序路由动作块与因果响应缺陷积分器提升机器人操作性能,在真实机器人试验中取得了优于基准的任务结果。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 74%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10271 2026-06-29 cs.CR cs.AI 版本更新 74%

MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation

MetaBreak: 通过特殊标记操纵越狱在线LLM服务

Wentian Zhu, Zhen Xiang, Wei Niu, Le Guan

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 提出利用特殊标记构造攻击原语,绕过LLM安全对齐和内容审核,并发现防御困难,实验显示MetaBreak在内容审核下优于现有方法。

Comments Accepted version. Revised to match the version accepted to the 2026 IEEE Symposium on Security and Privacy (SP); added publication information and DOI

Journal ref Proceedings of the 2026 IEEE Symposium on Security and Privacy (SP), pp. 98-117, IEEE Computer Society, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 73%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18933 2026-08-05 cs.RO cs.AI 版本更新 73%

Gated Memory Policy: In-Context Memorization and Adaptation

门控记忆策略

Yihuai Gao, Jeff Jinyun Liu, Shuang Li, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21429 2026-08-04 cs.LG cs.AI cs.SY eess.SY math.OC 版本更新 73%

Provably Safe Generative Sampling with Constricting Barrier Functions

具有约束屏障函数的可证明安全生成采样

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

机构 * Mechanical Engineering University of California, Riverside(机械工程 加州大学河滨分校) Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学 加州大学伊尔弗分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 通过约束屏障函数实现安全生成采样,确保生成样本满足硬约束并保持语义保真度。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 73%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新 73%

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 73%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14944 2026-06-23 cs.RO cs.CV 版本更新 73%

HRDexDB: A Paired Human-Robot Dataset for Cross-Embodiment Dexterous Grasping

HRDexDB:用于跨本体灵巧抓取的配对人机数据集

Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD(RLWRLD实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出HRDexDB,一个包含人类和多种机器人手的高保真灵巧抓取轨迹配对数据集,涵盖100种物体,提供高精度时空3D真值,作为跨本体灵巧操作的基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20906 2026-06-23 cs.RO cs.AI 版本更新 73%

DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies

DASIP:基于随机插值策略的机器人控制动态测试时计算缩放

Inkook Chun, Seungjae Lee, Michael S. Albergo, Saining Xie, Eric Vanden-Eijnden

机构 * New York University(纽约大学) University of Maryland(马里兰大学) Harvard University(哈佛大学) Capital Fund Management(资本基金管理公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22183 2026-06-16 cs.RO cs.AI 版本更新 73%

Action with Visual Primitives

基于视觉基元的动作生成

Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yuyang Pang, Wenda Xu, Gao Huang

机构 * Anyverse Dynamics Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。

Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05230 2026-06-15 cs.CV cs.RO 版本更新 73%

Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems

数字孪生驱动的自动化分拣系统中的纺织品分类与异物识别

Serkan Ergun, Tobias Mitterer, Hubert Zangl

机构 * Institute of Smart Systems Technologies(智能系统技术研究所) University of Klagenfurt(克雷格弗特大学) AAU SAL USE Laboratory(AAU SAL USE实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种数字孪生驱动的机器人分拣系统,结合抓取预测、多模态感知和视觉语言模型,实现纺织品分类与异物检测,Qwen模型准确率达87.9%。

Comments 10 pages,single column, 5 figures, preprint for Photomet Edumet 2026 (Klagenfurt, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 73%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03078 2026-07-07 cs.RO 版本更新 72%

3D Cal: An Open-Source Software Library for Depth Reconstruction on Vision-Based Tactile Sensors

3D Cal:用于基于视觉的触觉传感器深度重建的开源软件库

Rohan Kota, Kaival Shah, J. Edward Colgate, Gregory Reardon

机构 * McCormick School of Engineering, Center for Robotics and Biosystems, Northwestern University(麦科姆ick工程学院,机器人与生物系统中心,西北大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 介绍3D Cal开源库,将低成本3D打印机变为自动探测设备,为校准基于视觉的触觉传感器生成大量标记训练数据,还提供端到端管道训练自定义卷积网络进行深度重建,给出校准准则并展示良好性能。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Project page: https://rohankotanu.github.io/3DCal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13181 2026-07-17 cond-mat.other cond-mat.mes-hall 版本更新 71%

Transformation of the gyrotropic mode spectrum of the FM / AFM disk via vortex imprinting

通过涡旋印记调控FM/AFM圆盘中回旋模式频率和能带结构

E. V. Skorokhodov, E. A. Karashtin, I. A. Fedotov, I. Yu. Pashen'kin, M. V. Sapozhnikov

专题命中 机器人操作 :manipulation(title)

AI总结 实验研究交换耦合到反铁磁层的铁磁涡旋纳米振荡器的回旋模式,发现频率显著上移约4倍,并观测到双频峰,归因于非中心对称系统中的强非线性涡旋动力学。

Comments 5 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15567 2026-07-10 physics.plasm-ph physics.optics 版本更新 71%

Plasma-state metasurfaces for ultra-intensive field manipulation

用于超高强度场操纵的等离子体态超表面

Zi-Yu Chen, Hao Xu, Jiao Jia, Yanjie Chen, Siyu Chen, Yan Zhang, Mingxuan Wei, Minghao Ma, Runze Li, Fan Yang, Mo Li, Guangwei Lu, Weijun Zhou, Hanmi Mou, Zhuofan Zhang, Zhida Yang, Jian Gao, Feng liu, Boyuan Li, Min Chen, Liming Chen, Yongtian Wang, Lingling Huang, Wenchao Yan, Shuang Zhang, Jie Zhang

专题命中 机器人操作 :manipulation(title)

AI总结 研究旨在将超表面从固体拓展到等离子体领域,通过光子自旋霍尔效应等实验证明了等离子体态超表面,其功能可持续数皮秒,能用于控制高功率激光,有望革新高功率激光操纵能力并推动激光 - 等离子体相互作用创新应用。

Comments 37 pages, 5 figures

Journal ref Light: Science & Applications 15, 307 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16622 2026-07-08 quant-ph 版本更新 71%

Temporal steering of entanglement decay with single-shot control

单次控制下纠缠衰减的时间调控

Saumya Ranjan Behera, Kallol Sen, Animesh Sinha Roy, Snigdhadev Ray, Ashutosh Singh, A. R. P. Rau, Urbasi Sinha

专题命中 机器人操作 :manipulation(title)

AI总结 研究通过单次局部酉操作的时机来调控开放量子系统纠缠衰减轨迹,开发含时框架并推导解析条件,实验实现类关联阻尼机制演示相关转变,确立时间调控为退相干控制范例及展示操作优势。

Comments Manuscript: 19 pages, 18 figures, Supplementary: 16 pages, 14 figures. This is a combined version of arXiv:2505.16622 and arXiv:2505.16623 and is closest to the version accepted in Physical Review A

Journal ref Physical Review A 114, 012416 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02365 2026-06-23 physics.atom-ph nucl-ex 版本更新 71%

Adiabatic Fast Passage Spin Manipulation Measurements in Solid Polarized Targets

固体极化靶中的绝热快速通过自旋操纵测量

M. F. Hossain, K. Nakano, N. G. Vismith, D. Keller

专题命中 机器人操作 :manipulation(title)

AI总结 本文报告了在5 T、1 K极化靶系统中对辐照$^{15}$NH$_3$、辐照$^{14}$ND$_3$和丁醇基材料(TEMPO掺杂或辐照制备)的绝热快速通过(AFP)测量,提出了自旋-1靶的联合操纵线形分析,并展示了从AFP操纵的氘核NMR谱中提取矢量和张量极化的方法,同时观察到辐照$^{15}$NH$_3$样品中可重复的极化和方向依赖的AFP响应。

Comments Submitted to Nuclear Instruments and Methods in Physics Research Section A

Journal ref Nucl. Instrum. Meth. A (2026) 171770

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17394 2026-06-23 quant-ph math-ph math.MP 版本更新 71%

Optimizing Entanglement Manipulation via Algebraic-Geometric Decompositions and Semidefinite Programming Hierarchies

通过代数几何分解与半定规划层次优化纠缠操控

Seiseki Akibue, Jisho Miyazaki, Hiroyuki Osaka

专题命中 机器人操作 :manipulation(title)

AI总结 提出代数几何框架简化可分信道优化并强化DPS层次,用于计算非局域操作在可分信道下的最大成功概率,统一了纠缠成本的解析结果并解决了局部态区分的纠缠成本问题。

Comments 51 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-08-21 cs.RO 版本更新 70%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06754 2026-08-21 cs.RO cs.SY eess.SY 版本更新 70%

Model-Less Feedback Control of Space-based Continuum Manipulators using Backbone Tension Optimization

无模型反馈控制空间连续 manipulators 的背骨张力优化

Shrreya Rajneesh, Rakesh Kumar Sahoo, Manoranjan Sinha

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉吉尔普尔)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出一种无模型反馈控制方法,通过背骨张力优化实现连续 manipulators 的高精度运动控制,无需模型校准或参数识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 70%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01880 2026-08-12 cs.RO 版本更新 70%

World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment

实时世界动作模型:通过异步部署实现平滑执行的实证研究

Motubrain Team

机构 * Motubrain Team(Motubrain团队)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文针对世界动作模型推理延迟导致机器人执行不连续的问题,通过10Hz双机械臂机器人对比6种异步部署策略,发现前缀条件生成可在任务性能、速度与平滑度间实现最佳平衡,为高延迟世界动作模型的实时部署提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05868 2026-08-11 cs.RO 版本更新 70%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16465 2026-08-07 cs.AI 版本更新 70%

Berkeley and Heiserman as an Unexhausted Architecture for Embodied Machine Intelligence

伯克利和海斯曼作为具身机器智能的未穷尽架构

Christopher A. Tucker

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.AI

AI总结 本文以伯克利的《符号逻辑与智能机器》及海斯曼的工作为研究对象,探讨其在具身机器智能方面贡献。他们将逻辑与硬件、行为等联系,超越静态逻辑形式,为具身机器人认知架构方法提供思路,不应被视为历史终点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20290 2026-07-31 cs.GR cs.CV 版本更新 70%

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 机器人操作 :manipulation(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏