arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-27 至 2026-08-27 共收录 101 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 15 篇

2608.22149 2026-08-27 cs.RO cs.AI 版本更新 73%

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Meta-Ctrl:通过分离句法与语义约束实现带保证的规划生成

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui

机构 * Michigan State University(密歇根州立大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 具身推理 :embodied agent(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 Meta-Ctrl是一种约束解码框架,通过引入元标记分离句法与语义约束,在保证规划满足约束的同时保留语言模型的规划质量,在WAH-NL数据集和真实桌面机器人上均取得优于GPT-4的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 70%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 具身推理 :robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25956 2026-08-27 cs.CV 新提交 57%

4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting

4DGS-WAM:基于4D高斯溅射的以对象为中心的世界动作模型,连接过去与未来

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本研究提出基于4D高斯溅射的以对象为中心的世界动作模型4DGS-WAM,将2D观测转为持久4D表示,复用静态内容以聚焦动态对象演化,在KITTI-MOT上完成短程预测与过去重建评估。

Comments This is a work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-27 cs.LG 版本更新 57%

JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-27 cs.LG 版本更新 57%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-27 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: this https URL (https://github.com/boschresearch/TASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25728 2026-08-27 cs.DC 新提交 50%

A Spatially-Aware Publish-Subscribe Middleware for IoT Applications

面向物联网应用的空间感知发布-订阅中间件

Philipp Ungrund, Kurt Rothermel, Sukanya Bhowmik

专题命中 具身推理 :world model(abstract)

AI总结 针对物联网应用中空间感知中间件缺失的问题,提出基于 MQTT5 协议的空间感知发布-订阅中间件,实验验证其效率高、开销小且可部署于现有 IoT 设备。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 8 篇

2603.22991 2026-08-27 cs.CV 版本更新 79%

Training-Free Interaction-Aligned Visual Token Pruning for Efficient Embodied Manipulation

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Weibin Li, Haozhe Wang, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25757 2026-08-27 cs.RO cs.LG 新提交 76%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Jingxuan Zhu, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25585 2026-08-27 cs.RO 新提交 70%

RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation

RA-VLA:用于测试时自适应的检索增强视觉-语言-动作模型

Sanghwan Jang, Minjin Jeon, Minsoo Kim, Seongjin Choi, Dongha Kim, Hwanjo Yu

机构 * POSTECH(浦项科技大学) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究针对VLA模型面对新任务分布时的脆弱性问题,提出RA-VLA检索增强VLA框架,在LIBERO基准和UR5e环境中验证其可提升机器人操纵的任务适应成功率与计算效率。

Comments ICML 2026. Contact: this http URL (http://s.jang) @postech. this http URL (http://ac.kr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25308 2026-08-27 cs.CV 新提交 70%

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

V-Link:为视觉-语言-动作模型恢复动作DiT中丢失的视觉表征

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li

机构 * Zhejiang University(浙江大学) AGIBOT The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本研究针对VLA模型中动作专家访问视觉信息不足的问题,提出V-Link方法,通过注入空间与语义查询提升动作DiT性能,在多个机器人操作基准及现实任务中均取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00686 2026-08-27 cs.RO 版本更新 70%

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Hongxun Yao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24959 2026-08-27 cs.RO cs.CV 新提交 62%

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA:面向视觉-语言-动作模型的几何感知空间推理

Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

机构 * Yeungnam University(岭南大学) Kyungpook National University(庆北国立大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出基于Mamba的VLA模型GaussVLA,通过高斯空间分词器和深度感知思维链提升空间推理能力,在LIBERO数据集上仅2亿参数就实现93.5%平均成功率,优于SpatialVLA且参数效率更高。

Comments Accepted to BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交 57%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.CV

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25864 2026-08-27 cs.RO 新提交 57%

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 8 篇

2608.25610 2026-08-27 cs.RO 新提交 79%

Advantage-Driven Explicit Memory for Social Navigation

面向社交导航的优势驱动型显式记忆

Yeonsoo Park, Mattia Racca, Guillaume Bono, Steeven Janny, Gianluca Monaci, Tomi Silander, Christian Wolf

机构 * Seoul National University(首尔大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本研究针对社交导航任务,提出将非参数化显式记忆集成到循环PPO架构,利用RL优势信号保留关键事件,提升智能体泛化能力与对分布外社交行为的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25518 2026-08-27 cs.AI 新提交 79%

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) University of California, Berkeley(加州大学伯克利分校) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) HPC-AI Lab(高性能计算与人工智能实验室)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26053 2026-08-27 cs.RO cs.AI cs.CL cs.LG 新提交 75%

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

R^3:通过强化学习训练机器人以自然语言进行推理

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出R^3方法,通过中间训练和基于准则的强化学习将VLM转化为机器人推理器,在两个测试平台上提升了机器人的探索与泛化能力,优于仅指令式的模仿学习基线。

Comments 42 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25350 2026-08-27 cs.LG cs.RO 新提交 73%

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

超越成对反馈:用于基于偏好的奖励学习的列表式视觉-语言监督

Srivalli Katkuri, Maxwell Kawada, Juan Wachs

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出首个结合视觉-语言模型生成偏好与普拉科特-卢斯模型的列表式奖励学习框架,在Meta-World操纵任务中,其表现与基线相当且更灵活,最佳配置达86%平均成功率。

Comments 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23831 2026-08-27 cs.RO cs.LG 版本更新 62%

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu, Momen Khalil, E Harrison, Emanuele Poggi, Philipp Schmitt, Bernd Kast, Philine Meister, Pranav Atreya, Qiyang Li, Finn Ferchau, Cesar Colmenero, Yash Shahapurkar, Gokul Narayanan, Melih Erdogan, Kai Wurm, Georg von Wichert, Oier Mees, Eugen Solowjow, Andrew Wagenmaker, Sergey Levine

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures, project website: this https URL (https://async-rl-intermediate-information.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 62%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-08-27 cs.CV 版本更新 57%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25402 2026-08-27 cs.NI 新提交 50%

Lightweight AI for UAV-Mounted RIS: An Overview

用于无人机搭载可重构智能表面(RIS)的轻量级AI:综述

Sherief Hashima, Kohei Hatano, Eiji Takimoto, Mohamed Rihan, Basem.M. Elhalawany, Hamada Rizk

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本文综述用于无人机搭载RIS的轻量级AI技术,涵盖RL、FL等方法,分析现有工作与权衡,确定研究挑战并通过案例展示MAB方案对系统性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 2 篇

2503.13048 2026-08-27 cs.RO 版本更新 83%

Multi-Touch and Bending Sensing Using Electrical Impedance Tomography for Robotics

面向机器人的基于电阻抗断层成像(EIT)的多点触控与弯曲感知

Haofeng Chen, Bedrich Himmel, Bin Li, Xiaojie Wang, Matej Hoffmann

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子学系) Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(合肥物理科学研究院智能机器研究所)

专题命中 人机交互与遥操作 :robotics(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文针对机器人EIT触觉传感器弯曲时信号解读复杂的问题,提出集成深度神经网络与动态自适应参考策略的感知框架,实现了精准的弯曲角度估计与触控状态区分,为柔性EIT机器人皮肤奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24915 2026-08-27 cs.HC 新提交 50%

What Are We Measuring? Bonding, Trust, and the Evaluation of Human-Robot Relationships

我们在测量什么?联结、信任与人机关系的评估

Imran Khan

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 本文指出人机交互中常将信任等同于联结是范畴错误,提出二者为独立维度并划分四种关系构型,进而阐述对感知人类状态的机器人学的四项启示,以推动重新评估人机关系质量。

Comments Pre-print, accepted at H-STAR Workshop, RO-MAN 2026, Kitakyushu

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 12 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 81%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.AI、cs.CV

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22639 2026-08-27 cs.RO 版本更新 79%

Symmetries Here and There, Combined Everywhere: Cross-space Symmetry Compositions in Robotics

此处与彼处的对称性,无处不在的组合:机器人学中的跨空间对称性组合

Loizos Hadjiloizou, Rodrigo Pérez-Dattari, Noémie Jaquier

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 提出跨空间对称性组合框架,通过前向运动学的微分几何结构实现配置空间与任务空间对称性的联合等变,并在双机械臂实验中验证了多对称性联合利用能提升泛化能力。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26103 2026-08-27 cs.RO cs.CV 新提交 79%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments this https URL (https://robbyant-research.github.io/Zero-WAM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25274 2026-08-27 cs.CV 新提交 70%

OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization

OpenCVL:用于细粒度跨视角定位的开放、多样且大规模数据集

Zimin Xia, Mubariz Zaffar, Junsheng Fu, Alexandre Alahi, Julian F. P. Kooij

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Southern University of Science and Technology (SUSTech)(南方科技大学) Delft University of Technology(代尔夫特理工大学) Zenseact(Zenseact公司)

专题命中 机器人数据与评测 :navigation(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有CVL数据集的多样性与可扩展性不足问题,本文构建了含617388组图像对的OpenCVL数据集,开发数据整理框架处理野外数据,实验证实融入有噪声野外数据可提升CVL模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 62%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏