arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-28 至 2026-08-28 共收录 33 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 11 篇

2605.16514 2026-08-28 cs.RO cs.AI 版本更新 86%

No Plan, Yet Human: A Reactive Robotics Model Predicts Human Planning Failures on a Clinical Task

无计划,却有人类:一种反应式机器人模型预测临床任务中人类计划失败

Michael Migacev, Vito Mengers, Antonia Köngeter, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(技术大学柏林机器人与生物学实验室,德国) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(智能科学,卓越研究集群,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 机器人操作 :robotics(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究利用反应式梯度下降框架AICON,通过塔罗伦敦测试揭示人类计划能力下降时的反应模式,发现其能更准确预测24个问题的难度排序,并在留出验证中表现优异,揭示了生物系统组织方式的普遍规律。

Comments Accepted at SAB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13427 2026-08-28 cs.GR cs.AI cs.CV 版本更新 62%

A Unified Conditional Flow for Motion Generation, Editing, and Intra-Structural Retargeting

一种统一的条件流用于运动生成、编辑和内部结构重定向

Junlin Li, Xinhao Song, Siqi Wang, Haibin Huang, Yili Zhao

机构 * ByteDance(字节跳动)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种统一的条件流框架,用于运动生成、编辑和内部结构重定向,通过条件传输实现文本驱动的运动编辑和结构重定向,提升结构一致性。

Comments 16 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23940 2026-08-28 cs.CV cs.AI 版本更新 62%

High-Fidelity Face Content Recovery via Tamper-Resilient Versatile Watermarking

通过抗篡改的多功能水印实现高保真的面部内容恢复

Peipeng Yu, Jinfeng Xie, Chengfu Ou, Xiaoyu Zhou, Jianwei Fei, Yunshu Dai, Zhihua Xia, Chip Hong Chang

机构 * Jinan University(暨南大学) University of Macau(澳门大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出VeriFi框架,结合版权保护、像素级篡改定位和高保真面部内容恢复,通过紧凑语义潜在水印和AIGC攻击模拟器提升水印鲁棒性和恢复质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04802 2026-08-28 cs.CV cs.AI 版本更新 62%

Egosurg: Arbitrary view synthesis for egocentric replay of operating room workflows from ambient cameras

EgoSurg:基于环境相机的手术室工作流程自我中心视角回放的任意视角合成

Han Zhang, Lalithkumar Seenivasan, Jose L. Porras, Roger D. Soberanis-Mukul, Hao Ding, Hongchao Shu, Benjamin D. Killeen, Ankita Ghosh, Lonny Yarmus, Jeffrey K. Jopling, Masaru Ishii, Angela C. Argento, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 机器人操作 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 EgoSurg框架基于环境相机的立体视频重建手术室场景,渲染角色特定的自我中心视角,经评估可实现高质量重建,支持手术安全审查、培训等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23863 2026-08-28 cs.RO 版本更新 57%

DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit

DreamLedger:机器人决策回路中用于世界模型想象的执行结算信用文件

Xianyao Li, Ruitong Tian, Rui Min, Fang Xu, Jing Du

机构 * University of Florida(佛罗里达大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出DreamLedger执行结算信用文件,管控机器人世界模型预测的消耗,在多模拟域和真实机械臂上验证,可减少无效想象、降低验证探测次数,适用于多模型与硬件场景。

Comments 12 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-28 cs.RO 版本更新 57%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-28 cs.RO 版本更新 57%

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Hengshuo Chu, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25732 2026-08-28 cs.CL cs.AI 版本更新 57%

What the "Spotless" Mind Remembers: How Knowledge Entanglement Shapes What Leaks After Unlearning in LLMs

“无瑕疵”心智记住了什么:知识纠缠如何影响大语言模型(LLMs)在遗忘后泄露的内容

Aakriti Shah, Yifan Hu, Thai Le

机构 * Computer Science University of Southern California(计算机科学南加州大学) Computer Science Indiana University(计算机科学印第安纳大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究探究LLM中知识纠缠与遗忘后事实泄露的关系,发现GA+KL等算法会反转纠缠度与回忆率的正相关,训练出可预测遗忘后提示事实性的模型用于模型审计。

Comments 17 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26510 2026-08-28 cond-mat.mtrl-sci cond-mat.other 版本更新 50%

Modulation of charge density waves in a twisted vortex moire superlattice

扭转涡旋莫尔超晶格中电荷密度波的调制

Qian Fang, Yanhao Shi, Jingyi Duan, Hui Guo, Yikai Chen, Senhao Lv, Jiayi Wang, Zhongyi Cao, Jiayi Huang, Siyu Xu, Haitao Yang, Wei Jiang, Hui Chen, Hong-Jun Gao

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过扫描隧道显微镜和第一性原理计算,研究单层VTe2与超导NbSe2形成的扭转涡旋莫尔超晶格中电荷密度波的重构与调制,揭示局部应变变化导致CDW态的不均匀性及其与超导的竞争。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15427 2026-08-28 cs.HC 版本更新 50%

Losing One's Story: How Vulnerable Users Experience Harm in Online Support Seeking

失去自身叙事:弱势用户在在线寻求支持过程中如何遭受伤害

Yingfan Zhou, Priya Kumar, Anna Squicciarini, Sarah Rajtmajer

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过对Reddit用户的25次半结构化访谈,提出“叙事伤害”概念,揭示弱势用户在在线寻求支持时因叙事权威等受损而采取防御策略,指出平台设计需优化以维护叙事完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2608.17512 2026-08-28 cs.RO 版本更新 79%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-08-28 cs.RO cs.CV 版本更新 62%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: this https URL (https://dpt2026.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26002 2026-08-28 cs.RO 版本更新 57%

DESCENT: Directed Edge Scene Encoding for Airport Surface Movement Prediction

DESCENT:面向机场地面运动预测的有向边场景编码

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Graz University of Technology(格拉茨工业大学) Institute of Visual Computing(视觉计算研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究针对机场地面运动预测领域,提出基于Transformer的DESCENT架构,结合PRS上下文采样与检测Transformer解码器,在Amelia-10基准上较现有最优基线实现显著性能提升,尤其在安全关键场景表现突出。

Comments IROS 2026. Project page at this https URL (https://a-pru.github.io/descent)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 7 篇

2608.22294 2026-08-28 cs.RO 版本更新 83%

Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning

超越实例槽:面向物理交互规划的语义丰富世界模型

Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 该研究针对物理交互规划中实例槽无法明确实体任务角色的问题,提出SR-WM模型,通过功能角色绑定实现语义接口,在LIBERO模拟套件等评估中验证了其视觉动力学与规划决策的连接能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 79%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-08-28 cs.CV 版本更新 79%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-08-28 cs.CV 版本更新 79%

DALE-CT: Depth-Aware 2D Slice Encoders Learn an Anatomical World Model of Chest CT

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 18 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-28 cs.CV cs.AI 版本更新 73%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 具身推理 :embodied agent(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-28 cs.LG cs.AI 版本更新 62%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-08-28 cs.RO 版本更新 57%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 具身推理 :robotics(abstract);分类 cs.RO

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2608.25757 2026-08-28 cs.RO cs.LG 版本更新 76%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Zhiyuan Jing, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Yufei Liu, Boyang Xing, Lei Jiang, Yan Cui, Ying Chu, Jingxuan Zhu, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 2 篇

2507.00611 2026-08-28 cs.LG cs.AI cs.RO 版本更新 82%

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

残差奖励模型:利用先验知识实现机器人领域高效的基于偏好的强化学习

Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出残差奖励模型(RRM),将环境真实奖励拆分为先验奖励与学习奖励之和,可提升机器人领域基于偏好的强化学习的样本效率,在仿真与物理机器人实验中均优于基准方法。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-08-28 cs.CV 版本更新 57%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Yizhuang Peng, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 7 篇

2608.24199 2026-08-28 cs.RO 版本更新 83%

NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics

NVIDIA Cosmos-H-Dreams:面向外科机器人的实时生成式物理仿真

Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

专题命中 机器人数据与评测 :robotics(title,abstract);world model(abstract);分类 cs.RO

AI总结 该研究提出Cosmos-H-Dreams系统,结合生成模型与蒸馏技术实现实时外科机器人仿真,支持多控制器驱动,为外科教育等提供开放基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26103 2026-08-28 cs.RO cs.CV 版本更新 79%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments this https URL (https://robbyant-research.github.io/Zero-WAM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15917 2026-08-28 cs.RO cs.AI cs.CV 版本更新 75%

Pre-training Visual Dexterity in Simulation

在仿真环境中预训练视觉灵巧性

Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Scale AI(Scale AI公司)

专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。

Comments Project page: this https URL (https://spd.bot)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20781 2026-08-28 cs.RO cs.LG 版本更新 62%

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE:基于引导扩散的轨迹拼接用于离线策略评估

Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) University of Toronto Robotics Institute(多伦多大学机器人研究所) Toyota Research Institute(丰田研究院) Vector Institute(向量研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 STITCH-OPE通过引导扩散生成长周期轨迹,有效降低OPE中的方差,提升在高维空间中的评估性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-08-28 cs.AI 版本更新 57%

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-08-28 cs.AI cs.CL 版本更新 57%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏