arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-25 至 2026-08-25 共收录 161 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 人机交互与遥操作 4 篇

2608.21410 2026-08-25 cs.RO cs.HC 新提交 74%

Position: Robot Privacy as Embodied Boundary Work. Connecting Capabilities, Contexts, and Design Responses in Everyday Robotics

位置:机器人隐私作为具身边界工作——连接日常机器人中的能力、情境与设计响应

Liwen He, Shuning Zhang, Chengwen Zhang, Xin Yi, Chun Yu, Jihong Jeung, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 人机交互与遥操作 :robotics(title);分类 cs.RO

AI总结 本研究提出具身边界隐私框架,结合机器人7种能力与5种部署情境分析其隐私风险,给出具身隐私机制设计启示,呼吁HRI领域关注机器人具身行动的隐私意义。

Comments 8 pages, 1 figure, 3 tables. Accepted for publication in UbiComp Companion '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09846 2026-08-25 cs.RO 版本更新 70%

Whole-Body Bilateral Teleoperation with Multi-Stage Object Parameter Estimation for Wheeled Humanoid Locomanipulation

用于轮式人形机器人运动操作的多阶段物体参数估计的全身双边遥操作

Donghoon Baek, Amartya Purushottam, Jason J. Choi, Joao Ramos

专题命中 人机交互与遥操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出结合多阶段物体惯性参数估计的轮式人形机器人全身双边遥操作框架,通过视觉、VLM与分层采样实现参数估计,提升遥操作的动态性与操作跟踪精度,可实时完成约1/3体重载荷的相关任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22008 2026-08-25 cs.RO 新提交 57%

Stakeholder Insights for Designing In-Home Social Robots for Dementia Disorientation Detection and Caregiver-Aware Intervention

面向痴呆定向障碍检测与护理者感知干预的家庭社交机器人设计的利益相关者见解

Emmanuel Akinrintoyo, Nicole Salomons

机构 * Imperial College London(帝国理工学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 该研究通过对14名痴呆护理相关人员访谈,明确了居家社交机器人设计需融入日常作息、提供情境化定向支持等关键方向,以辅助痴呆患者定向障碍检测与干预。

Comments 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21620 2026-08-25 cs.RO 新提交 57%

Why Personalization Matters: Cross-Subject Challenges in EMG-IMU-based HRI Activity Recognition

个性化为何重要:基于EMG-IMU的HRI活动识别中的跨主体挑战

Ruan Rithelle Chagas de Faria Carminati, Giovanni Braglia, Luigi Biagiotti, Ronnier Frates Rohrich, Andre Schneider de Oliveira, Mikael Nedel Hartmann, André Eugenio Lazzaretti

机构 * Universidade Tecnológica Federal do Paraná(巴拉那联邦理工大学) University of Modena and Reggio Emilia(摩德纳-雷焦艾米利亚大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 人机交互与遥操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对基于EMG-IMU的HRI活动识别的跨主体挑战,构建了MAGIC-HRI数据集,发现存在较大泛化差距,证实注入少量新用户样本的个性化适配可显著提升识别性能,为HRI稳健部署提供支撑。

Comments Data collection was approved by the Federal University of Technology-Paraná Ethics Committee (CAAE 91430125.0.0000.0177). The MAGIC-HRI (Multimodal Activity, Gesture, and Intention Collection for HRI) dataset is available at [https://github.com/ruancarminati/MAGIC-HRI-V01.git](https://github.com/ruancarminati/MAGIC-HRI-V01.git). This paper will be presented at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人数据与评测 31 篇

2512.01946 2026-08-25 cs.RO cs.CV 版本更新 84%

Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models

为视觉-语言机器人操控扩展跨环境故障推理数据

Paul Pacaud, Ricardo Garcia, Shizhe Chen, Cordelia Schmid

机构 * Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎高等师范学院、法国国家科学研究中心、巴黎文理研究大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出自动框架生成多样化的机器人规划与执行故障数据,构建FailCoT数据集,训练Guardian模型提升故障检测泛化能力。

Comments Code, Data, and Models available at https://www.di.ens.fr/willow/research/guardian/. The paper contains 8 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15395 2026-08-25 cs.RO 版本更新 83%

Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述

Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis, Panagiotis Sarigiannidis, Efstratios Gavves, Kostas Bekris, Arash Ajoudani, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)

专题命中 机器人数据与评测 :robotics(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。

Journal ref Transactions on Machine Learning Research (TMLR), 07/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 81%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: https://github.com/AtongWang/world-model-simulators

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交 81%

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

专题命中 机器人数据与评测 :embodied AI(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21416 2026-08-25 cs.RO cs.AI 新提交 81%

Operational digital twin clinics enable task-based evaluation of embodied AI

可操作的数字孪生诊所支持具身人工智能的任务型评估

Xinyuan Wu, Jingrao Zhang, Mengdi Xu, Henry K. Chu, Mingguang He, Danli Shi

专题命中 机器人数据与评测 :embodied AI(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出将常规诊所图像转换为可操作的数字孪生,用于评估具身人工智能,验证了其在机器人测试、策略学习等方面的有效性,填补了具身AI医疗应用离线开发与物理部署间的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22990 2026-08-25 cs.RO 新提交 79%

InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation

InstructMove:一种指令跟随操作的文本不可或缺基准

Mengao Zhao, Ziang Li, Chaodong Huang, Mengchen Ma, Haoyi Jiang, Yiwei Jin, Xinjie Wang, Yun Du, Xuewu Lin, Taojun Ding, Hongyu Xie, Jackson Jiang, Chunlei Yu, Kaihua Zhang, Lichao Huang, Liu Liu, Tianwei Lin, Zhizhong Su

机构 * Horizon Robotics(地平线机器人) WuwenAI(悟文智能) Southeast University(东南大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO

AI总结 针对现有操作基准无法充分检验机器人指令跟随能力的问题,提出文本不可或缺的InstructMove基准,将指令跟随分解为多环节,实验表明其可诊断视觉捷径且模拟数据能提升现实操作性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 79%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.CV

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-08-25 cs.CV 版本更新 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23140 2026-08-25 cs.CV cs.RO 新提交 62%

MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models

MIVIFI:弥合透视域与鱼眼域以训练多视图鱼眼图像生成模型

Matthias Neuwirth-Trapp, Begüm Altunbas, Jiayi Wang, Yan Xia, Maarten Bieshaar, Xinyu Huang, Daniel Cremers

机构 * ETH Zurich(苏黎世联邦理工学院) Bosch Research(博世研究中心) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本研究针对多视图鱼眼图像生成问题,提出SyntheOcc-FE与MIVIFI两种方法,其中MIVIFI利用跨域学习缓解鱼眼数据稀缺问题,实现高保真的多视图鱼眼图像生成。

Comments Accepted at the IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-08-25 cs.RO cs.AI 62%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13200 2026-08-25 cs.LG cs.AI cs.MA 版本更新 62%

SRMT: Shared Memory for Multi-agent Lifelong Pathfinding

SRMT:面向多智能体终身路径规划的共享内存

Alsu Sagirova, Yuri Kuratov, Mikhail Burtsev

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出共享循环记忆Transformer(SRMT),通过全局共享内存工作区实现去中心化多智能体的无约束协调,在PO-MAPF等任务上表现优于基线,可扩展且无需领域特定启发式。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16291 2026-08-25 cs.RO cs.AI 62%

Guessing human intentions to avoid dangerous situations in caregiving robots

Noé Zapata, Gerardo Pérez, Lucas Bonilla, Pedro Núñez, Pilar Bachiller, Pablo Bustos

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

Comments Associated mpeg file see https://youtu.be/87UEB8P97KY

Journal ref Applied Sciences 2025 15(2) 11084

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-08-25 cs.AI 版本更新 61%

MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Wen-Huang Cheng, Jianlong Fu

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

专题命中 机器人数据与评测 :embodied agent(abstract,comments);分类 cs.AI

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18845 2026-08-25 cs.RO cs.SY eess.SY 版本更新 61%

MADR: MPC-guided Adversarial DeepReach

MADR:MPC引导的对抗性深度可达性分析

Ryan Teoh, Sander Tonkens, William Sharpless, Aijia Yang, Zeyuan Feng, Somil Bansal, Sylvia Herbert

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本研究提出MADR框架,用于鲁棒近似两人零和微分博弈值函数,通过结合MPC引导与对抗性深度可达性分析,在高维机器人仿真及硬件测试中优于现有基线方法。

Comments 8 pages, IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23290 2026-08-25 cs.CV 新提交 57%

Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments

Spotter:GPS信号退化环境下利用地理参考立面地标实现高效城市视觉定位

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(西班牙国家研究委员会-加泰罗尼亚理工大学机器人与工业自动化研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 Spotter是GPS退化环境下的实时视觉定位框架,以建筑立面为地理参考,在巴塞罗那数据集上精度优于里程计基线、与先进地图方法相当且帧率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23068 2026-08-25 cs.RO cs.SY eess.SY 新提交 57%

Switched Turn-based Adaptive Source Seeking Strategy using Estimation and Information-driven Direction of Improvement

基于估计和信息驱动改进方向的切换式回合自适应源搜寻策略

Shubhra Banerjee, Satadal Ghosh

机构 * Indian Institute of Technology Madras(印度马德拉斯理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出结合EKF估计与FIM方向选择的循环源搜寻框架,采用基于测量的收敛检测,在静止和移动源场景下较纯信息或估计驱动策略的跟踪性能更优、估计误差更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-25 cs.AI 新提交 57%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22960 2026-08-25 cs.AI 新提交 57%

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21778 2026-08-25 cs.RO 新提交 57%

Vision Guided Target Conditioned Control for Autonomous Excavation

面向自主挖掘的视觉引导目标条件控制

Shuai Zhao, Ji-An Pan, Junwei Li, Xun Tang, Fansen Xi, Qing Xu, Keqiang Li, Jianqiang Wang

机构 * Liaoning University(辽宁大学) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对自主挖掘问题,提出结合视觉目标条件与配对演示的掩码条件动作块Transformer框架,在模拟任务中显著提升挖掘成功率与堆料清理效率,为挖掘机自动化提供实用方案。

Comments 5 pages, 3 figures, 3 tables. Accepted at ISCSIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21533 2026-08-25 cs.RO cs.SY eess.SY 新提交 57%

Model-Free Adaptive Parameter Tuning for Efficient Multi-Robot Warehouse Operations

用于高效多机器人仓库作业的无模型自适应参数调优

Pratap Tokekar, Mouhacine Benosman, Rahul Chandan, Alexandre Ormiga Galvao Barbosa, Michael Caldara, Joseph W. Durham

机构 * Amazon Robotics(亚马逊机器人公司) University of Maryland(马里兰大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对多机器人仓库作业参数需随工况动态调整的问题,提出基于极值寻优控制(ESC)的无模型自适应参数调优框架,经仿真验证可平均提升吞吐量5.0%,动态工况下提升8.4%,实现自调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18632 2026-08-25 cs.RO 版本更新 57%

Evaluation of Monocular SLAM Systems on High-Altitude Nadir UAV Footage

高空天底视角无人机影像下单目SLAM系统的评估

Gašper Spagnolo, Matej Dobrevski, Danijel Skočaj

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 该研究评估5种单目SLAM系统在高空天底视角无人机影像的性能,发现DROID-SLAM表现最优,MASt3R-SLAM水平误差最低,但所有系统垂直位置估计差、大面积轨迹失真,纯视觉单目SLAM不足以可靠应用于航空导航。

Comments 6 pages, accepted to ERK 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17978 2026-08-25 cs.AI 版本更新 57%

MoCo-AIS: A Contrastive Learning Framework for Similarity Computation of Vessel Trajectories

MoCo-AIS: 一种用于船舶轨迹相似度计算的对比学习框架

Ruixin Song, Md Mahbub Alam, Zahra Sadeghi, Amilcar Soares, José F. Rodrigues-Jr, Gabriel Spadon

机构 * Dalhousie University(达尔豪斯大学) Linnaeus University(林奈大学) University of Sao Paulo(圣保罗大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出基于动量对比(MoCo)的统一对比学习框架MoCo-AIS,通过正负轨迹对学习嵌入,在真实AIS数据集上评估多种深度学习模型,显著提升轨迹相似度学习性能。

Comments Under review at IEEE Big Data'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-08-25 cs.CV 版本更新 57%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24136 2026-08-25 cs.CV eess.IV 版本更新 57%

Bridging Restoration and Generation in One-step Diffusion for Real-World Image Super-Resolution

连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用

Shyang-En Weng, Yi-Cheng Liao, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan MediaTek Inc., Taiwan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15052 2026-08-25 cs.RO 版本更新 57%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 4 figures, accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-08-25 cs.MA cs.AI cs.CL 版本更新 57%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏