Digital Twin Synchronization Over Mobile Embodied AI Network With Agentic Intelligence
基于移动具身AI网络的数字孪生同步
专题命中 机器人数据与评测 :embodied AI(title,abstract)
AI总结 本文提出基于移动具身AI网络的数字孪生同步框架,通过五阶段闭环工作流和分层优化算法,实现高保真同步并降低偏差。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
基于移动具身AI网络的数字孪生同步
专题命中 机器人数据与评测 :embodied AI(title,abstract)
AI总结 本文提出基于移动具身AI网络的数字孪生同步框架,通过五阶段闭环工作流和分层优化算法,实现高保真同步并降低偏差。
面向机器人视觉-语言模型的具有推理能力的空间轨迹
专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.CV
AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。
Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer
SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体
机构 * Stanford University(斯坦福大学)
专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI
AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。
RoboVista:评估用于各种机器人应用的视觉语言模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。
Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/
物理镜像:物理感知镜像对象生成
机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) ; Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) ; University of Dayton(代顿大学) ; Monash University(莫纳什大学) ; VinFast(VinFast公司) ; VinUniversity(Vin大学)
专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV
AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。
Comments IROS 2026
SilvaScenes:自然森林冠层下图像中的树木检测与物种分类
机构 * Northern Robotics Laboratory, Université Laval(北方机器人实验室,拉瓦尔大学) ; Département des sciences du bois et de la forêt, Université Laval(林业与木材科学系,拉瓦尔大学) ; Institut des Sciences de la Forêt tempérée, Université du Québec en Outaouais(温带森林科学研究所,魁北克outsouais大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对深度学习发展下森林自动化需求,提出SilvaScenes数据集,用于自然森林冠层下图像的树种实例分割,评估显示树干分割可行,物种分割有挑战,还指出关键问题及图像分辨率的作用。
Comments 14 pages, 8 figures
iVISION-2DCD:用于大规模户外建筑监测的长期变化检测数据集
机构 * National Research Council Canada(加拿大国家研究委员会) ; Vision and Image Processing Research Group, Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系视觉与图像处理研究小组)
专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO、cs.CV
AI总结 研究从检测建筑工地变化监测施工进度,针对跨视角变化检测算法缺开源基准数据集问题,用LiDAR点云生成iVISION-2DCD数据集,提出合成数据生成等方法,为相关领域带来新挑战。
Comments 11 pages, 7 figures, 1 table. Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026). Project page: https://danielmao2019.github.io/iVISION-2DCD-dataset.github.io/
用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。
Comments 11 pages, 5 figures, technical report
SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移
机构 * NVIDIA Corporation(英伟达公司) ; University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。
Comments Website: https://silo-cable-routing.github.io/
E-TraMamba:一种用于事件相机的高效长期3D特征跟踪的新范式
机构 * Department of Computing, FCMS(计算系(FCMS)) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 针对现有3D跟踪器在处理稀疏、噪声事件流时的问题,提出E-TraMamba框架,采用线性状态空间模型和多尺度线索融合等方法,构建数据集,实验表明其性能达最优,适用于多种视觉任务。
Comments 14 pages
K9-Bench:在以犬类为中心的视频上评估多模态大语言模型
机构 * Ogmen Robotics Inc.(Ogmen机器人公司) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV
AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。
EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架
机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。
无需封闭车道的交通感知无人机路面监测数字孪生框架
机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 提出基于Unity的数字孪生框架,集成YOLOv8n检测与分类器,实现交通感知无人机路面监测,无需封闭车道,实验评估三种遮挡恢复策略,最高覆盖率达97.95%。
Comments Accepted for publication in the proceedings of the 6th Annual IEEE International Conference on Digital Twins and Parallel Intelligence (DTPI 2026)
Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练
机构 * Duke University(杜克大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。
Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA
AnchorDream:将视频扩散用于具身感知机器人数据合成
机构 * Toyota Research Institute(丰田研究院) ; USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV
AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。
Comments Project page: https://jay-ye.github.io/AnchorDream/
UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Technology Innovation Institute(技术创新研究院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。
BaTCAVe:机器人行为的可信解释
机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。
Comments 19 pages, 26 figures
Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874
理性逆推理:通过规划推断意图进行少样本模仿
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。
S-ICDF数据集:基于Sionna仿真的动态干扰表征与测向数据集
机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫整合电路研究所)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI
AI总结 针对干扰监测数据集稀缺问题,基于Sionna生成含102种干扰配置的大规模S-ICDF数据集,用经典测向方法与现代ML方法完成基准测试,支撑无线干扰相关算法研发。
Comments 6 pages, 9 figures
面向稳健非视距场景的基于自编码器驱动高斯聚类的物理信息域不变特征学习方法
机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所IIS)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG
AI总结 针对非视距下射频干扰波达角估计性能下降问题,提出融合物理约束的混合学习框架,结合自编码器高斯聚类提取域不变特征,提升低样本下跨场景AoA估计精度。
Comments 7 pages, 8 figures
ChatImage:通过交互式图像导航大语言模型的长文本回答
机构 * Zhejiang University(浙江大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。
Comments Project:https://wencanjiang.github.io/ChatImage
FlatManifold:基于内在流形扁平化的强标签噪声与域偏移场景下鲁棒持续学习方法
机构 * Department of Mechanical Engineering, Faculty of Engineering, University of Fukui(日本福井大学工学部机械工学科)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG
AI总结 针对非平稳流环境下强未校准标签噪声与非线性域偏移共存的挑战,提出FlatManifold框架,通过流形扁平化实现鲁棒持续学习,大幅优于基线方法。
Comments 5 pages, technical report
InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动
机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。
Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/
道路施工区域检测与地理定位的框架和多模态数据集
机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) ; Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) ; Technical University of Munich(慕尼黑工业大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。
Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG
用于实时碰撞避免的GPU加速多边形符号距离函数
机构 * School of Mechanical Engineering, Yonsei University(延世大学机械工程学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO
AI总结 研究在密集障碍物环境中实时碰撞避免问题,提出多边形符号距离函数(PSDF),通过张量化几何管道实现GPU加速,嵌入模型预测控制,设计分离CPU/GPU计算,实验证明其有效性。
Comments 13 pages, 5 figures, 3 tables
SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架
机构 * University of Science and Technology of China(中国科学技术大学) ; King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Vast Intelligence Lab(旷视智能实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。
Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard
通过信息过载对大型视觉语言模型进行越狱攻击
机构 * National University of Singapore(新加坡国立大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV
AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。
大语言模型是否准备好进行冲突监测?来自西非的实证证据
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG
AI总结 研究评估多个大语言模型在尼日利亚和喀麦隆冲突事件分类中的表现,发现普通模型有错误合法化偏差,领域适应模型有行为者选择偏差,输出对地理特定词汇框架敏感,当前模型不适用于冲突监测,呼吁针对性改进。
Journal ref The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026), June 25-28, 2026, Montreal, QC, Canada. ACM, New York, NY, USA
野外稀疏视角3D高斯点云生成
机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; GenGenAI ; Seoul National University(首尔国立大学) ; Kennesaw State University(肯纳邦斯州立大学)
专题命中 机器人数据与评测 :robotic(abstract_cn);分类 cs.CV
AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。
Comments 16 pages, 16 figures, and 14 tables
HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试
机构 * The University of Melbourne(墨尔本大学) ; Melsy Tech(Melsy科技) ; MBZUAI ; Navlyn ; The University of Sydney(悉尼大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。