Learning 3D-Gaussian Simulators from RGB Videos
从RGB视频学习3D高斯模拟器
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出3DGSim,一种从多视角RGB视频直接学习物理交互的3D模拟器,统一了3D场景重建、粒子动力学预测和视频合成,能泛化到未见过的多体交互和新场景编辑。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
从RGB视频学习3D高斯模拟器
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出3DGSim,一种从多视角RGB视频直接学习物理交互的3D模拟器,统一了3D场景重建、粒子动力学预测和视频合成,能泛化到未见过的多体交互和新场景编辑。
HapTile: 用于接触丰富模仿学习的触觉感知视觉-触觉-语言-动作数据集
机构 * King’s College London, UK(伦敦国王学院) ; Huawei, Noah’s Ark Lab, UK(华为、诺亚实验室) ; University College London, UK(伦敦大学学院)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出HapTile数据集,通过集成指尖触觉反馈和操作员触觉感知,为接触丰富的机器人操作任务提供视觉-触觉-语言-动作联合数据,并验证其在策略学习中的有效性。
QuadVerse:一种对齐视觉-物理现实用于四足仿真的集成框架
机构 * Nanjing University(南京大学) ; BUPT(北京邮电大学) ; DEXMAL ; Tsinghua University(清华大学)
专题命中 机器人数据与评测 :robot learning(abstract);navigation(abstract);分类 cs.RO
AI总结 提出QuadVerse框架,通过重建场景校准视觉、物理和致动器,利用3DGS和接触校准减少仿真到现实的差距,实现零样本视觉导航策略部署。
MiDAS:一种用于机器人辅助微创手术的多模态数据采集系统和数据集
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 MiDAS是一种开源多模态数据采集系统,能够实现机器人辅助微创手术的非侵入式数据采集,并发布首个高保真仿真模型的缝合任务数据集。
Comments 29 pages, 17 figures
在ImaginationLand中学习:通过3D生成模型(OP-Gen)实现全向策略
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 该研究提出用3D生成模型(OP-Gen)从单个真实演示扩充数据集,学习全向策略,可减少所需演示数,在多任务上性能优于基线方法。
Comments Project webpage with robot videos: https://www.robot-learning.uk/op-gen
RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。
Comments Accepted by ECCV
MODEST:多光学深度景深立体数据集
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。
Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST
Curiosity-Diffuser:引导扩散模型提升可靠性的好奇心机制
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 针对机器人神经网络模型不稳定的问题,提出Curiosity-Diffuser方法,结合RND好奇心模块与分类器引导扩散提升策略可靠性,经仿真与真实实验验证有效
Comments Accepted for publication in Machine Intelligence Research
神经执行器:用于机器人动力学和外力感知的神经驱动建模
机构 * MIT(麻省理工学院) ; Amazon(亚马逊)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 研究针对低成本平台执行器动力学致模拟到现实误差问题,提出NeuralActuator模型,能联合预测多种内容,引入NAD数据集,通过可微模拟训练,经多平台实验验证其在电机状态估计等方面有应用价值。
Comments RSS 2026. Outstanding Systems Paper Award. Project Page: https://people.csail.mit.edu/frankzydou/projects/NeuralActuator/index.html Code: https://github.com/Frank-ZY-Dou/Dynamics-Modeling/tree/main/NeuralActuator
SWITCH:在长时程具身场景中评估和处理具象接口的基准测试
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。
Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH
SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅
机构 * Purdue University(普渡大学) ; University of California, Berkeley(加州大学伯克利分校) ; Toyota InfoTech Labs(丰田信息科技实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。
Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模
机构 * Northwestern University(西北大学) ; Dolby Laboratories(杜比实验室)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。
Mordal: 面向视觉语言模型的自动化预训练模型选择
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。
可解释深度学习提升人类对自动驾驶汽车的心理模型
机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) ; Motional AD Inc.(Motional AD公司) ; Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) ; Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。
Comments MST & JAS contributed equally to this work
如何缓解越野环境语义分割中的分布偏移
机构 * Department of Electrical and Communication Engineering, Seoul National University(电子与通信工程系,首尔国立大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV;robotics(comments)
AI总结 提出ST-Seg框架,通过风格扩展和纹理正则化缓解越野场景中源-目标域差异和传感器退化导致的分布偏移,提升语义分割鲁棒性。
Comments 8 pages, 6 figures. Accepted to IEEE Robotics and Automation Letters (RA-L)
Journal ref IEEE Robotics and Automation Letters, vol. 10, issue. 5, pp. 4500-4507, 2025
视觉目标姿态估计的不确定性量化
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO、cs.CV
AI总结 SLUE通过凸优化方法为视觉目标姿态估计提供高概率的椭球不确定性界,有效缩小平移界限并保持方向精度。
Comments 18 pages, 9 figures. Code available: https://github.com/MIT-SPARK/PoseUncertaintySets. Published in IEEE Transactions on Robotics
Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)
AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。
Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)
CADENCE:预测实际MAPF执行时间超越成本总和
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 机器人数据与评测 :robotic(abstract,comments);分类 cs.RO;robotics(comments)
AI总结 提出CADENCE框架,通过分析原始运动负担和交互感知协调特征,发现原始运动负担能显著提高多智能体路径规划执行时间的预测精度,超越传统成本总和指标。
Comments 7 pages, 4 figures, 3 tables and this paper was accepted at Multi-Agent Robotic Systems: Real-World Collaboration and Interaction a workshop at the international conference of robotics and automation (ICRA 2026)
OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成
机构 * Gwangju Institute of Science and Technology(全州科学技术院)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。
Comments Accepted to ECCV 2026
EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。
Comments Accepted by COLM2026. The first two authors contributed equally. Project website: https://egomemreason.github.io/
流运动策略:基于流匹配模型的机械臂运动规划
机构 * Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学Zachry土木与环境工程系)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出流运动策略,一种基于流匹配模型的机械臂运动规划方法,通过生成路径分布实现高效推理优化。
OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集
机构 * USTC(中国科学技术大学) ; Kling Team(Kling团队) ; HDU(华中科技大学) ; PKU(北京大学) ; NJU(南京大学) ; CASIA(中国科学院自动化研究所) ; THU(清华大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。
VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化
机构 * Ukrainian Catholic University(乌克兰天主教大学) ; New York University(纽约大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。
LLM-Advisor: 一种用于多地形高效路径规划的LLM基准
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。
Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering
UniGround: 通过无训练场景解析实现通用三维视觉接地
机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) ; Shanghai Normal University(上海师范大学)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。
Comments 30 pages,9 figures,11 tables
MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准
机构 * Google(谷歌)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。
自动化欺骗:可扩展的多轮LLM欺骗攻击
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(埃弗格林谷学院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。
自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?
机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) ; Umeå University(于默奥大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。
Comments 21 pages, 7 figures,4 tables
四足机器人全景多模态语义占用预测
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出PanoMMOcc数据集和VoxelHound框架,通过垂直抖动补偿和多模态信息融合提升四足机器人全景多模态3D感知性能。
Comments The dataset and code will be publicly released at https://github.com/SXDR/PanoMMOcc
PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集
机构 * Zhejiang University(浙江大学) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) ; Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV
AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。
Comments 15pages, 4 figures, 4 tables