Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search
弥合评估差距:多目标搜索的标准化基准
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI
AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
弥合评估差距:多目标搜索的标准化基准
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI
AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。
BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络
机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) ; School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) ; Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。
Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH
可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证
机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) ; Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) ; Robotics Institute Germany (RIG)(德国机器人研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。
Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
DocQT: 通过多样化的JPEG量化表提高文档伪造定位的鲁棒性
机构 * MAIF, Niort, France(法国尼奥特MAIF机构) ; L3i Laboratory, La Rochelle University, La Rochelle, France(法国拉罗谢尔大学拉罗谢尔L3i实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出DocQT数据集,通过对比不同架构在不同量化表训练下的表现,证明标准质量因子增强无法代表实际压缩多样性,并展示了显式考虑量化表的架构在实际部署中的鲁棒性优势。
基于视觉-语言表示学习的场景变化检测
机构 * New York University(纽约大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。
Comments 9 pages, 6 figures, 6 tables
SimFoundry: 用于策略学习和评估的模块化自动化场景生成
机构 * NVIDIA ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Toronto(多伦多大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 提出SimFoundry系统,从视频零样本构建仿真场景,支持对象、场景和任务编辑,生成数字孪生与数字表亲,提升策略在真实世界的泛化能力,实验显示仿真评估与真实性能高度相关。
ASACK : 适应性安全主动持续Koopman学习用于具有收缩保证的不确定系统
机构 * Department of Mechanical Engineering, Indian Institute of Science(机械工程系,印度科学研究院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本文提出ASACK框架,通过合同适应律和主动学习策略实现非线性系统安全高效的持续适应,结合理论误差界与鲁棒MPC提供形式安全保证。
面向数据的可扩展敏感性分析用于决策树集成
机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(计算机科学与工程系,印度理工学院班加罗尔)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG
AI总结 本文提出了一种数据感知的敏感性分析框架,用于评估决策树集成的鲁棒性和公平性,通过混合整数线性规划和SMT编码提高效率,并在大规模集成上实现了显著改进。
指令调优语言模型代理中类似人类的内群体偏见
机构 * Independent Researcher(独立研究者)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。
HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准
机构 * Beijing Institute of Technology(北京理工大学) ; Beihang University(北京航空航天大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV
AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。
Comments Preprint
FGGS-LiDAR:从通用3DGS模型到LiDAR的超快速GPU加速仿真
机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; DISCOVER Robotics ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO
AI总结 提出FGGS-LiDAR框架,通过体积离散化和TSDF提取将预训练3DGS资产转换为水密网格,结合GPU加速光线投射实现超500 FPS的LiDAR仿真,在并行设置中比Isaac Sim低一个数量级延迟。
EnvShip-Bench:一种环境增强的短期船舶轨迹预测基准
机构 * Harbin Engineering University(哈尔滨工程大学) ; Politecnico di Torino(都灵理工大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG
AI总结 针对现有船舶轨迹预测基准缺乏统一协议和环境上下文的问题,提出EnvShip-Bench,基于丹麦海事局和NOAA的原始AIS数据构建,采用标准化预测协议,提供环境与邻近船舶上下文扩展,支持轨迹、环境感知和交互感知预测的统一评估。
Comments 16 pages,8 pages of main text
SAM3D-Phys:迈向真实世界中的多物体交互仿真
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。
Comments 9 pages, 4 figures
单目深度估计器中准确性并不保证人类化
机构 * Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 研究发现单目深度估计器的准确性与人类相似性之间存在复杂权衡,提升准确性不一定增强人类化行为。
Comments 21 pages, 14 figures, 1 table
为次优服务付费:一种对抗不诚实大语言模型提供者的博弈论方法
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; ShanghaiTech University(上海科技大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Shanghai University of Finance(上海财经大学) ; Tsinghua University(清华大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 本文提出了一种博弈论方法,通过设计近似激励相容机制,解决大语言模型服务提供者可能存在的不诚实行为问题,并保证用户效用的次优性。
Comments Published as a conference paper at WWW 2026; 12 pages, 4 figures
SUNSET -- 一种基于传感器融合的语义分割示例,用于基于ROS的自适应系统
机构 * XITASO GmbH(XITASO公司) ; German Aerospace Center (DLR) Institute of Flight Systems(德国航空航天中心(DLR)飞行系统研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 SUNSET是一种基于ROS2的自适应系统示例,通过传感器融合语义分割流水线和训练好的机器学习模型,实现对动态环境中的不确定性进行严格评估和自适应处理。
Comments Accepted at RoSE Workshop 2026
用于悬挂式双足机器人人体运动复现的三阶段离线SDRE控制框架
机构 * Department of Applied Mathematics, National Yang Ming Chiao Tung University(应用数学系,阳明交通大学) ; Department of Electrical Engineering, National Central University(电气工程系,国立中央大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本文针对下肢外骨骼人体评估的安全风险,提出三阶段离线SDRE控制框架,结合PID-LQR补偿,在悬挂式双足机器人上实现行走、下蹲运动的高精度可重复复现,性能优于基准控制器。
Comments 14 pages, 11 figures. Preliminary version submitted for documentation purposes on arXiv
VidNum-1.4K:一个全面的视频基于数值推理基准
机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV
AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。
Comments 7 pages, 5 figures
DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准
机构 * People’s Daily Online(人民网) ; Nanyang Technological University(南洋理工大学) ; Tongji University(同济大学) ; Nanjing University of Science and Technology(南京理工大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。
Comments Some errors must be corrected
BayesContact:通过视觉触觉提议和基于模拟的推理进行不确定姿态估计
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 针对富含接触操作中姿态估计难题,提出BayesContact框架,通过融合视觉与触觉信息及基于模拟的推理来维护物体姿态信念,经模拟预测与真实观测对比更新信念,提升了姿态可观测性与插入成功率。
Comments Update funding sources
超越成功率:攻防安全代理的成本感知评估
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI
AI总结 研究通过成本-成功率视角评估语言模型安全代理,在攻防挑战中比较固定成本下模型性能,发现红蓝队任务扩展模式不同,进攻性CTF性能与测试时计算量有关,防御性SOC调查更依赖工具使用等,强调安全代理基准应考量经济效率与运营契合度。
开放手术中机器人辅助的模仿学习:针对缝合跟随的多策略评估
机构 * Harvard Medical School(哈佛医学院) ; Massachusetts General Hospital(麻省总医院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本研究首次评估通用模仿学习在开放手术中用于外科医生-机器人协作辅助的可行性,以缝合跟随(每次缝合时助手执行的抓取-拉动-释放动作)为任务,通过比较四种策略(ACT、Diffusion Policy、SmolVLA、π₀)在28个训练模型上的表现,发现π₀在数据效率、背景鲁棒性和轨迹平滑性上最优,并在机器人缝合试验中达到92%的缝合完成率。
具备力感知的残差数据集聚合轨迹编辑用于阻抗控制的精确插入
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 本文提出TER-DAgger框架,通过优化轨迹编辑学习残差策略,减少协变量偏移,结合力感知的失败预判机制和阻抗控制框架,提升精确插入任务的成功率。
Comments 8 pages, 3 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
用于 API 调用智能体的无环境合成数据生成
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI
AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。
VOFA:基于力适应控制的人形机器人视觉目标推动
机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Amazon Inc.(亚马逊公司) ; Sony AI(索尼人工智能)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 本文提出VOFA系统,通过视觉引导实现对未知物理属性物体的精准推动,解决重物操控中的未知质量和地面摩擦问题,实现在仿真和现实中的高成功率表现。
Comments Accepted at IROS 2026. Project website: https://amrl.cs.utexas.edu/VOFA
信息几何下的概率单纯形贝叶斯优化
机构 * Department of Economics, Management and Statistics University of Milan, Bicocca(经济管理统计系米兰大学Bicocca分校) ; Department of Robotics, Perception and Learning KTH Royal Institute of Technology(机器人感知与学习系皇家理工学院KTH) ; University of Milan, Bicocca Milan, Italy(米兰大学Bicocca分校) ; KTH Royal Institute of Technology Stockholm, Sweden(皇家理工学院KTH 斯德哥尔摩瑞典)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG
AI总结 本文提出了一种基于信息几何的概率单纯形贝叶斯优化算法,通过构建几何优化器和马尔可夫核,在概率约束域中提升优化性能。
Comments 16 pages, 5 figures
通过扩散合成在多样场景中进行快速且安全的轨迹规划
机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) ; University of Michigan(密歇根大学) ; MIT(麻省理工学院)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO
AI总结 针对动态环境规划难题,提出能量参数化扩散规划框架,结合轻量级安全过滤器和场景无关的数据生成管道,实现多样场景下快速安全规划,仿真与真实实验验证了其有效性、鲁棒性和适用性。
通过新闻工作流程对智能新闻写作进行基准测试
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; Sony Group Corporation(索尼集团)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。
Comments Accepted to Findings of ACL 2026
用于自适应和容错模块化微型机器人的可编程同步图
机构 * Department of Mechanical Engineering, Bilkent University(巴尔坎大学机械工程系) ; International Iberian Nanotechnology Laboratory (INL)(国际伊比拉纳米技术实验室)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO
AI总结 研究模块化微型机器人协调难题,提出可编程同步图框架,通过图耦合编码运动协调,实现同步、相位调整、容错及适应,还能减轻耦合负担,降低相位误差,确立其为紧凑控制层。
HiLSVA:用于科学可视化的人机协同智能系统设计与评估
机构 * Department of Computer Science and Engineering, University of Notre Dame(Notre Dame 大学计算机科学与工程系)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 提出HiLSVA,一种人机协同智能系统,通过计划优先的多智能体架构、显式人类监督和逐步溯源,支持混合主动的科学可视化工作流,增强而非替代人类分析推理。
Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)