arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2605.19630 2026-05-20 cs.AI 57%

EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection

EMO-BOOST:情感增强的音频视觉特征用于深度伪造检测中的泛化改进

Aritra Marik, Marcel Klemt, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆施塔特技术大学) ELIZA

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出EMO-BOOST框架,通过融合传统RGB和声学聚焦检测器与基于情感的EmoForensics检测器,利用高阶语义线索提升深度伪造检测的泛化能力,实验显示在FakeAVCeleb数据集上平均跨操纵泛化AUC提升了2.1%。

Comments Accepted at SAFE@CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19386 2026-05-20 cs.CV 57%

MatPhys: Learning Material-Aware Physics Parameters for Deformable Object Simulation from Videos

MatPhys: 从视频中学习材料感知的物理参数以模拟可变形物体

Yang Yang, Yiyan Wang, Zheming Liu, Naoya Iwamoto

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Huawei Technologies Japan K.K(华为技术日本株式会社)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出MatPhys方法,通过单视角视频预测弹簧-质量参数,解决了现有方法在材料假设和跨场景一致性方面的不足,从而提升可变形物体模拟的准确性和泛化能力。

Comments Submitted to Siggrah Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 57%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 57%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04525 2026-05-20 cs.RO 57%

HDFlow: Hierarchical Diffusion-Flow Planning for Long-horizon Tasks

HDFlow:用于长时间任务的分层扩散-流规划

Nandiraju Gireesh, Yuanliang Ju, Chaoyi Xu, Weiheng Liu, Yuxuan Wan, He Wang

机构 * Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出HDFlow,一种新的分层规划框架,利用扩散和修正流模型的优势,克服了单一范式生成规划器的局限性,通过在模拟和现实中的家具组装任务验证其有效性。

Comments ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02223 2026-05-20 cs.SD cs.CV 57%

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran

机构 * Posts and Telecommunications Institute of Technology

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11234 2026-05-20 cs.CV 57%

RoomPilot: Controllable Indoor Scene Synthesis via Multimodal Semantic Parsing

RoomPilot: 通过多模态语义解析实现可控的室内场景合成

Wentang Chen, Shougao Zhang, Yiman Zhang, Tianhao Zhou, Ruihui Li

机构 * School of Information Science and Engineering, Hunan University(信息科学与工程学院,湖南大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 该研究提出RoomPilot框架,通过多模态语义解析实现可控的室内场景合成,解决了现有方法输入模态有限和生成过程隐式的问题,提高了场景结构和语义的可控性。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18467 2026-05-19 cs.CV 57%

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

InstructAV2AV:基于指令的音频视频联合编辑

Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出InstructAV2AV,首个端到端的指令引导音频视频联合编辑框架,通过构建大规模音频视频编辑数据集InsAVE-80K和改进的生成模型,实现了更高质量的音频视频联合编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18451 2026-05-19 cs.CV cs.GR 57%

Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间

Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan, Zhaoyang Lyu, Xudong Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) University of Warwick(沃里克大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05653 2026-05-19 cs.RO cs.MA 57%

EvoQRE: Modeling Bounded Rationality in Safety-Critical Traffic Simulation via Evolutionary Quantal Response Equilibrium

EvoQRE: 通过进化量化反应均衡建模安全关键交通仿真中的有限理性

Phu-Hoa Pham, Chi-Nguyen Tran, Duy-Minh Dao-Sy, Phu-Quy Nguyen-Lam, Trung-Kiet Huynh

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 本文提出EvoQRE框架,通过量化反应均衡和进化博弈动态建模安全关键交通交互,理论证明其在弱单调性假设下收敛到Logit-QRE,并在Waymo和nuPlan数据集上验证了其在真实性和安全指标上的优越性。

Comments This article is being withdrawn due to identified issues in the experimental evaluation and theoretical assumptions that may affect the validity of some reported conclusions. The authors plan to revise the methodology and provide a corrected version in future work.

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20857 2026-05-19 cs.CL cs.AI 57%

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

Evo-Memory:通过自演化记忆基准测试LLM代理的测试时间学习

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng

机构 * Google DeepMind(谷歌DeepMind) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出Evo-Memory,一个用于评估LLM代理自演化记忆能力的综合流基准和框架,通过构建序列任务流数据集,要求LLM在每次交互后搜索、适应和演化记忆,并在10个多样化的多轮目标导向和单轮推理与问答数据集上评估了超过十种代表性的记忆模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18058 2026-05-19 cs.CV 57%

Threats to Arabic Handwriting Recognition: Investigating Black-Box Adversarial Attacks on embedded ConvNet models

阿拉伯手写识别的威胁:调查嵌入式卷积网络模型上的黑盒对抗攻击

Mohsine EL Khayati, Abdelillah Semma, Abdelaziz Courr, Rachid Elouahbi

机构 * Systems theory and informatics laboratory(系统理论与信息学实验室) Moulay Ismail University of Meknes(穆莱·艾息姆大学) Department of Computer Science(计算机科学系) EST of Sidi Bennour(西迪·本努尔工程与技术学院) Chouaib Doukkali University(侯赛因·杜克利大学) Faculty of Education Sciences(教育科学学院) University Mohammed V(穆莱·维大学) Laboratory of Computer Science and Applications(计算机科学与应用实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本研究探讨了阿拉伯手写识别系统对黑盒对抗攻击的脆弱性,通过实验揭示了高精度模型在面对对抗攻击时的易受攻击性,强调了加强模型安全性和可靠性的必要性。

Comments Accepted in the IEEE 15th Image, Video, and Multidimensional Signal Processing Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 57%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 57%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16899 2026-05-19 cs.CV 57%

LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map

LASAR:迈向基于潜在认知图的时空推理

Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出LASAR架构,通过双记忆系统维护事件经历和语义认知图,并引入ST-CRL对比目标训练该架构,以提升长距离碎片化经验中对细粒度空间关系的编码能力,在标准VLN-CE和VSI-Bench基准上实现了零样本泛化能力的2%-3.5%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10408 2026-05-19 cs.SE cs.RO 57%

VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

VISOR:基于视觉-语言模型的机器人测试 oracle

Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆理工大学) Mondragon University(蒙dragon大学) National Institute of Informatics(国立信息研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 VISOR 提出基于视觉-语言模型的自动化测试 oracle 方法,解决机器人测试中任务正确性评估难题,通过两个模型在多个任务上验证,展现高召回率和高精确度,但不确定性与正确性相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08454 2026-05-19 cs.RO 57%

Real2Sim via Active Perception with Behavior Trees Automatically Generated by VLMs

通过主动感知与行为树自动生成功能的Real2Sim

Alessandro Adami, Sebastian Zudaire, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) ABB Robotics(ABB机器人)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于视觉语言模型的自主Real2Sim框架,通过分解语义任务,自动生成行为树以高效获取物理参数,实验证明其在效率和安全性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07152 2026-05-19 cs.CV 57%

Intuitive Surgical SurgToolLoc and SurgVU Challenges Results: 2022-2025

直观外科SurgToolLoc和SurgVU挑战结果:2022-2025

Aneeq Zia, Max Berniker, Rogerio Garcia Nespolo, Xiaorui Zhang, Conor Perreault, Kiran Bhattacharyya, Xi Liu, Ziheng Wang, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Bo Liu, David Austin, Yiheng Wang, Michal Futrega, Jean-Francois Puget, Zhenqiang Li, Yoichi Sato, Ryo Fujii, Ryo Hachiuma, Mana Masuda, Hideo Saito, An Wang, Mengya Xu, Mobarakol Islam, Long Bai, Winnie Pang, Hongliang Ren, Chinedu Nwoye, Luca Sestini, Nicolas Padoy, Maximilian Nielsen, Samuel Schüttler, Thilo Sentker, Hümeyra Husseini, Ivo Baltruschat, Rüdiger Schmitz, René Werner, Aleksandr Matsun, Mugariya Farooq, Numan Saaed, Jose Renato Restom Viera, Mohammad Yaqub, Neil Getty, Fangfang Xia, Zixuan Zhao, Xiaotian Duan, Xing Yao, Ange Lou, Hao Yang, Jintong Han, Jack Noble, Jie Ying Wu, Tamer Abdulbaki Alshirbaji, Nour Aldeen Jalal, Herag Arabian, Ning Ding, Knut Moeller, Weiliang Chen, Quan He, Muhammad Bilal, Taofeek Akinosho, Adnan Qayyum, Massimo Caputo, Hunaid Vohra, Michael Loizou, Anuoluwapo Ajayi, Ilhem Berrou, Faatihah Niyi-Odumosu, Charlie Budd, Oluwatosin Alabi, Tom Vercauteren, Ruoxi Zhao, Ayberk Acar, John Han, Jumanh Atoum, Yinhong Qin, Surong Hua, Lu Ping, Wenming Wu, Rongfeng Wei, Jinlin Wu, You Pang, Zhen Chen, Tim Jaspers, Amine Yamlahi, Piotr Kalinowski, Dominik Michael, Tim Rädsch, Marco Hübner, Danail Stoyanov, Stefanie Speidel, Lena Maier-Hein, Jie Tian, Ruxin Zhang, Khang Hoang Nguyen, Anh Quoc Nguyen, Tam Minh Nguyen, Khoi Dinh Tran, Minh Nguyen Dang Nhat, Trinh Thi Doan Pham, Linh Van Nguyen, Chunyang Jiang, Dewei Yang, Haitao Li, Yannick Prudent, Thibaut Boissin, Mahmood Alam, Shazad Ashraf, Andrew D. Beggs, Lukman Akanbi, Manuel D. Delgado, Narain Gupta, Amir M. Hajiyavand, Iqbal Qasim, Hafiz A. Alaka, Junaid Qadir, Shu Yang, Yihui Wang, Hao Chen, Shin Paul, Yosuke Yamagishi, Zhang Dong, Hongyun Li, Hongyu Gu, Xiaoliu Ding, Xiaoyao Liu, Xingyu Zhao, Mariana Ribeiro, Tiago Jesus, André Ferreira, Guilherme Barbosa, João Carvalho, Leonardo Barroso, Nuno Gomes, Rafael Peixoto, Rodrigo Ralha, Victor Alves, Stephanie, Nattapat Ittikosil, Achita Chitrapan, Quan Huu Cap, Jiayuan Huang, Shreyas C Dhake, Sergi Kavtaradze, Mobarak I Hoque, Ka Young Kim, Su Yong Yun, Young Tae Kim, Hyeon Bae Kim, Seong Tae Kim, Zuxing Deng, Ling Li, Jieyu Zheng, Xiaojian Li, Anthony Jarc

机构 * Intuitive Surgical, Inc.(Intuitive Surgical公司) Muroran Institute of Technology(Muroran理工学院) Niigata University of Health and Welfare Fujita Health University(Niigata大学健康与福利大学 Fujita健康大学) NVIDIA, Inc.(NVIDIA公司) University of Tokyo(东京大学) Keio University(Keio大学) Shun Hing Institute of Advanced Engineering(Shun Hing先进工程研究所) NUS NUSRI SZ(新加坡大学 NUSRI SZ) University of Strasbourg IHU Strasbourg(斯特拉斯堡大学 IHU斯特拉斯堡) University Medical Center Hambrug-Eppendorf(汉堡-埃彭多夫大学医学中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文总结了2022-2025年间在机器人辅助手术中解决手术工具定位和手术视觉理解的挑战成果,探讨了相关机器学习问题的解决方法与贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16116 2026-05-18 cs.AI 57%

ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

ShopGym: 一个集成框架,用于电子商务网络代理的现实模拟和可扩展基准测试

Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu, Han Li, Shuang Xie, Alberto Castelo, Tianfu Wu, Lingyun Wang

机构 * North Carolina State University(北卡罗来纳州立大学) Shopify

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出ShopGym框架,通过模拟层ShopArena和基准层ShopGuru,实现电子商务网络代理的现实模拟与可扩展基准测试,验证了合成商店在结构属性和代理性能上的有效性。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15923 2026-05-18 cs.CV 57%

Invaria: Learning Scale and Density Invariance in Point Clouds via Next-Resolution Prediction

Invaria:通过下一分辨率预测实现点云中的尺度和密度不变性

Chun-Peng Chang, Shaoxiang Wang, Alain Pagani, Dariu Gavrila, Holger Caesar

机构 * TU Delft(代尔夫特理工大学) DFKI(德累斯顿德国研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Invaria,一种通过下一分辨率预测和感受野校准实现点云尺度和密度不变性的编码器,提升了模型在不同分辨率下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 57%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15650 2026-05-18 cs.RO 57%

MyoChallenge 2025: A New Benchmark for Human Athletic Intelligence

MyoChallenge 2025: 人类运动智能的新基准

Cheryl Wang, Chun Kwang Tan, Balint K. Hodossy, Eric Lyu, Jun Guo, Wentao Zhao, Huaping Liu, Chengkun Li, Merkourios Simos, Bianca Ziliotto, Alexander Mathis, Siyuan Liu, Jiahao Chen, Shanlin Zhong, Bo Jiang, Ci Song, Yaoye Zhu, Chenhui Zuo, Yanan Sui, Mohamed Irfan Refai, Massimo Sartori, Guillaume Durandau, Vikash Kumar, Vittorio Caggiano

机构 * McGill University(麦吉尔大学) National University of Singapore(国立新加坡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院) Tsinghua University(清华大学) EPFL(苏黎世联邦理工学院) CASIA(中国科学院自动化所) University of Twente(代尔夫特理工大学) MyoLab

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出MyoChallenge 2025基准,通过高保真骨骼肌模型与机器学习算法结合,推动运动控制智能研究,包含乒乓球和足球点球两个任务,促进多学科交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15535 2026-05-18 cs.CV 57%

Learning Dynamic Structural Specialization for Underwater Salient Object Detection

学习动态结构专业化用于水下显著目标检测

Lin Hong, Chenhui Wang, Linan Deng, Yuning Cui, Yu Zhang, Xin Wang, Bojian Zhang, Wenqi Ren, Xingchen Yang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(机器人与先进制造学院,哈尔滨工业大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) College of Computer Science & Visual Computing and Intelligent Perception Lab, Nankai University(计算机科学与视觉计算学院及智能感知实验室,南开大学) School of Cyber Science and Technology, Sun Yat-sen University(网络科学与技术学院,中山大学) School of Automation, Southeast University(自动化学院,东南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出DSS-USOD方法,通过动态结构专业化解决水下图像退化导致的定位不准确、区域碎片化和边界预测粗的问题,提升边界精度与区域一致性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 57%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 57%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14700 2026-05-15 cs.RO 57%

SR-Platform: An Agentic Pipeline for Natural Language-Driven Robot Simulation Environment Synthesis

SR-Platform:一种基于自然语言的机器人仿真环境合成代理管道

Ben Wei Lim, Minh Duc Le, Thang Truong, Thanh Nguyen Canh

机构 * Strike Robotics

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO

AI总结 SR-Platform通过代理系统将自然语言描述转化为可执行的MuJoCo仿真环境,显著降低手动创建多样机器人训练环境的工作量,实现从普通英文提示在一分钟内生成可执行场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 57%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11468 2026-05-15 cs.LG stat.ML 57%

Increasing the Scope as You Learn: Adaptive Bayesian Optimization in Nested Subspaces

扩大学习范围:嵌套子空间中的自适应贝叶斯优化

Leonard Papenmeier, Luigi Nardi, Matthias Poloczek

机构 * Lund University(吕勒欧大学) Stanford University(斯坦福大学) DBtune Amazon(亚马逊)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出BAxUS方法,通过嵌套随机子空间自适应优化空间,提升高维贝叶斯优化性能,理论保证其鲁棒性并在多种应用中表现更优。

Comments 28 pages, 8 figures. Accepted to NeurIPS 2022. This is the revised version and includes the appendix

Journal ref Advances in Neural Information Processing Systems 35 (NeurIPS 2022), pp. 11586-11601

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09046 2026-05-15 cs.RO 57%

Terminal Matters: Kinodynamic Planning with a Terminal Cost and Learned Uncertainty in Belief State-Cost Space

终端问题:带有终端成本和学习不确定性的动力学规划

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯通理工学院(WPI))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种终端成本形式的动力学规划方法,通过优化终端状态质量和累积轨迹成本提升目标可靠性。KiTe规划器结合学习的不确定性模型,提高了在不确定环境下的目标达成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13470 2026-05-14 cs.LG 57%

Twincher: Bijective Representation Learning for Robust Inversion of Continuous Systems

Twincher: 基于双射表示学习的连续系统鲁棒反演

Arkady Gonoskov

机构 * Department of Physics, University of Gothenburg(哥德堡大学物理系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出Twincher架构,通过结构化微分同胚变换和对抗训练策略,实现对连续前向过程的鲁棒反演,提升机器人、视觉和物理AI中的数据效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏