arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8686 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8686 篇

2307.08336 2026-04-21 cs.LG cs.RO 62%

RAYEN: Imposition of Hard Convex Constraints on Neural Networks

RAYEN:在神经网络中施加硬凸约束

Jesus Tordesillas, Victor Klemm, Jonathan P. How, Marco Hutter

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究 institute,ICAI 工程学院,Comillas 大学) Aerospace Controls Laboratory, Massachusetts Institute of Technology(航空航天控制实验室,麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 RAYEN通过高效方法在神经网络输出或潜在变量中施加硬凸约束,保证训练和测试时的约束满足,支持多种约束类型,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17231 2026-04-21 cs.CV cs.RO 62%

Fringe Projection Based Vision Pipeline for Autonomous Hard Drive Disassembly

基于条纹投影的自主硬盘拆解视觉流水线

Badrinath Balasubramaniam, Vignesh Suresh, Benjamin Metcalf, Beiwen Li

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Alcon Research Laboratories(阿康研究实验室) School of Environmental, Civil, Agricultural and Mechanical Engineering, University of Georgia(佐治亚大学环境、土木、农业和机械工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于条纹投影的视觉流水线,通过3D传感和实例分割网络实现硬盘拆解的精准定位与识别,提升拆解效率与鲁棒性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16582 2026-04-21 cs.CV cs.AI 62%

Camo-M3FD: A New Benchmark Dataset for Cross-Spectral Camouflaged Pedestrian Detection

Camo-M3FD:一种新的跨光谱伪装行人检测基准数据集

Henry O. Velesaca, Andrea Mero, Guillermo A. Castillo, Angel D. Sappa

机构 * ESPOL Polytechnic University(ESPOL理工大学) Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Software Engineering Department, Research Center for Information and Communication Technologies (CITIC-UGR), University of Granada(格拉纳达大学软件工程系,信息与通信技术研究中心(CITIC-UGR)) Università della Svizzera Italiana(瑞士意大利大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Camo-M3FD数据集,用于跨光谱伪装行人检测,通过高精度图像对和标准化评估框架提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16486 2026-04-21 cs.CV cs.LG 62%

Aletheia: Physics-Conditioned Localized Artifact Attention (PhyLAA-X) for End-to-End Generalizable and Robust Deepfake Video Detection

Aletheia: 基于物理条件的局部化瑕疵注意力(PhyLAA-X)用于端到端通用且鲁棒的深度伪造视频检测

Devendra Ghori

机构 * Aletheia Project(Aletheia项目)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PhyLAA-X,通过引入物理衍生特征体积提升深度伪造检测的鲁棒性,在多个数据集上均取得显著性能提升。

Comments Code: https://github.com/devghori1264/Aletheia (MIT license). Dataset notes: see Data and Code Availability section

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 62%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16022 2026-04-20 cs.AI cs.LG cs.MA 62%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24058 2026-04-20 eess.SP cs.AI cs.LG 62%

PULSE: Privileged Knowledge Transfer from Rich to Deployable Sensors for Embodied Multi-Sensory Learning

PULSE:从丰富到可部署传感器的特权知识转移以实现具身多感官学习

Zihan Zhao, Kaushik Pendiyala, Masood Mortazavi, Ning Yan

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Davis(加州大学戴维斯分校) IC Lab, Futurewei Technologies Inc.(未来科技公司IC实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 PULSE框架通过从信息丰富的教师传感器向更廉价的部署传感器转移知识,解决具身智能系统中传感器不对称问题,实现多感官学习。

Comments v2: Accepted at the CVPR 2026 Workshop on Sense of Space. 8 pages main content + references + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 62%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07717 2026-04-16 cs.RO cs.CV 62%

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12905 2026-04-15 cs.RO cs.LG 62%

Frequency-aware Decomposition Learning for Sensorless Wrench Forecasting on a Vibration-rich Hydraulic Manipulator

面向频率的分解学习用于振动丰富的液压机械臂无传感器力预测

Hyeonbeen Lee, Min-Jae Jung, Tae-Kyeong Yeu, Jong-Boo Han, Daegil Park, Jin-Gyun Kim

机构 * Department of Mechanical Engineering, Kyung Hee University(Kyung Hee 大学机械工程系) Korea Research Institute of Ships and Ocean Engineering(韩国船舶海洋研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出频率感知分解网络(FDN)用于预测振动丰富的力,通过自适应增强输入频谱和频率带先验,提升高频力预测性能,实验表明FDN在高频段优于基线方法,在低频段表现稳健,且迁移学习进一步提升性能。

Comments 11 pages, 6 figures, submitted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12803 2026-04-15 cs.CV cs.LG 62%

Generative Anonymization in Event Streams

事件流中的生成匿名化

Adam T. Müller, Mihai Kocsis, Nicolaj C. Stache

机构 * Heilbronn University of Applied Sciences(海德堡应用科学大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个事件流生成匿名化框架,通过桥接异步事件与标准空间生成模型,实现隐私保护与数据效用的平衡。

Comments Accepted to the 1st Workshop on Low-Level Vision Frontiers (LoViF) at IEEE/CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 62%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 62%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG 62%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17925 2026-04-14 cs.RO cs.CV 62%

Switch-JustDance: Benchmarking Whole Body Motion Tracking Controllers Using a Commercial Console Game

Switch-JustDance: 使用商业游戏机评估完整身体运动跟踪控制器的基准测试

Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Sehoon Ha, Tianyu Li

机构 * Georgia Tech(佐治亚理工学院) HKU(香港大学) ETH Zurich(苏黎世联邦理工学院) SCUT(华南理工大学) THU(清华大学) MIT(麻省理工学院) PNDbotics

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Switch-JustDance基准测试平台,利用Nintendo Switch上的Just Dance游戏评估机器人完整身体控制能力,验证其可靠性并对比三种先进控制器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 62%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07728 2026-04-10 cs.CV cs.GR cs.RO 62%

GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting

GEAR: 基于高斯点划法的几何-运动交替优化用于关节物体建模

Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室,中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 GEAR通过交替优化几何与运动,提升关节物体重建的精度和泛化能力,尤其在复杂多关节物体上表现优异。

Comments Accepted to CVPRF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 62%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07799 2026-04-10 cs.CV cs.RO 62%

Horticultural Temporal Fruit Monitoring via 3D Instance Segmentation and Re-Identification using Colored Point Clouds

通过彩色点云进行3D实例分割与重识别的园艺时间水果监测

Daniel Fusaro, Federico Magistri, Jens Behley, Alberto Pretto, Cyrill Stachniss

机构 * University of Padua(帕多瓦大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用彩色点云进行3D水果实例分割与重识别的方法,通过学习模型和注意力匹配网络实现动态果园中水果的准确监测。

Journal ref Computers and Electronics in Agriculture, Volume 247, Pages 111723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05681 2026-04-08 cs.AI cs.CL cs.GT cs.LG cs.MA 62%

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

LUDOBENCH:通过基于点的棋盘游戏场景评估LLM的行为决策

Ojas Jain, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 LudoBench通过12种不同决策类别中的480个手工设计点场景,评估LLM在Ludo棋盘游戏中的战略推理能力,发现模型在行为上呈现不同特征,揭示了提示敏感性作为关键漏洞。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 62%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 62%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03328 2026-04-07 cs.CV cs.RO 62%

Review and Evaluation of Point-Cloud based Leaf Surface Reconstruction Methods for Agricultural Applications

点云基叶面重建方法在农业应用中的综述与评估

Arif Ahmed, Parikshit Maini

机构 * University of Nevada, Reno(内华达大学里诺分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文综述并评估了九种叶面重建方法,通过三个公开数据集分析不同方法在精度、平滑度、噪声鲁棒性和计算成本方面的权衡,为农业机器人提供选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 62%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 62%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02639 2026-04-06 cs.CV cs.AI 62%

Cross-Vehicle 3D Geometric Consistency for Self-Supervised Surround Depth Estimation on Articulated Vehicles

跨车辆3D几何一致性用于机械臂车辆上的自监督周围深度估计

Weimin Liu, Jiyuan Qiu, Wenjun Wang, Joshua H. Meng

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Remote Sensing and Earth Observation Laboratory, University of Copenhagen(哥本哈根大学遥感与地球观测实验室) California PATH, University of California, Berkeley(加州大学伯克利分校加州PATH)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ArticuSurDepth框架,通过跨视图和跨车辆几何一致性提升机械臂车辆周围深度估计的结构一致性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00842 2026-04-02 cs.AI cs.LG cs.MA 62%

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

主动代理研究环境:模拟活跃用户以评估主动助手

Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Apple, USA(苹果公司(美国)) University of Washington(华盛顿大学) Independent Researcher, USA(独立研究员(美国))

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pare框架,通过状态机模拟用户交互,构建并评估主动代理,同时引入Pare-Bench基准测试143种不同任务,测试上下文感知、目标推理和多应用协调能力。

Comments 34 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00804 2026-04-02 cs.RO cs.CV 62%

Compact Keyframe-Optimized Multi-Agent Gaussian Splatting SLAM

紧凑化关键帧优化多智能体高斯点云SLAM

Monica M. Q. Li, Pierre-Yves Lajoie, Jialiang Liu, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院) University of Wisconsin(威斯康星大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种改进的多智能体RGB-D高斯点云SLAM框架,通过压缩步骤和中央闭环计算减少通信负载,提升地图保真度,实验证明数据传输量减少85-95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00350 2026-04-02 cs.RO cs.AI 62%

Go Big or Go Home: Simulating Mobbing Behavior with Braitenbergian Robots

要么大举进攻,要么全盘退出:基于布拉提恩格机器人模拟群体排斥行为

Elaheh Sanoubari

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文通过Webots平台模拟布拉提恩格机器人在面对光源时的群体排斥行为,探讨了叫声范围和机器人数量对群体攻击成功率的影响。

Comments This work was completed in 2019 as a final project for a graduate course at the University of Waterloo, titled: ECE 750 - Artificial Life: Embodied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI 62%

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏