arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-30 至 2025-12-30 共收录 15 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 15 篇

2507.19854 2025-12-30 cs.RO cs.HC 85%

Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models

思考、行动、学习:一种利用闭环大语言模型的自主机器人代理框架

Anjali R. Menon, Rohit K. Sharma, Priya Singh, Chengyu Wang, Aurora M. Ferreira, Mateja Novak

机构 * Dept. of Electronics & Comm. Eng.(电子与通信工程系) Government Engineering College(政府工程学院) Dept. of Electrical & Electronics Eng.(电气与电子工程系) Poornima College of Engineering(波奥尼玛工程学院) Dept. of Electronics & Telecom. Eng.(电子与电信工程系) Shivaji University College of Eng.(希瓦吉大学工程学院) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Dept. of Electrical Eng.(电气工程系) Instituto Federal do Maranhão(马里兰联邦学院) Dept. of Electrical & Computer Eng.(电气与计算机工程系) Technical University of Košice(科希丘夫技术大学)

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract);embodied agent(abstract);分类 cs.RO

AI总结 本文提出T-A-L框架,通过闭环大语言模型实现机器人自主学习与策略优化,显著提升复杂任务的成功率和泛化能力。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21710 2025-12-30 cs.CV 70%

RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention

RAPTOR: 用于高效视频注意的实时高分辨率无人机视频预测

Zhan Chen, Zile Guo, Enze Zhu, Peirong Zhang, Xiaoxuan Liu, Lei Wang, Yidan Zhang

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 RAPTOR通过高效视频注意机制实现了实时高分辨率视频预测,首次在Jetson AGX Orin上达到30 FPS以上,提升了无人机任务成功率18%。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22263 2025-12-30 cs.CV cs.LG cs.RO 67%

Evaluating an Adaptive Multispectral Turret System for Autonomous Tracking Across Variable Illumination Conditions

评估一种自适应多光谱 turret 系统用于自主跟踪在变化的照明条件下

Aahan Sachdeva, Dhanvinkumar Ganeshkumar, James E. Gallagher, Tyler Treat, Edward J. Oughton

机构 * Department of Geography & Geoinformation Science, George Mason University(地理与地理信息科学系,乔治·马歇尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出了一种自适应多光谱turret系统,通过融合RGB和LWIR视频流提升自主机器人在不同光照条件下的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01516 2025-12-30 cs.LG cs.AI cs.CL 62%

Quantifying True Robustness: Synonymity-Weighted Similarity for Trustworthy XAI Evaluation

量化真实鲁棒性:基于同义词加权的相似性用于可信XAI评估

Christopher Burger

机构 * The University of Mississippi(密苏里大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于同义词加权的相似性方法,用于更准确评估XAI系统的鲁棒性,防止攻击成功率的高估。

Comments 10 pages, 2 figures, 6 tables. Changes to title, abstract and minor edits to the content as a result of acceptance to the 59th Hawaii International Conference on System Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02903 2025-12-30 cs.CV cs.RO 62%

LidarDM: Generative LiDAR Simulation in a Generated World

LidarDM: 生成世界中的生成激光雷达模拟

Vlas Zyrianov, Henry Che, Zhijian Liu, Shenlong Wang

机构 * UIUC(伊利诺伊大学香槟分校) NVIDIA(英伟达)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 LidarDM通过集成4D世界生成框架,实现了基于驾驶场景的4D激光雷达点云生成,提升自动驾驶模拟的逼真度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22774 2025-12-30 cs.LG cs.CV 62%

Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization

薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架

Truong Son Nguyen

机构 * Arizona State University(亚利桑那州立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23431 2025-12-30 cs.RO cs.MA 57%

Optimal Scalability-Aware Allocation of Swarm Robots: From Linear to Retrograde Performance via Marginal Gains

蜂群机器人最优可扩展性感知分配:通过边际收益从线性到反向性能

Simay Atasoy Bingöl, Tobias Töpfer, Sven Kosub, Heiko Hamann, Andreagiovanni Reina

机构 * Department of Computer and Information Science, Universität Konstanz, Germany(康斯坦茨大学计算机与信息科学系) Centre for the Advanced Study of Collective Behaviour (CASCB), Universität Konstanz, Germany(康斯坦茨大学集体行为高级研究所以) Department of Collective Behaviour, Max Planck Institute of Animal Behavior, Konstanz, Germany(动物行为Max Planck研究所集体行为系)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO

AI总结 本文提出了一种基于边际收益的高效算法,用于优化蜂群机器人在不同可扩展性任务中的分配,以实现最大集体性能。

Comments 14 pages, 11 figures, Accepted for publication in IEEE Transactions on Systems, Man, and Cybernetics: Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 57%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22819 2025-12-30 cs.CV 57%

Depth Anything in $360^\circ$: Towards Scale Invariance in the Wild

360度深度估计:迈向野外的尺度不变性

Hualie Jiang, Ziyang Song, Zhiqiang Lou, Rui Xu, Minglang Tan

机构 * Insta360 Research(Insta360研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 DA360通过学习ViT主干的位移参数,实现全景深度估计的尺度不变性,显著提升室内和户外深度估计性能。

Comments https://insta360-research-team.github.io/DA360

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05526 2025-12-30 cs.CV 57%

When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework

当深度伪造检测遇见图神经网络:一种统一且轻量级的学习框架

Haoyu Liu, Chaoyu Gong, Mengke He, Jiate Li, Kai Han, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SSTGNN,一种统一且轻量级的深度伪造检测框架,通过图神经网络联合处理空间、时间及频谱信息,实现高效且准确的伪造检测。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05822 2025-12-30 cs.CV 57%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 57%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 57%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07348 2025-12-30 cs.LG 57%

Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts

在少量训练上下文中进行零样本上下文泛化于强化学习

James Chapman, Kedar Karhadkar, Guido Montufar

机构 * Department of Mathematics University of California, Los Angeles(数学系加州大学洛杉矶分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出上下文增强的贝尔曼方程(CEBE)和上下文样本增强(CSE)方法,以提升在少量训练上下文中强化学习的泛化能力。

Comments 10 pages, 8 figures, 3 tables, publushed at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22429 2025-12-30 astro-ph.EP 50%

Chain Reactions in Space: Analyzing the Impact of Satellite Collisions and Debris Accumulation

太空中的连锁反应:分析卫星碰撞和碎片积累的影响

Mark Ballard, Guanqun Song, Ting Zhu

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文研究了卫星碰撞和碎片积累的风险,发现远地点和轨道周期与风险相关性最高,提出通过AI导航和抗辐射材料提升高轨道资产的韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏