arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2510.13817 2026-07-09 cs.LG cs.NI 版本更新 57%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06291 2026-07-08 cs.CV cs.HC 新提交 57%

AlayaWorld: Long-Horizon and Playable Video World Generation

AlayaWorld:长期可玩视频世界生成

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 研究旨在解决游戏世界构建难题,核心方法是提出AlayaWorld全栈开源框架,可实现开放式实时交互,统一开发流程,主要贡献是为生成世界模型研究和应用奠定实践基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 57%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 57%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05571 2026-07-08 cs.AI cs.HC 新提交 57%

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

CSTutorBench:将小型语言模型作为基于块的编程导师进行基准测试

H. Chad Lane, Bryson Kageler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对K-12环境中部署语言模型的问题,引入CSTutorBench基准评估VEX VR中语言模型作导师的表现。通过对11个模型测试发现其在深层教学行为有困难,模型家族和指令调整方法对辅导质量预测性更好,特定提示修订可提分,凸显此类基准的价值。

Journal ref SLM4ED'26: The 1st Workshop of Small Language Models for Education (SLM4ED). AIED 2026. Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05315 2026-07-08 cs.RO 新提交 57%

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance

面向应急援助的具备社会感知能力的自主过门与物资递送机器人系统

Andrew Snowdy, Ananya Trivedi, Sarvesh Prajapati, Lorena Maria Genua, Taskin Padir

机构 * Department of Electrical and Computer Engineering, Northeastern University(美国东北大学电气与计算机工程系) Northeastern University(美国东北大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对机器人辅助应急疏散场景,以行为树为核心框架实现社会感知自主过门与救援物资递送功能,经多场景实验验证系统可靠性,为应急响应机器人提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03411 2026-07-07 eess.SP cs.AI 新提交 57%

The S-ICDF Dataset: Sionna-Simulated Dynamic Interference Characterization and Direction Finding

S-ICDF数据集:基于Sionna仿真的动态干扰表征与测向数据集

Christian Wielenberg, Lucas Heublein, Jonathan Ott, Alexander Mattick, Nisha L. Raichur, Jonas Pirkl, Lukas Schelenz, Tobias Feigl, George Yammine, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫整合电路研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对干扰监测数据集稀缺问题,基于Sionna生成含102种干扰配置的大规模S-ICDF数据集,用经典测向方法与现代ML方法完成基准测试,支撑无线干扰相关算法研发。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02537 2026-07-07 eess.SP cs.LG stat.ML 新提交 57%

Physics-Informed Domain-Invariant Feature Learning with Autoencoder-Driven Gaussian Clustering for Robust Non-line-of-Sight Scenarios

面向稳健非视距场景的基于自编码器驱动高斯聚类的物理信息域不变特征学习方法

Nisha L. Raichur, Lucas Heublein, Dominik Seuß, Frank Deinzer, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所IIS)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对非视距下射频干扰波达角估计性能下降问题,提出融合物理约束的混合学习框架,结合自编码器高斯聚类提取域不变特征,提升低样本下跨场景AoA估计精度。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05201 2026-07-07 cs.LG 新提交 57%

FlatManifold: Robust Continual Learning under Severe Label Noise and Domain Shifts via Intrinsic Manifold Flattening

FlatManifold:基于内在流形扁平化的强标签噪声与域偏移场景下鲁棒持续学习方法

Rai Hisada, Kanji Tanaka

机构 * Department of Mechanical Engineering, Faculty of Engineering, University of Fukui(日本福井大学工学部机械工学科)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 针对非平稳流环境下强未校准标签噪声与非线性域偏移共存的挑战,提出FlatManifold框架,通过流形扁平化实现鲁棒持续学习,大幅优于基线方法。

Comments 5 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 57%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 57%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04310 2026-07-07 cs.RO 新提交 57%

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance

用于实时碰撞避免的GPU加速多边形符号距离函数

Taekwon Ga, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University(延世大学机械工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究在密集障碍物环境中实时碰撞避免问题,提出多边形符号距离函数(PSDF),通过张量化几何管道实现GPU加速,嵌入模型预测控制,设计分离CPU/GPU计算,实验证明其有效性。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 57%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04177 2026-07-07 cs.CL cs.LG 57%

Are LLMs Ready for Conflict Monitoring? Empirical Evidence from West Africa

大语言模型是否准备好进行冲突监测?来自西非的实证证据

Hoffmann Muki, Olukunle Owolabi

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究评估多个大语言模型在尼日利亚和喀麦隆冲突事件分类中的表现,发现普通模型有错误合法化偏差,领域适应模型有行为者选择偏差,输出对地理特定词汇框架敏感,当前模型不适用于冲突监测,呼吁针对性改进。

Journal ref The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026), June 25-28, 2026, Montreal, QC, Canada. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 57%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 机器人数据与评测 :robotic(abstract_cn);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 57%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14891 2026-07-07 cs.CV 版本更新 57%

GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects

高斯艺术:关节物体几何与运动的统一建模

Licheng Shen, Saining Zhang, Honghan Li, Peilin Yang, Zihao Huang, Zongzheng Zhang, Hao Zhao

机构 * BAAI(百度人工智能研究院) AIR, THU(清华大学人工智能研究院) NTU(国立台湾大学) BIT(北京理工大学) HUST(华中科技大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 研究关节物体重建,此前方法解耦几何与运动,本文用关节3D高斯联合建模,提升运动分解鲁棒性,支持多达20个部件的物体,还提出新基准测试,实验表明该方法在多任务中精度更优。

Comments 3DV 2026 Project Page: https://sainingzhang.github.io/project/gaussianart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 57%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 57%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01189 2026-07-03 cs.RO cs.SY eess.SY 版本更新 57%

SPOT: Spatio-Temporal Obstacle-free Trajectory Planning for UAVs in Unknown Dynamic Environments

SPOT:未知动态环境中无人机的时空无碰撞轨迹规划

Astik Srivastava, Thomas J Chackenkulam, Bitla Bhanu Teja, Antony Thomas, Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) IIT-BHU, India(IIT-BHU,印度)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出一种基于4维时空规划器、视觉安全飞行走廊生成和轨迹优化的无地图反应式运动规划方法,实现无人机在未知动态环境中的避障,并通过备份规划模块应对死锁。

Comments Accepted for publication at ICRA 2026. Code available at (https://astik-2002.github.io/ICRA-2026-SPOT/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01139 2026-07-02 cs.CV 新提交 57%

SD-RouteFusion: Ego-Trajectory Prediction with SD-Map Route Conditioning

SD-RouteFusion:基于SD地图路线条件的自车轨迹预测

Sviatoslav Voloshyn, Bruno K. W. Martens, Wangxin Liu, Jakob Vinkås, Junsheng Fu

机构 * Zenseact

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出SD-RouteFusion,融合前视相机、车辆动力学和SD地图导航路线进行自车轨迹预测,无需HD地图,通过双假设设计和门控分类器实现鲁棒融合,在8秒预测时ADE降低16.9%。

Comments 9 pages, 4 figures, 29th International Conference on Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00569 2026-07-02 cs.RO 新提交 57%

[Preprint] Dynamic Modeling, Gait Synthesis, and Control of a Novel Subsurface Bore Propagator

[预印本] 一种新型地下钻孔推进器的动力学建模、步态合成与控制

Lina van Brügge, Shruti Kotpalliwar, Anton Koval, Akshit Saradagi, George Nikolakopoulos

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对模块化地下机器人,提出基于蚯蚓锚定推进和隧道掘进机挖掘的动力学模型与步态合成控制策略,通过Unity仿真和实验验证了3个步态周期内30毫米的土壤推进。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 57%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00399 2026-07-02 cs.CV 新提交 57%

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving

DriveVer: 自动驾驶的轻量级轨迹评估器作为测试时验证器

Chong He, Yuechen Luo, Fang Li, Shaoqing Xu, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出DriveVer,一种轻量级即插即用的测试时验证器,通过双头架构融合候选轨迹与多视图视觉特征,预测安全置信度和几何修正向量,在不增加训练成本下提升规划模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27962 2026-07-02 cs.RO 新提交 57%

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao, Chenfeng Gu, Zhen Sun, Haoran Li, Wei Lu, Yucheng Guo, Shuai Di, Xiaodong Bai, Haoran Sun, Jing Long, Jiaxuan Gao, Hui Zhang, Peng Hao, Lu Lu

机构 * AI Infra Team at JDT(京东科技AI基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 57%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏