arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 497 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 497 篇

2607.12480 2026-07-15 cs.AI 新提交 57%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12370 2026-07-15 cs.RO 新提交 57%

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance

StratMamba:用于基于路径高效的激光雷达避障的策略性和反应性流划分

Hung-Chieh Wu, Xiaopan Zhang, Kasra Sinaei, Ryan Abnavi, Kasun Weerakoon, Christopher Bradley, Seyed Fakoorian, Jiachen Li, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AlphaZ, Inc.(阿尔法兹公司) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究针对复杂环境中机器人导航问题,提出StratMamba双流时间建模架构,结合快慢衰减内存架构处理激光雷达数据。经多场景评估及与其他基线对比,其在时间推理效率、导航速度和路径最优性方面表现出色,在现实中性能更稳健。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 6 figures. Video: https://www.youtube.com/watch?v=Z0FfO_AVaSw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交 57%

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 57%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 57%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10999 2026-07-14 cs.RO 新提交 57%

Wearing A Coat: Dual-Arm Robot-Assisted Dressing with Differentiable Clothing Simulation

穿着外套:基于可微服装模拟的双臂机器人辅助穿衣

Yiming Liu, Lijun Han, Hesheng Wang

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对机器人辅助穿衣中衣物与人体四肢复杂接触交互的问题,提出集成实时可微服装模拟的控制算法,经模拟和实验验证,该算法能解决接触约束下服装状态问题,实现多阶段控制策略,证明了其可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10842 2026-07-14 cs.RO cs.SY eess.SY 新提交 57%

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions

D-SafeMPC:基于离散时间控制障碍函数的扩散驱动安全模型预测控制

Erdi Sayar, Ersin Daş, Joel W. Burdick, Alois Knoll, Erdal Kayacan

机构 * Paderborn University(帕德博恩大学) Illinois Institute of Technology(伊利诺伊理工学院) California Institute of Technology(加州理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对扩散模型用于机器人规划时无法保证安全和动态约束的问题,提出D-SafeMPC方法,通过控制障碍函数等引导扩散过程,结合迭代投影方案,经实验验证该方法能提升安全性、任务成功率和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10437 2026-07-14 cs.RO 新提交 57%

Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household Environments

未知多房间家庭环境中多目标搜索的交错部分可观测马尔可夫决策过程规划

Ruochu Yang, Ziyi Xia, Huibo Zhang, Yatong Han, Yiming Zhao, Yingke Li, Fumin Zhang, Yorai Wardi, Mengxue Hou

机构 * Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学) Ising AI(伊辛人工智能公司) MIT(麻省理工学院) Notre Dame University(圣母大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究未知多房间家庭环境下多目标搜索问题,提出Inter-POMDP算法,通过高级POUCT规划器与低级运动规划器相互作用,平衡规划质量与效率,相比基线方法减少碰撞、导航步数及检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 57%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09692 2026-07-14 cs.LG cs.CL 新提交 57%

Reference-Based Distillation Detection in LLMs

大语言模型中基于参考的蒸馏检测

Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) University of Southern California(南加利福尼亚大学) OpenAI

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 研究旨在检测大语言模型是否经蒸馏而来,提出基于参考的成员推理蒸馏检测方法,通过比较模型与不同候选教师输出的优先对齐程度识别教师及蒸馏证据,能处理未知管道,扩展到开放世界设置,应用于当代模型获潜在蒸馏关系新证据。

Comments 27 pages (14 main), 21 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交 57%

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09650 2026-07-13 cs.CV 新提交 57%

Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks

用柯尔莫哥洛夫 - 阿诺德网络重新审视欧拉角回归

Yangting Sun, Zijun Cui, Yufei Zhang

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 研究欧拉角回归难题,提出结合范围感知欧拉建模与柯尔莫哥洛夫 - 阿诺德网络的新框架,经理论分析和实验验证,该框架在控制旋转回归等多方面能提升精度、收敛性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09519 2026-07-13 cs.RO 新提交 57%

DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting

DemoBridge:用于单视图人类演示重定向的循环内仿真工具包

Zehao Wang, Fabien Despinoy, Sergey Zakharov, Tinne Tuytelaars, Rahaf Aljundi

机构 * KU Leuven(库勒万大学) Toyota Motor Europe(丰田欧洲公司) Toyota Research Institute(丰田研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 DemoBridge工具包可将单视图人类手部演示转化为机器人手臂轨迹,核心是碰撞感知规划器,能综合考虑多种因素优化轨迹,经物理模拟器验证,还可用于策略学习,在实际任务和基准测试中评估了其性能。

Comments RSS 2026 RoboData Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09136 2026-07-13 cs.RO 新提交 57%

Residual Physics-Informed Neural Networks for High-Fidelity BLDC Motor Modeling

用于高保真无刷直流电机建模的残差物理信息神经网络

Haitham El-Hussieny

机构 * Department of Mechatronics and Robotics Engineering(机电工程与机器人工程系) Egypt-Japan University of Science and Technology (E-JUST)(埃及-日本科学技术大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对无刷直流电机精确动力学建模问题,提出基于ResNet主干的PINN,以仿真时间等为输入预测电机状态变量,满足相关常微分方程,用课程调度策略防过早收敛,训练快且推理延迟低,适用于实时应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 57%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08674 2026-07-10 cs.CV 新提交 57%

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection

变换能揭示真相吗?用于广义人工智能生成图像检测的生成残差学习

Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik

机构 * University of Michigan Flint(密歇根大学弗林特分校) Korea Aerospace University(韩国航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对生成式AI带来的威胁及AIGI检测难题,提出GenRes框架,通过神经张量网络建模关系特征增强泛化;引入GenRes++,用注意力机制聚合多变换样本特征;利用PE-Core提取特征,实验证明GenRes++性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18664 2026-07-09 cs.SD cs.AI 新提交 57%

NeuralMUSIC: A Hybrid Neural-Subspace Framework for Robot Sound Source Localization

NeuralMUSIC: 一种用于机器人声源定位的混合神经-子空间框架

Yizhuo Yang, Junqiao Fan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 提出NeuralMUSIC混合框架,结合神经网络估计空间协方差矩阵与经典MUSIC子空间方法,通过频率注意力融合和自监督学习提升机器人声源定位的鲁棒性和跨域泛化能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06291 2026-07-08 cs.CV cs.HC 新提交 57%

AlayaWorld: Long-Horizon and Playable Video World Generation

AlayaWorld:长期可玩视频世界生成

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 研究旨在解决游戏世界构建难题,核心方法是提出AlayaWorld全栈开源框架,可实现开放式实时交互,统一开发流程,主要贡献是为生成世界模型研究和应用奠定实践基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 57%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 57%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05571 2026-07-08 cs.AI cs.HC 新提交 57%

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

CSTutorBench:将小型语言模型作为基于块的编程导师进行基准测试

H. Chad Lane, Bryson Kageler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对K-12环境中部署语言模型的问题,引入CSTutorBench基准评估VEX VR中语言模型作导师的表现。通过对11个模型测试发现其在深层教学行为有困难,模型家族和指令调整方法对辅导质量预测性更好,特定提示修订可提分,凸显此类基准的价值。

Journal ref SLM4ED'26: The 1st Workshop of Small Language Models for Education (SLM4ED). AIED 2026. Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05315 2026-07-08 cs.RO 新提交 57%

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance

面向应急援助的具备社会感知能力的自主过门与物资递送机器人系统

Andrew Snowdy, Ananya Trivedi, Sarvesh Prajapati, Lorena Maria Genua, Taskin Padir

机构 * Department of Electrical and Computer Engineering, Northeastern University(美国东北大学电气与计算机工程系) Northeastern University(美国东北大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对机器人辅助应急疏散场景,以行为树为核心框架实现社会感知自主过门与救援物资递送功能,经多场景实验验证系统可靠性,为应急响应机器人提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03411 2026-07-07 eess.SP cs.AI 新提交 57%

The S-ICDF Dataset: Sionna-Simulated Dynamic Interference Characterization and Direction Finding

S-ICDF数据集:基于Sionna仿真的动态干扰表征与测向数据集

Christian Wielenberg, Lucas Heublein, Jonathan Ott, Alexander Mattick, Nisha L. Raichur, Jonas Pirkl, Lukas Schelenz, Tobias Feigl, George Yammine, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫整合电路研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对干扰监测数据集稀缺问题,基于Sionna生成含102种干扰配置的大规模S-ICDF数据集,用经典测向方法与现代ML方法完成基准测试,支撑无线干扰相关算法研发。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02537 2026-07-07 eess.SP cs.LG stat.ML 新提交 57%

Physics-Informed Domain-Invariant Feature Learning with Autoencoder-Driven Gaussian Clustering for Robust Non-line-of-Sight Scenarios

面向稳健非视距场景的基于自编码器驱动高斯聚类的物理信息域不变特征学习方法

Nisha L. Raichur, Lucas Heublein, Dominik Seuß, Frank Deinzer, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所IIS)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对非视距下射频干扰波达角估计性能下降问题,提出融合物理约束的混合学习框架,结合自编码器高斯聚类提取域不变特征,提升低样本下跨场景AoA估计精度。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05201 2026-07-07 cs.LG 新提交 57%

FlatManifold: Robust Continual Learning under Severe Label Noise and Domain Shifts via Intrinsic Manifold Flattening

FlatManifold:基于内在流形扁平化的强标签噪声与域偏移场景下鲁棒持续学习方法

Rai Hisada, Kanji Tanaka

机构 * Department of Mechanical Engineering, Faculty of Engineering, University of Fukui(日本福井大学工学部机械工学科)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 针对非平稳流环境下强未校准标签噪声与非线性域偏移共存的挑战,提出FlatManifold框架,通过流形扁平化实现鲁棒持续学习,大幅优于基线方法。

Comments 5 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 57%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 57%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04310 2026-07-07 cs.RO 新提交 57%

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance

用于实时碰撞避免的GPU加速多边形符号距离函数

Taekwon Ga, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University(延世大学机械工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究在密集障碍物环境中实时碰撞避免问题,提出多边形符号距离函数(PSDF),通过张量化几何管道实现GPU加速,嵌入模型预测控制,设计分离CPU/GPU计算,实验证明其有效性。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏