arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2821 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2821 篇

2603.10407 2026-07-14 cs.RO 版本更新 50%

Rethinking Gaussian Trajectory Predictors: Calibrated Uncertainty for Safe Planning

重新思考高斯轨迹预测器:为安全规划校准不确定性

Fatemeh Cheraghi Pouria, Mahsa Golchoubian, Katherine Driggs-Campbell

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出了一种新的损失函数,通过核密度估计校准高斯轨迹预测器的不确定性,以提高安全规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 50%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06700 2026-07-09 cs.RO 新提交 50%

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM

CILC:用于多智能体协作SLAM的加密安全的智能体间闭环候选检测

Andrew Fishberg, Yixuan Jia, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究多智能体协作SLAM中智能体间闭环候选检测问题,提出CILC系统,利用安全多方计算仅对隐私敏感且计算量轻的GD相似性比较步骤进行加密处理,在模拟和硬件实验中验证其能保持实时性、通信可行并减轻信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12144 2026-07-03 cs.MA 版本更新 50%

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理

Lucas Stoffl, Benedikt Wiestler, Johannes C. Paetzold

专题命中 多模态Agent :multimodal(abstract)

AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。

Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 50%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00031 2026-07-02 cs.RO 新提交 50%

Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning

通过效应预测联合发现物体与动作符号以进行机器人操作规划

Burcu Kilic, Berke Kartal, Fatih Dogangun, Erhan Oztop, Emre Ugur

机构 * Bogazici University(博阿齐奇大学) Ozyegin University(厄兹耶金大学) Osaka University(大阪大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出一种通过二元瓶颈层联合发现操作原语和物体类别的方法,利用预测多模态交互效应进行离散规划,在桌面重定位和堆叠任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31142 2026-07-01 math.OC 新提交 50%

Augmenting airline networks using airside-to-airside buses to strengthen system resilience under disruptions

利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性

Micah M. Borrero, Max Z. Li

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 50%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23822 2026-06-30 cs.SE 50%

KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant

KISS Sorcar:一个简单通用且软件工程友好的AI助手

Koushik Sen

专题命中 多模态Agent :multimodal(abstract)

AI总结 KISS Sorcar基于KISS Agent Framework构建,通过五层代理架构解决传统AI助手的缺陷,实现高质量代码生成与多任务处理,测试显示其在Terminal Bench 2.0上的通过率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04949 2026-06-26 cs.RO 版本更新 50%

Monte Carlo Tree Search with Tensor Factorization for Optimization Problems in Robotics

基于张量分解的蒙特卡洛树搜索用于机器人优化问题

Teng Xue, Yan Zhang, Amirreza Razmjoo, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出TTTS算法,利用张量分解压缩决策树分支间的隐式相关性,以线性复杂度降低MCTS的计算和存储开销,在逆运动学、运动规划、多阶段操作等任务中实现高效全局优化。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 50%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21897 2026-06-23 cs.CE 新提交 50%

Simulating Public Transit Fare Policies in NYC: An Efficient, Socioeconomic-Aware Framework

模拟纽约市公共交通票价政策:一个高效、社会经济感知的框架

Parker Wischhover, Hossein Amiri, Kiara Ha, Jooyoung Yoo, Lina Li, Andreas Züfle, Joon-Seok Kim

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一个可扩展的数据驱动仿真框架,集成合成人口、智能体仿真、多模式出行时间估计和票价敏感模式选择模型,评估纽约市多种票价政策对客流量、收入与公平性的影响。

Comments 10 pages, 10 figures, submitted to SIGSPATIAL'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20755 2026-06-23 cs.RO 新提交 50%

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

机构 * University of Trento(特伦托大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20592 2026-06-23 cs.NI cs.LG 新提交 50%

Empowering Embodied AI in 6G Networks: Architecture, Enablers, and Open Challenges

赋能6G网络中的具身人工智能:架构、使能技术与开放挑战

Junaid Sajid, Sheikh Salman Hassan, Wenshuai Liu, Yan Kyaw Tun, Yaru Fu, Nguyen H. Tran, Zhu Han, Cedomir Stefanovic, Tharmalingam Ratnarajah, Muhammad Mahtab Alam

机构 * Thomas Johann Seebeck Department of Electronics(托马斯·约翰·塞贝克电子系) Tallinn University of Technology(塔林理工大学) Institute for Imaging, Data and Communication (IDCoM)(成像、数据与通信研究所) The University of Edinburgh(爱丁堡大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) School of Science and Technology(科学与技术学院) Hong Kong Metropolitan University(香港 metropolitan 大学) Department of Electronic Systems(电子系统系) Aalborg University(奥胡斯大学) School of Computer Science(计算机科学学院) University of Sydney(悉尼大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Houston(休斯顿大学) San Diego State University(圣地亚哥州立大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出面向6G的具身AI原生架构,通过感知-通信-动作闭环统一设计通信、感知、计算与控制,实现任务驱动的物理智能。

Comments This work has been submitted to the IEEE Communication Magazine for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19897 2026-06-19 cs.RO 新提交 50%

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms

一对二执行:一种面向单臂智能体动作扩展至双臂的新框架

Youbin Yao, Nieqin Cao, Mingyan Li, Yan Ding, Fuqiang Gu, Chao Chen

机构 * Chongqing University(重庆大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Lumos Robotics

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出ExS2D层次化动作扩展框架,利用单臂监督实现双臂操作,通过时间优先关系提取、子任务引导动作映射和碰撞避免协调规划,在仿真中减少54.4%执行步骤并保持成功率。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19267 2026-06-18 cs.RO cs.SY eess.SY 新提交 50%

A Mixed-Reality Testbed for Autonomous Vehicles

自动驾驶汽车的混合现实测试平台

H. M. Sabbir Ahmad, Ehsan Sabouni, Emrullah Celik, Zean Wan, Damola Ajeyemi, Christos G. Cassandras, Wenchao Li

机构 * Division of Systems Engineering(系统工程系) Boston University(波士顿大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种混合现实硬件在环测试平台,集成物理移动机器人与高保真仿真环境,用于验证感知、规划和控制算法,并支持多智能体系统研究。

Comments 9 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17937 2026-06-17 cs.RO 新提交 50%

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

ThinkingVLA:用于机器人操作的交叉视觉与语言推理

Tianyi Lu, Hui Zhang, Zijie Diao, Junke Wang, Shengqi Xu, Xingyao Lin, Guojin Zhong, Ziyi Ye, Peng Wang, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15898 2026-06-16 cs.RO 新提交 50%

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Advanced Micro Devices, Inc.(超威半导体公司) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。

Comments 9 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12542 2026-06-12 astro-ph.IM astro-ph.EP cs.LG 版本更新 50%

Earth Science Foundation Models: From Perception to Reasoning and Discovery

地球科学基础模型:从感知到推理与发现

Xiangyu Zhao, Bo Liu, Yuehan Zhang, Zelin Song, Wanghan Xu, Feng Liu, Fengxiang Wang, Ben Fei, Fenghua Ling, Wangxu Wei, Wenlong Zhang, Xiao-Ming Wu

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了地球科学基础模型,探讨了其从感知到多模态推理及科学发现的能力演进,并总结了其在大气、水圈、岩石圈等领域的广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11618 2026-06-11 cs.IT math.IT 新提交 50%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18343 2026-06-10 physics.optics 版本更新 50%

Super-Resolution Structured-Illumination X-Ray Microscopy based on Fourier Decomposition

基于傅里叶分解的超分辨结构照明X射线显微镜

Stefan Schwaiger, Lennart Forster, Martin Dierolf, Franz Pfeiffer, Benedikt Günther

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种超分辨X射线显微镜方法,通过结构照明编码高频信息,利用傅里叶分解解码,实现2.2倍分辨率提升,并扩展至显微断层成像,同时获取相位衬度和暗场图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08470 2026-06-09 cs.RO 新提交 50%

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving

LUNA-AD: 面向自动驾驶的轻量级不确定性感知语言模型与终身学习

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出LUNA-AD,一种结合三系统架构、多智能体分析、双头轻量模型和反思驱动终身学习的轻量级不确定性感知语言模型,在nuPlan上实现高成功率与低推理延迟。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 50%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05960 2026-06-05 cs.RO 50%

Towards a Data Flywheel for Embodied Intelligence in Logistics

面向物流具身智能的数据飞轮

Anlan Yu, Zaishu Chen, Zhiqing Hong, Daqing Zhang

机构 * Peking University(北京大学) JD Logistics(京东物流) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种数据驱动的物流具身智能框架,通过构建数据飞轮将日常操作转化为可复用数据资产,利用世界模型生成长尾包裹操作的可靠监督,并整合多模态数据实现策略持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04799 2026-06-04 cs.SE 50%

UModel: An Agent-Ready Observability Data Modeling Method at Scale

UModel: 一种面向智能体的可观测性数据规模化建模方法

Changhua Pei, Zheyuan Li, Zexin Wang, Hang Cui, Xiaohui Nie, Qi Zhou, Fang Situ, Cheng Zhang, Xin Zhang, Xidao Wen, Gaogang Xie, Jingjing Li, Dan Pei

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对现有可观测性框架数据孤岛、模式不兼容及语义元数据不足导致根因分析困难的问题,提出UModel统一本体框架,通过对象中心化建模和语义图连接异构数据,并引入U-SPL管道查询接口,使智能体自主探索系统拓扑并关联多模态数据,在AIOps 2025挑战赛数据集上根因定位精度提升8%,已在阿里云部署超一年,服务数万用户,支撑每秒数百万操作和亚秒级查询延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 50%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.03641 2026-06-04 math.OC cs.SY eess.SY 50%

Role of Iso-connectivity Topologies in Multi-agent Interactions

等连通拓扑在多智能体交互中的作用

Rajdeep Dutta, Daniel Pack

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了等连通拓扑在多智能体系统动态中的作用,通过分析不同拓扑结构对信息共享能力的影响,提出了解决多智能体图结构确定问题的方法。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.04634 2026-06-04 cs.RO cs.SY eess.SY 50%

Motion Planning for Global Localization in Non-Gaussian Belief Spaces

非高斯信念空间中的全局定位运动规划

Saurav Agarwal, Amirhossein Tamjidi, Suman Chakravorty

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种在不确定环境下进行运动规划的方法,用于处理模糊数据关联导致的多模态假设。通过递推方法逐步消除多模态信念,实现有限时间内精确定位。

Comments extends previous submission with updated figures, analysis and justifications. arXiv admin note: text overlap with arXiv:1506.01780

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03392 2026-06-03 cs.RO 50%

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

机构 * Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏