arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2821 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2821 篇

2608.09771 2026-08-11 cs.RO 新提交 50%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 50%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09098 2026-08-11 cs.RO 新提交 50%

UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes

UnsDrive:面向非结构化场景的鲁棒端到端自动驾驶

Nanxin Zeng, Ruiqi Song, Xiangyu Guo, Baiyong Ding, Yunfeng Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous Inc.(文远知行公司)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对非结构化采矿环境自动驾驶泛化差的问题,提出UnsDrive规划器,结合未知感知占用表示与流匹配规划器,引入专用损失和评分器,辅以MineLoop模拟器验证,性能优于基线。

Comments 9 pages, 4 figures, conference

Journal ref the 34th ACM International Conference on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07002 2026-08-10 cs.RO 新提交 50%

A Haptic Robot Finger Designed for Guqin Instrument Playing

用于古琴演奏的触觉机器人手指

Tianwei Zhang, Hanming Yan, Yang Yang. Ziya Wang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) The Chinese University of Hong Kong - Shenzhen(香港中文大学(深圳)) School of Physics and Optoelectronic Engineering, Shenzhen University(深圳大学物理与光电工程学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究设计了一款模仿人类手指的高精度触觉传感机器人指尖,以古琴为验证场景,开展了古琴弦接触相关任务的验证,将触觉传感与机器人技术结合,助力世界遗产保护与文化传播。

Comments Accepted by IEEE Transactions on Haptics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03556 2026-08-05 cs.RO 新提交 50%

Human Centric Embodied Intelligence for Soft Wearable Robotics

面向软质可穿戴机器人的以人为中心的具身智能

Rainier Natividad, Raye Chen-Hua Yeow

专题命中 多模态Agent :multimodal(abstract)

AI总结 本综述提出以人为中心的具身智能(HCEI)概念,引入感知-认知-执行-增强(PCAA)框架,整合多领域进展以指导软质可穿戴机器人向个性化、可预测的以人为中心方向发展。

Comments Review article; 48 pages, 6 figures, 4 tables, and 2 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02959 2026-08-05 cs.MA 新提交 50%

SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget

SABRE:预算约束下选择分布外检测器的多智能体方法

Mary Wisell, Salimeh Sekeh

专题命中 多模态Agent :multimodal(abstract)

AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新 50%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 多模态Agent :multi-modal(abstract)

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29113 2026-08-03 cs.HC 新提交 50%

Designing a digital word-learning intervention with neurodiverse children: Experiences and ideas from children with developmental language disorder

面向神经多样性儿童的数字词汇学习干预方案设计:发育性语言障碍儿童的经验与思路

Rafiah Ansari, Rina R. Wehbe, Lizbeth Olivia Escobedo

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究针对发育性语言障碍儿童,采用定制化参与式设计方法,设计词汇学习干预方案,明确了多模态等关键设计要求,为相关干预开发提供了宝贵见解。

Comments 56 pages, 7 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07792 2026-08-03 quant-ph 50%

Wigner and friends, a map is not the territory! Contextuality in multi-agent paradoxes

Sidiney B. Montanhano

专题命中 多模态Agent :multi-modal(abstract)

Comments Minor corrections. 12 pages, 2 figures, 3 tables; 20 pages with appendix and references

Journal ref Foundations of Science, 30(4), 971-1002 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28399 2026-07-31 cs.LG 新提交 50%

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees

为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试

Zihan Dong, Rui Qian, Qishi Zhan, Dongshen Peng, Kaixin Li, Yu Li

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 50%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18060 2026-07-29 cs.RO 版本更新 50%

RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning

RoboHarness:用于长期规划的异构机器人策略的内存驱动编排

Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of British Columbia(英属哥伦比亚大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Labs(2012实验室)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 针对长期机器人任务需多种能力、异构策略编排难的问题,提出RoboHarness框架,通过多模态执行内存等表征策略能力边界,经内存桥接稳定策略交接,实验验证其在长期规划和分布外鲁棒性上有显著提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23176 2026-07-28 eess.SY cs.SY 新提交 50%

An Adjoint-Based Differentiable Physics Framework for Online Parameter Inversion in Closed-Brayton Gas-Cooled Reactor Digital Twins

用于闭式布雷顿气冷反应堆数字孪生体在线参数反演的基于伴随的可微物理框架

Chengyuan Li, Shanfang Huang, Jian Deng

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究先进反应堆数字孪生体在线参数反演问题,提出基于伴随的可微物理框架,通过隐式微分代数模型传播反向模式自动微分,驱动AD - 海森增量4D - Var估计器,在多工况下与多种基线对比,展现出不同优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 50%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 多模态Agent :multimodal(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20912 2026-07-24 cs.RO 新提交 50%

URF: A Unified Robot Control-Policy Framework for Stable Contact Aware Manipulation

URF:用于稳定接触感知操纵的统一机器人控制策略框架

Jiyou Shin, Youngjin Seo, Jaeseog Won, Sungwon Seo, Hyunjun Kim, Seokmin Yoon, Tuan Luong, Hyungpil Moon

机构 * Faculty of Mechanical Engineering, Sungkyunkwan University(成均馆大学机械工程学院) Faculty of Intelligent Robotics, Sungkyunkwan University(成均馆大学智能机器人学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对基于学习的操纵策略中动作预测与执行分离在刚性接触时的问题,提出URF统一框架,结合多模态观察预测虚拟目标等,利用接触力构建标签监督控制器模式预测,在相关任务中提升成功率并减少失败模式。

Comments 8 pages, 5 figures, 2 tables. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 50%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17049 2026-07-22 cs.SE cs.RO 版本更新 50%

Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots

评估具有视觉语言动作能力的机器人的不确定性和质量

Pablo Valle, Chengjie Lu, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17527 2026-07-21 cs.HC 新提交 50%

Sidekick: Designing Communication for Effective Multitasking with Computer Use Agents

Sidekick:与计算机使用代理进行有效多任务通信的设计

Ruei-Che Chang, Wenqian Xu, Dingzeyu Li, Bryan Wang, Anhong Guo

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对计算机使用代理文本反馈问题,开发Sidekick原型系统,在不同交互阶段用多模态反馈传达其状态,经30人参与的研究验证其能显著提升多任务性能,有效支持进度感知等,还展示了应用前景及对人机协作的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09540 2026-07-21 cs.IR 版本更新 50%

From Raw IDs to Semantic Planning: How Recommender Systems Utilize Information at Scale

从原始ID到语义规划:推荐系统如何大规模利用信息

Changhong Jin, Shiqiu Yang, Roger Zhe Li, Yingjie Niu, Aghiles Salah, Mete Sertkan, Zheng Ju, Xingsheng Guo, Huifeng Guo, Ruihai Dong, Barry Smyth

专题命中 多模态Agent :multimodal(abstract)

AI总结 探讨推荐系统如何利用信息,分析原始ID主导早期发展及语义信息封装于ID的原因,引入语义规划为未来方向,指出转变需在模型设计、评估及协调多方目标等方面做出改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 50%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14655 2026-07-17 cs.HC 新提交 50%

Dendrite: A Real-Time Python Application for Online Brain-Computer Interface Research and Development

Dendrite:用于在线脑机接口研究与开发的实时Python应用程序

Niko Kroflic, Jan Babič

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究旨在开发在线脑机接口软件,核心方法是用Python编写Dendrite应用程序,它整合信号采集、解码器训练与实时推理,能同时记录多信号流并并发处理,可重现且开源,为在线BCI范式开发评估提供了系统。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14870 2026-07-17 physics.med-ph 新提交 50%

One-for-All Adaptive Radiotherapy Planning Agent: A Foundation Framework for Daily CBCT-guided Radiotherapy

一适用于所有情况的自适应放射治疗计划智能体:基于每日锥束CT引导的放射治疗基础框架

Shaoyan Pan, Kirk Jon Luca, Yuan Gao, Shansong Wang, Mingzhe Hu, Ryan Sanford, Mojtaba Safari, Justin Roper, Zhen Tian, Tonghe Wang, Xiaofeng Yang

专题命中 多模态Agent :multimodal(abstract)

AI总结 介绍一适用于所有情况的自适应放射治疗计划智能体,它基于统一基础模型,能从每日锥束CT执行在线自适应计划,自主预测关键组件并设计临床计划,经多数据集评估,其准确性和计划质量与临床方案相当,为放射治疗带来新机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04103 2026-07-17 q-fin.RM cs.LG 版本更新 50%

Governing Generative AI Across Financial Institutions: A Framework for Generative AI Risk Control

跨金融机构治理生成式AI:符合SR 26-2要求的生成式AI风险控制框架

Dennis Mao, Alessandra Lin, Yixin Kang, Yiqing Wang

机构 * Citigroup(摩根大通) Florida State University(佛罗里达州立大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对SR 26-2未覆盖生成式AI的治理难题,本文提出兼容该监管规则的GAICF框架,将模型风险管理原则转化为分层控制结构,助力金融机构合规管控生成式AI应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13067 2026-07-16 cs.RO 新提交 50%

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS

一种由 3DGS 驱动的用于水下遥操作的动态视点和振动触觉框架,并通过功能近红外光谱法进行验证

Fang Xu, Tianyu Zhou, Ruitong Tian, Md Jahidul Islam, Jing Du

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对水下遥操作受限于二维视图和通信延迟的问题,提出基于 ROS - Unity 框架的多模态架构,用 3DGS 驱动的 DAVS 及振动触觉套装辅助,经实验验证该方式能提升操作员性能与认知耐力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12732 2026-07-15 cs.RO 新提交 50%

Globalized Constrained Stein Variational Inference for Diverse Feasible Robot Motion Planning

用于多样化可行机器人运动规划的全局约束斯坦变分推理

Jiayun Li, Georgia Chalvatzaki

机构 * PEARL Lab, Dept. of Computer Science, TU Darmstadt(珍珠实验室,达姆施塔特工业大学计算机科学系) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究机器人运动规划多模态问题,提出SteinSQP方法,通过约束斯坦变分推理演化粒子集合,用无矩阵原始对偶算法解决子问题,引入优点函数全局化方法,在多任务中表现良好,收敛快且可行性高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21477 2026-07-15 cs.CR 版本更新 50%

MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks

MCP陷阱实验室:在多向攻击下暴露MCP工具服务器安全漏洞的开发人员陷阱

Run Hao, Zhuoran Tan

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出MCP Pitfall Lab框架,通过可复现的场景验证开发人员陷阱,评估MCP工具服务器在多向攻击下的安全性和修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11739 2026-07-14 cs.RO 新提交 50%

AutoPath: Learning Transferable Goal-Conditioned Stochastic Path Prior for Safe Navigation Without Human Demonstrations

AutoPath:学习可转移的目标条件随机路径先验以实现无人类示范的安全导航

Ziyang Zhang, Boyang Zhou, Zesong Yang, Haocheng Peng, Zeming Gai, Xiao Liang, Yujun Shen, Danping Zou, Ruizhen Hu, Hujun Bao, Zhaopeng Cui

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Shenzhen University(深圳大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究在复杂环境下的安全导航问题,提出学习可转移目标条件随机路径先验的方法,引入规范状态表示和结构化先验学习框架,实验证明该方法成功率高、效率有竞争力且可跨平台转移。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09756 2026-07-14 cs.RO 新提交 50%

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems

用于无人机群的以大语言模型为中心的智能体人工智能:架构、使能技术及开放问题

Yousef Emami, Rahim Taheri, Mohammadhossein Homaei, Muhammad Atif Ur Rehman, Mohammad Shojafar

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对无人机群实际部署受限问题,提出以大语言模型为中心的智能体人工智能LAUS,回顾相关使能技术,分析威胁,确定包括抗幻觉推理等在内的开放研究挑战。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏