Karhunen-Loève Expansion-Based Residual Anomaly Map for Resource-Efficient Glioma MRI Segmentation
基于Karhunen-Loève展开的残差异常图用于资源高效的胶质瘤MRI分割
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV
AI总结 本文提出基于KLE的残差异常图方法,实现资源高效的胶质瘤MRI分割,显著提升性能并降低计算与数据需求。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
基于Karhunen-Loève展开的残差异常图用于资源高效的胶质瘤MRI分割
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV
AI总结 本文提出基于KLE的残差异常图方法,实现资源高效的胶质瘤MRI分割,显著提升性能并降低计算与数据需求。
视觉语言动作模型在机器人操作中的应用:系统综述
机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) ; Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。
Comments submitted to annual review in control
基于概率的方法用于神经符号无人机系统任务设计
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。
Comments arXiv admin note: text overlap with arXiv:2406.03454
EHRNavigator: 一种用于异构电子健康记录上患者级临床问答的多智能体系统
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL
AI总结 EHRNavigator通过多智能体系统在异构电子健康记录上实现患者级临床问答,展示出高准确率和高效响应,有效连接基准评估与临床应用。
基于智能代理的极端城市形态中人类移动性模拟
机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) ; Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) ; Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) ; Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。
UniConFlow: 一种统一的约束流匹配框架用于认证运动规划
机构 * Technical University of Munich (TUM)(技术大学慕尼黑) ; School of Mechanical Engineering, Translational Research Center, Tongji University(机械工程学院、转化研究中心,同济大学) ; Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 UniConFlow提出一种统一约束流匹配框架,通过整合等式和不等式约束,提升轨迹生成在安全性和动态一致性上的性能。
人工智能海马体:我们离人类记忆还有多远?
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。
Journal ref Transactions on Machine Learning Research (11/2025)
AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理
机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) ; NEC Laboratories Europe(NEC欧洲实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL
AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。
VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航
机构 * Peking University(北京大学) ; Zhongguancun Academy(中关村学院)
专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV
AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。
Comments Project page: https://wsakobe.github.io/VLingNav-web/
AgriAgent:面向现实农业的合同驱动规划与能力感知工具编排
机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) ; College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL
AI总结 AgriAgent通过合同驱动规划和能力感知工具编排,提升现实农业中复杂任务的执行成功率和鲁棒性。
显式世界模型以实现可靠的人机协作
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出通过构建显式世界模型来实现可靠的显式人机协作,强调动态模糊的人机交互需求。
Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification
A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估
机构 * Nankai University(南开大学) ; vivo AI Lab(vivo 人工智能实验室) ; SJTU(上海交通大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。
基于大语言模型代理的终身学习:路线图
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。
Comments Accepted to IEEE TPAMI
生成、迁移、适应:从单个人示范学习功能性灵巧抓取
机构 * Cornell University(康奈尔大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 CorDex通过单个人示范生成合成数据,结合多模态预测网络和局部-全局融合模块,实现对新型物体的灵巧抓取学习。
Comments Project Page: https://cordex-manipulation.github.io/
D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。
通过大型语言模型理解多智能体推理用于漫画视觉问答
机构 * University of Reading(阅读大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。
基于代理记忆的递归推理用于微服务根因定位
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence(人工智能研究院)
专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI
AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。
Comments accepted by ICSE-SEIP'26
AI代理系统:架构、应用与评估
机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。
提升视觉:基于推理引导的地面到空中定位
机构 * School of Computer Science, UPES(UPES计算机科学学院) ; Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。
CAML: 多智能体系统中的协同辅助模态学习
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Adobe Research(Adobe 研究院) ; North Carolina State University(北卡罗来纳州立大学)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 CAML通过多智能体协作和共享多模态数据,提升多模态学习在资源受限环境下的性能,实现事故检测和语义分割的显著改进。
AKG核代理:跨平台核合成的多智能体框架
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) ; Hunan University(湖南大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 AKG核代理是一种多智能体系统,通过自动化核生成、迁移和性能调优,提升跨平台核开发效率。
TCEval:利用热舒适性评估人工智能的认知与感知能力
专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI
AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。
GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。
永不终止的行为克隆代理用于机器人操作
机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ; Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。
Comments 17 pages, 6 figures, 9 tables
从浅层幽默到隐喻:通过LMM代理自我改进实现无标签有害迷因检测
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Southwestern University of Finance and Economics(西南财经大学) ; Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 ALARM通过LMM代理自我改进实现无标签有害迷因检测,利用浅层迷因信息提升对复杂迷因的识别能力。
Comments 12 pages. Accepted by KDD 2026 research track. Codes are released at https://github.com/Jian-Lang/ALARM
Motus:一个统一的潜在动作世界模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) ; Peking University(北京大学) ; Horizon Robotics
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。
TongSIM: 一个用于模拟智能机器的通用平台
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI ; Beijing, China(中国北京)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。
多智能体智能在胃肠肿瘤多学科决策中的应用
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) ; Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) ; Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) ; Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) ; Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。
大模型赋能的具身智能用于6G集成感知、通信与计算网络
机构 * School of Information and Electronics(信息与电子学院) ; School of Interdisciplinary Science(交叉科学学院) ; State Key Laboratory of CNS/ATM(CNS/ATM国家重点实验室) ; Beijing Institute of Technology(北京理工大学) ; Advanced Technology Research Institute(先进技术研究院) ; Yangtze Delta Region Academy(长江三角洲地区学院) ; School of School of Information Science and Engineering(信息科学与工程学院) ; Institute of Intelligent Communication Technologies(智能通信技术研究院) ; Shandong Key Laboratory of Intelligent Communication and Sensing-Computing Integration(智能通信与传感-计算集成山东省重点实验室) ; Zhejiang Provincial Key Laboratory of Information Processing, Communication and Networking(信息处理、通信与网络浙江省重点实验室) ; Department of Electronic Engineering(电子工程系) ; State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室) ; National Mobile Communications Research Laboratory(移动通信研究中心) ; Purple Mountain Laboratories(紫金山实验室)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文提出利用大模型赋能基站实现感知、通信和计算一体化,为6G系统提供安全关键的智能解决方案。
Step-GUI 技术报告
机构 * GELab-Team(GELab团队)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 Step-GUI 是一种先进的 GUI 代理,通过自我进化训练管道和 GUI-MCP 协议,在保持高准确率的同时实现高效隐私保护的 GUI 自动化。
Comments 41 pages, 26 figures