Towards Semantic-based Agent Communication Networks: Vision, Technologies, and Challenges
迈向基于语义的智能体通信网络:愿景、技术与挑战
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文探讨语义在智能体通信网络中的作用,提出新的架构并综述现有技术,识别关键挑战并提出解决方案。
Comments 46 pages, 15 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
迈向基于语义的智能体通信网络:愿景、技术与挑战
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文探讨语义在智能体通信网络中的作用,提出新的架构并综述现有技术,识别关键挑战并提出解决方案。
Comments 46 pages, 15 figures
纠正,而非后悔:避免可微模拟在轨迹预测中的陷阱
机构 * University of Wuppertal(乌珀塔尔大学)
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出一种非可微的递推滚动方法,通过切断计算图来避免可微模拟中的捷径学习,提升轨迹预测的鲁棒性和恢复能力。
AirSimAG:一种高保真空地协同机器人仿真平台
机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)
专题命中 多模态Agent :cross-modal(abstract)
AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。
面向即兴任务的移动建筑机器人AI代理的定位任务感知
机构 * University of Michigan(密歇根大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。
放射治疗中的全面剂量学验证与位置敏感性分析:一种用于 HDR 和 LDR 治疗的统一 ESAPI 工具
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出了一种基于 Varian Eclipse Scripting API 的独立软件工具,用于验证 HDR 和 LDR 放射治疗的 QA,通过比较点源和线源模型,分析位置不确定性,并提高临床工作流程的安全性。
Comments 13 pages, 2 tables, 5 figures
基于概念的词典学习用于推理时的安全性在视觉语言动作模型中
机构 * Beijing Jiaotong University(北京交通大学) ; Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) ; King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) ; University of Auckland(奥克兰大学) ; RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出基于概念的词典学习框架,用于提升视觉语言动作模型推理时的安全性,通过学习稀疏可解释词典识别有害概念方向并抑制风险组件,实验表明其在多个基准上有效降低攻击成功率70%以上。
BioBO:结合生物学知识的贝叶斯优化用于扰动设计
机构 * Johnson & Johnson Innovative Medicine(强生创新医药) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 多模态Agent :multimodal(abstract)
AI总结 BioBO结合多模态基因嵌入和富集分析,提升代理建模和获取策略,提高标签效率25-40%,并提供路径级解释,链接设计与生物调控电路。
Comments ICLR 2026
基于触觉的交互式运动规划器用于未知杂乱环境中的机器人
机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) ; State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) ; Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) ; College of Electronics and Information Engineering, Tongji University(同济大学电子与信息学院)
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出了一种基于触觉的交互式运动规划框架,通过多模态触觉感知实时构建接触模型,从而在未知杂乱环境中安全扩展自由运动空间。
Nevis数字孪生:历史遗址的摄影测量与沉浸式可视化
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出了一种多模态数据采集流程,用于保护受威胁的历史遗址,通过摄影测量和3D高斯点散布实现虚拟重建,以提供可扩展的数字遗产民主化模型。
Comments ARCHERIX Workshop - IEEE VR 2026
CaroTo:一种用于快速全面分析4D PC-和3D BB-MRI数据颈动脉狭窄的工具
专题命中 多模态Agent :multimodal(abstract)
AI总结 CaroTo工具通过多模态和多维分割、生物标志物提取和可视化,实现颈动脉动脉粥样斑块的标准化评估,提升颈动脉狭窄分析的精度和一致性。
Comments VCBM 2024, Poster Honorable Mention
超越检测:用于快速在轨遥感危机响应的协作多智能体推理
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。
Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)
SpecZoo:一个基于AI的天文光谱分析与可视化平台
专题命中 多模态Agent :multi-modal(abstract)
AI总结 SpecZoo平台利用人工智能技术,整合现代信息技术和机器学习,提升光谱数据处理效率,支持光谱可视化、自动分类、参数测量及多波段数据融合,应用于LAMOST、SDSS等重大项目,并促进天文与数据科学的教育融合。
Comments 19 pages, 11 figures, 2 tables, published in the journal of 'universe' (see the special issue: https://www.mdpi.com/journal/universe/special_issues/77CGKMGC3Q)
在不确定性下的分层决策:一种混合MDP和机会约束MPC方法
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。
Comments 14 pages, 10 figures
云原生自主移动系统在户外和室内环境中的实际部署
机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) ; Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯加拿大有限公司技术伙伴关系与创新部) ; Mechanical Engineering Department, University of Alberta(阿尔伯塔大学机械工程系)
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出云原生自主移动框架,通过基础设施智能传感与云计算协调提升自主操作能力,实验证明在城市环岛和医院类室内环境中的感知鲁棒性和安全性提升。
Comments This paper has been submitted to IEEE Robotics and Automation Magazine
UGotMe: 一种用于情感人机交互的具身系统
机构 * School of Computing, Macquarie University(麦考瑞大学计算学院) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出UGotMe系统,解决多对话场景中视觉噪声和实时响应问题,通过去噪策略和高效数据传输提升情感识别能力。
Comments Accepted to the 2025 IEEE International Conference on Robotics and Automation (ICRA)
STRIDE: 通过流匹配实现结构化拉格朗日和随机残差动力学
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出STRIDE框架,结合拉格朗日神经网络与条件流匹配,分离保守刚体动力学与非保守随机交互效应,提升机器人在不确定环境中的预测精度与控制可靠性。
Comments 9 pages, 7 figures
ClimateAgents: 一种用于社会-气候动态分析的多智能体研究助手
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出ClimateAgents,一种多智能体研究助手,通过整合多模态数据检索、统计建模和自动推理,帮助研究者探索社会-环境动态,提升气候分析的适应性和解释性。
从4D速度测距学习孔隙尺度多相流
机构 * Department of Earth Science and Engineering, Imperial College London(帝国理工学院伦敦地球科学与工程系) ; Department of Geology, Ghent University(根特大学地质系) ; Department of Energy Science and Engineering, Stanford University(斯坦福大学能源科学与工程系) ; Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; NVIDIA
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出一种多模态学习框架,通过4D微速度测距数据直接推断多相孔隙流,结合图网络模拟和3D U-Net,实现快速预测,为地下碳和氢存储提供高效工具。
将顺序设计动作建模为设计师在无限画布上的外部化
专题命中 多模态Agent :multimodal(abstract)
AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。
利用人工智能进行phytolith研究
专题命中 多模态Agent :multimodal(abstract)
AI总结 Sorometry通过人工智能整合2D和3D数据,实现phytolith的高效分析与预测,提升考古和古生态研究的精度与标准化。
Comments 45 pages, 23 figures
SpecOps:一种在真实GUI环境中完全自动化的AI代理测试框架
专题命中 多模态Agent :multimodal(abstract)
AI总结 SpecOps是一种全新的自动化AI代理测试框架,通过专门设计的LLM代理处理四个阶段,实现对真实GUI环境中复杂代理的高效测试与验证。
Comments Accepted to ICSE 2026
Journal ref Proceedings of the IEEE/ACM International Conference on Software Engineering (ICSE 2026)
HMR-1: 基于视觉-语言模型的分层按摩机器人用于具身医疗
机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; Spatiotemporal AI, China(时空人工智能,中国) ; Hangzhou International Innovation Institute, Beihang University, China(杭州国际创新研究院,北航,中国) ; Georgia Institute of Technology, China(佐治亚理工学院,中国) ; Key Laboratory of Computing Power Network and Information Security, Ministry of Education(计算功率网络与信息安全重点实验室,教育部;山东省计算机科学中心,齐鲁工业大学(山东省科学院),中国) ; Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences), China
专题命中 多模态Agent :multimodal(abstract)
AI总结 HMR-1提出基于视觉-语言模型的分层按摩机器人框架,通过构建多模态数据集和微调Qwen-VL模型,实现了具身医疗任务的评估与应用。
在政治盟友网络中辨别媒体偏见:一种用于党派破坏的分析条件
专题命中 多模态Agent :multimodal(abstract)
AI总结 研究在政治盟友网络中辨别媒体偏见的条件,通过概率框架分析党派分子对代理体观点的影响,推导出湍流非收敛与渐近学习的区分条件。
Comments 37 pages, 8 figures
Journal ref Physica A: Statistical Mechanics and its Applications Volume 673, 1 September 2025, 130679
GeoNav: 通过双尺度地理推理赋能大语言模型实现语言目标的空中导航
机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; BNRist, Tsinghua University(清华大学BNRist)
专题命中 多模态Agent :multi-modal(abstract)
AI总结 GeoNav通过双尺度地理推理赋能大语言模型,实现语言目标的空中导航,提升城市场景下的导航成功率和精度。
Comments Published in Pattern Recognition (2026)
Journal ref Pattern Recognition, Volume 177, 113365, 2026
观察和控制视觉-语言-动作模型中的特征
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。
触觉在认知中的作用:记忆的破坏者还是促进者?
专题命中 多模态Agent :multimodal(abstract)
AI总结 本研究探讨触觉敏感度和运动强度对记忆的影响,发现增加书写压力略微降低即时回忆,但手套使用无明显影响,揭示了身体互动与认知表现之间的复杂关系。
Comments 22 Pages (including references), Book chapter
VizCrit: 探索在视觉设计工具中展示计算反馈的策略
专题命中 多模态Agent :multi-modal(abstract)
AI总结 VizCrit通过算法问题检测和视觉注释生成,探索在视觉设计工具中实现可操作反馈的策略,发现以解决方案为中心的反馈能提升初学者的创造力感知和设计质量。
LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索
机构 * Brown University(布朗大学)
专题命中 多模态Agent :multimodal(abstract)
AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。
Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)
MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Science and Technology Beijing(北京科技大学) ; NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; XYZ Embodied AI(XYZ具身AI) ; Shandong University(山东大学) ; Linketic ; D-Robotics
专题命中 多模态Agent :multi-modal(abstract)
AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。
Comments Project Page: https://xuhu0529.github.io/MarketGen
基于高斯混合的逆感知合同用于不确定性感知的机器人导航
机构 * Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学) ; Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出基于高斯混合的逆感知合同,通过联合椭球置信集表示不确定性,提升机器人导航的安全性和适应性。
Comments 8 pages, 5 figures. Accepted to ACC 2026 (American Control Conference)