From Failure to Mastery: Generating Hard Samples for Tool-use Agents
从失败到精通:为工具使用代理生成困难样本
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL
AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
从失败到精通:为工具使用代理生成困难样本
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL
AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。
从上下文到EDUs:通过基本话语单元分解实现忠实且结构化的上下文压缩
机构 * DeepLang AI ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 工具调用 :autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出EDU-based Context Compressor,通过基本话语单元分解实现结构化上下文压缩,提升模型在长文档问答和复杂搜索任务中的性能。
重新构想传统飞行计算机:E6BJA作为现代多平台工具用于飞行计算和训练
专题命中 工具调用 :planning(abstract);分类 cs.SE
AI总结 E6BJA是一款多平台飞行计算工具,通过增强建模能力和更准确的大气计算,提升飞行计划和训练的准确性与教育价值。
Comments Pre-print v2. 27 pages, 18 figures, 2 tables
AI代理系统:架构、应用与评估
机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)
专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);planning(abstract)
AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。
Youtu-LLM:解锁轻量级大语言模型的原生代理潜力
机构 * Youtu-LLM Team(Youtu-LLM团队)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool-use(abstract);planning(abstract)
AI总结 Youtu-LLM通过紧凑架构和长上下文支持,实现了轻量级大语言模型在代理任务中的高效推理与规划能力。
Comments 57 pages, 26 figures
代理AI用于自主、可解释和实时的信用风险决策制定
专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 本文提出代理AI框架,通过多代理系统实现自主、可解释和实时的信用风险决策,提升决策效率并应对监管与技术挑战。
Comments 8 pages
Journal ref INTELLIGENT SYSTEMS AND APPLICATIONS IN ENGINEERING, vol 12 No23, 2024
AirSpatialBot: 一种空间感知的空中智能体用于细粒度车辆属性识别与检索
机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) ; Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)
专题命中 规划决策 :agent(title,abstract);planning(abstract)
AI总结 AirSpatialBot通过空间感知的VLM和两阶段训练策略,实现细粒度车辆属性识别与检索,解决遥感图像中的空间理解难题。
Comments 12 pages, 9 figures
基于DPDP的数据治理代理软件框架
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 本文提出基于DPDP的数据治理代理框架,通过协作代理和动态政策执行实现透明、合规的数据治理。
基于JEPA世界模型的价值引导动作规划
机构 * École Polytechnique(巴黎高等理工学院) ; ENS Paris(巴黎高等师范学院) ; New York University(纽约大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于JEPA世界模型的价值引导动作规划方法,通过塑造表示空间提升规划性能。
Comments Presented as a poster at the World Modeling Workshop 2026, Mila
ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务
机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。
Comments 12 pages, 9 figures
从感知到符号任务规划:基于视觉语言的引导人机协作结构装配
机构 * Department of Civil, Environmental, and Construction Engineering, Texas Tech University(土木、环境与建设工程系,德克萨斯理工大学)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出基于视觉语言模型的人机协作结构装配框架,通过感知到符号态和人感知规划模块提升动态环境下的态估计和任务规划鲁棒性。
高效迭代近端变分推断运动规划
机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA(电气与计算机工程学院,佐治亚理工学院,亚特兰大,GA) ; School of Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA(航空航天工程学院,佐治亚理工学院,亚特兰大,GA)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出P-GVIMP方法,通过并行计算和变分推断解决非线性随机系统的运动规划问题,实现高效规划与不确定性下的成功解决方案。
Comments 13 pages
Journal ref Robotics and Autonomous Systems 174 (2025) 105267
潜在空间强化学习用于多机器人探索
机构 * Department of Aerospace Engineering(航空航天工程系) ; Indian Institute of Science(印度科学研究所)
专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出利用潜在空间强化学习,通过自编码器和过程生成算法提升多机器人探索效率和鲁棒性。
定性实验室:利用大语言模型进行社会学人设模拟与假设生成
专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出利用大语言模型进行社会学人设模拟,通过生成自然对话生成深入的定性假设,挑战传统方法的局限性。
Comments 26 pages, 3 tables. Manuscript submitted for peer-reviewed journal publication
迈向病理学中的可审计神经符号推理:SQL作为证据的显式轨迹
机构 * Capital Normal University, Beijing, China(首都师范大学) ; Leibniz-Institut für Analytische Wissenschaften-ISAS, Dortmund, Germany(莱比锡分析科学研究所-ISAS) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出一种基于SQL的神经符号推理框架,通过可执行的SQL轨迹实现病理分析的可审计性和可解释性。
从情绪分类到情绪推理:提升大语言模型情感智能
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文通过合成情绪链式思维数据提升大语言模型的情感推理能力,实验表明微调后模型在情绪理解与意识评估上显著提升。
Comments 10 pages, 1 figure
投资成功的获取路径:基于信息驱动的LLM图推理的创业投资预测
机构 * ShanghaiTech University(上海科技大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; University of Maryland(马里兰大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 MIRAGE-VC通过信息驱动的图路径推理,提升创业投资预测的准确性和可解释性。
熵适应微调:解决自信冲突以缓解遗忘
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhongguancun Academy(中关村学院)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 熵适应微调通过利用令牌级熵区分知识不确定性和冲突,缓解微调过程中的遗忘问题,提升模型在多个领域的表现。
有限状态去中心化策略基控制与保证地面覆盖
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 本文提出了一种有限状态去中心化策略基控制框架,通过智能体的参考配置设计DNN结构,并利用AOC概念实现最优地面覆盖的去中心化收敛。
MentalGame:利用多类型游戏和机器学习方法预测软件开发人员的性格-职业适配度
机构 * Department of Computer Engineering, University of Tehran(塔里哈大学计算机工程系)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 MentalGame通过多类型游戏和机器学习方法预测软件开发人员的性格-职业适配度,实现高精度的适配性预测。
具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测
机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) ; Affiliated Hospital of Xiangnan University(湘南大学附属医院) ; Jiangxi Cancer Hospital(江西省肿瘤医院) ; Chenzhou Third People's Hospital(郴州第三人民医院)
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。
TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。
Comments AAAI 2026 Oral
稀疏威胁,聚焦防御:面向安全自动驾驶的关键性感知鲁棒强化学习
机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R.China(北京智能交通安全与隐私重点实验室,北京交通大学,中华人民共和国)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CARRL方法,通过关键性感知的对抗训练,提升自动驾驶中稀疏安全关键风险的鲁棒性,实验显示碰撞率降低22.66%。
nvBench 2.0:通过分步推理解决文本到可视化中的歧义
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。
利用Actor-Critic强化学习生成测地线以预测中点
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于Actor-Critic强化学习的方法,通过递归预测中点来生成测地线,以提高在复杂运动学和多自由度机器人臂规划中的性能。
Comments 17 pages with 8 pages of appendices and references, 9 figures
Journal ref Journal of Machine Learning Research, 26(212):1-36, 2025
AprielGuard:一个统一安全与对抗防御的8B参数模型
机构 * AprielGuard
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。
CSCBench: 一种用于商品供应链推理的PVC诊断基准
机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) ; Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) ; Xiamen C&D Co., Ltd.(厦门C&D有限公司) ; Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)
专题命中 规划决策 :planning(abstract);分类 cs.CL
AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。
FALCON:跨域少样本对抗学习用于医学图像分割
机构 * KU Leuven(卢森堡大学) ; IIT-Bombay(印度理工学院-孟买) ; Tezpur University(泰浦大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 FALCON通过跨域少样本对抗学习实现高精度医学图像分割,以更少的数据和计算开销获得更优的边界精度和分割性能。
Comments 20 pages, 6 figures, 7 tables
HanoiWorld:基于联合嵌入预测架构的世界模型用于自动驾驶控制器
机构 * Faculty of Mathematics and Informatics, Hanoi University of Science and Technology(数学与信息学学院,河内科学技术大学) ; Troy University(特洛伊大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 HanoiWorld基于JEPA架构,利用RNN实现自动驾驶中的长期规划,通过实验展示在安全意识下有效降低碰撞率。
基于贝叶斯不确定性加权的自适应置信预测用于分层医疗数据
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出一种结合贝叶斯不确定性加权与置信校准的混合框架,用于提升医疗数据中的不确定性量化精度与覆盖保证。