arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2607.19935 2026-07-23 cs.AI 新提交 57%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19742 2026-07-23 cs.CR cs.AI 新提交 57%

An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports

一种从网络威胁情报报告中提取可达攻击链的自动化框架

Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) New Network Research Department(新网络研究部) Peng Cheng Laboratory(鹏城实验室) Great Bay University(大湾区大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19739 2026-07-23 cs.IR cs.AI 新提交 57%

Personalized Recommendation Tool Learning via Autonomous Language Agents

通过自主语言智能体进行个性化推荐工具学习

Mingdai Yang, Zhiwei Liu, Weizhi Zhang, Yibo Wang, Hao Peng, Philip Yu

机构 * Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对基于大语言模型的智能体在推荐系统中的局限性,提出PRTA框架,让LLM作中央规划器与多推荐模型交互,负责高级推理和个性化工具选择,传统模型进行全排序评分,设计反射机制,实验表明该框架提升了全排序推荐性能。

Comments 6 pages. Accepted by RecSys'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19232 2026-07-22 cs.LG cs.MA 新提交 57%

S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择

Kshitij Kumar Srivastava, Kshitij Jerath

机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。

Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 57%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18696 2026-07-22 cs.AI 新提交 57%

Do AI-Native Biotechs Need Departments? Benchmarking Company World Models for AI-Driven Drug Development

人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试

Yinan Wang

机构 * Noah AI Research(诺亚人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。

Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18241 2026-07-22 cs.AI 新提交 57%

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG:用于企业数据上可扩展即席分析的大语言模型规划执行图

Anupreet Walia

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对企业数据跨实体分析问题,提出BatchDAG系统,大语言模型生成操作DAG,经确定性引擎评估。通过实体感知批处理优化,减少大语言模型调用。实验显示其质量高、溯源性好,能高效处理查询,是通用编排层替代手工工作流程。

Comments 9 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18102 2026-07-22 cs.IR cs.CL cs.MA 版本更新 57%

FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering

FinSAgent:用于基于证据的美国证券交易委员会文件问答的语料库对齐多智能体框架

Jijun Chi, Zhenghan Tai, Hanwei Wu, Tung Sum Thomas Kwok, Hailin He, Zixing Liao, Bohuai Xiao, Chaolong Jiang, Jianliang Lei, Jerry Huang, Peng Lu, Muzhi Li, Liheng Ma, Yihong Wu, Sicheng Lyu, Jingrui Tian, Yihan Li, Yanzhang Ma, Sizhe Guan, Dingtao Hu, Yufei Cui, Ling Zhou, Lei Ding, Xinyu Wang

机构 * 1SimpleWay.AI 2McGill University 3University of Toronto 4University of California, Los Angeles 5The Chinese University of Hong Kong 6University of Manitoba 7Universit\'e de Montr\'eal 8Boston University 9Mila - Quebec AI Institute 10CG Matrix Technology Limited 11Lakehead University 12McMaster University

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究针对美国证券交易委员会文件问答中模型与文件不匹配问题,提出FinSAgent框架,通过角色专用智能体、数据库感知查询分解及多路径检索等方法,提升检索覆盖和答案正确性,在离线和在线实验中均优于基线。

Comments 20 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07649 2026-07-22 cs.CV cs.AI 版本更新 57%

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03698 2026-07-22 cs.LG 版本更新 57%

Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策

Sangeun Park, Minhae Kwon

机构 * KAIST(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17086 2026-07-22 econ.GN cs.AI cs.CY q-fin.EC stat.AP 版本更新 57%

Global Automation Atlas

全球自动化图谱

Prashant Garg, Tommaso Crosta, Jasmin Baier

机构 * Imperial College London(伦敦帝国学院) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于任务和国家特定的方法,用于全球范围内分类自动化暴露,以区分劳动力替代和增强自动化,相关技术渠道以及人工智能的物质作用。研究涵盖了124个国家,生成了覆盖全球99%人口和GDP的233万个任务-国家标签。

Comments 78 pages, 6 figures, 5 Extended Data figures. Substantially revised and expanded. Data and code: https://automationatlas.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07055 2026-07-22 cs.AI 版本更新 57%

Dr. Zero: Self-Evolving Search Agents without Training Data

零博士:无需训练数据的自我进化搜索智能体

Zhenrui Yue, Kartikeya Upasani, Xianjun Yang, Suyu Ge, Shaoliang Nie, Yuning Mao, Zhe Liu, Dong Wang

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究在高质量数据难获取时智能体自我进化问题,提出零博士框架,通过自我进化反馈循环和HRPO方法,使搜索智能体无需训练数据自我进化,在问答基准测试中表现出色,证明可仅通过自我进化实现强大智能搜索和推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 57%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17724 2026-07-21 cs.RO cs.AI cs.MA 新提交 57%

Lifelong Multi-Subsystem Pickup and Delivery with Buffer-Limited Handover Stations

具有缓冲区受限交接站的终身多子系统取货与送货

Chuanlong Zang, Isabelle Barz, Anna Mannucci, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Technical University of Berlin(柏林工业大学) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究终身多子系统取货与送货中协调子系统载荷转移的问题,提出交接感知预留与路由(HARR)方法,通过共享日历和缓冲区预测协调行动,模拟显示该方法能显著提高吞吐量、减少积压并降低规划时间,提升运输稳定性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17694 2026-07-21 cs.AI 新提交 57%

Artificial Intelligence for Understanding and Managing Transportation Behavior in Sustainable Smart Cities

可持续智慧城市中用于理解和管理交通行为的人工智能

Junbiao Pang, Muhammad Ayub Sabir, Fatima Ashraf

机构 * Beijing University of Technology(北京工业大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究如何利用人工智能理解和管理可持续智慧城市中的交通行为,通过以行为为中心的视角,研究公交到站预测等四个方向,经闭环框架整合,确定部署条件,建立从行为证据到各类交通决策的统一路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 57%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-07-21 cs.AI 新提交 57%

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16981 2026-07-21 cs.AI 新提交 57%

Expected Free Energy as Belief-Dependent Utility for rho-POMDPs

作为rho-POMDPs中信念依赖效用的期望自由能

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究在部分可观测性下智能体信息收集决策问题,核心方法是用主动推理最小化期望自由能,此方法被证明等同于求解特定rho-POMDP,实验表明该方法在多种环境中表现良好,能提供基于信念的效用,避免过度探索。

Comments 41 pages, 12 figures. Paper accepted as a spotlight at the 2026 International Workshop on Active Inference (IWAI); the workshop version will appear in the Springer Communications in Computer and Information Science (CCIS) series. Code and experiment data at https://github.com/PatrickAllenCooper/rho_aif

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16916 2026-07-21 cs.LG 新提交 57%

Enhancing Personalized Bladder Cancer Treatment Through Reinforcement Learning: A Recurrent Patient State Transition Decision Support Framework

通过强化学习增强个性化膀胱癌治疗:一种循环患者状态转换决策支持框架

Divyansh Chawla, Anshu Garg, Isshaan Singh

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究针对膀胱癌复发性疾病治疗需个性化决策的问题,提出集成预测状态转换建模、马尔可夫决策过程和深度Q网络强化学习环境的框架,能动态制定治疗计划,经评估效果良好,凸显其作为个性化膀胱癌治疗规划决策支持框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16211 2026-07-21 cs.AI 新提交 57%

Accurate and Efficient Long-Term Memory for LLM Agents

用于大语言模型智能体的准确高效长期记忆

Zicheng Zhao, Xinyang Guo, Luyao Lv, Menghan Wang, Ming Li, Shuaicheng Li

机构 * Central China Research Institute for AI Technology(华中人工智能技术研究院) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science, BNU-HKBU United International College, Zhuhai(北京师范大学-香港浸会大学联合国际学院数据科学跨学科研究与应用广东省重点实验室) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体长时记忆问题,提出MOSAIC框架,通过实体类型图存储、哈希加速双路径检索和主动冲突检测,提升了准确性和效率,在多项测试中取得更好结果,如准确率提高、冲突检测能力增强且检索延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16597 2026-07-21 cs.AI math.OC math.PR 新提交 57%

FST.ai 2.5: Explainable and Uncertainty-Aware AI for Olympic and Para-Taekwondo Decision Support, Athlete Digital Twins, and Federation-Scale Analytics

FST.ai 2.5:用于奥运会和跆拳道决策支持、运动员数字孪生及联合会规模分析的可解释且具有不确定性感知的人工智能

Keivan Shariatmadar, Ahmad Osman, Ramin Rey

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对精英运动数字化中现有方案零散问题,提出FST.ai 2.5框架,通过整合多源数据,实现战术诊断、运动员监测等功能,其原型部署可行,方法广泛适用于搏击等体育环境中的可解释AI、数字孪生及可靠决策支持。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10144 2026-07-21 cs.AI 版本更新 57%

IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation

IdeaTrail:用于科学构思的全流程智能体轨迹

Hengquan Guo

机构 * ShanghaiTech University(上海科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于科学构思和提案生成的多轮过程轨迹数据集IdeaTrail,从高质量论文和工件出发,经生成器-顾问合成循环,产生与真实工件一致且近似研究实践的多轮数据,为科研智能体提供数据及合成过程监督数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 57%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08258 2026-07-21 cs.DL cs.AI cs.IR 57%

Large Language Models for Scholarly Ontology Generation: An Extensive Analysis in the Engineering Field

大型语言模型在学术本体生成中的应用:工程领域的广泛分析

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University(知识媒体研究所,开放大学) Department of Business and Law, University of Milano Bicocca(商业与法律系,米兰比可卡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在工程领域生成学术本体的能力,通过评估多种模型发现,小型量化模型在优化后可达到大型专有模型的性能,且计算资源需求更低。

Comments Now accepted to Information Processing & Management. this is the camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 57%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15957 2026-07-20 cs.CL 新提交 57%

From Plausible to Actionable: A Position on LLM Self-Explanations

从似是而非到可付诸行动:关于大语言模型自我解释的立场

Elize Herrewijnen, Benedetta Muscato, Gizem Gezici, Fosca Giannotti

机构 * Utrecht University(乌得勒支大学) Scuola Normale Superiore(高等师范学校) University of Pisa(比萨大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 探讨大语言模型自我解释,指出其虽看似合理但忠实性存疑。从传统可解释人工智能角度识别评估局限,提出评估合理性与忠实性的指南,并强调评估应拓展到可操作性及相关应用,以支持不同利益相关者的明智决策和适当行动。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13669 2026-07-20 cs.AI 版本更新 57%

Agents-K1: Towards Agent-native Knowledge Orchestration

Agents-K1:迈向智能体原生的知识编排

Zongsheng Cao, Bihao Zhan, Jinxin Shi, Jiong Wang, Fangchen Yu, Zhijie Zhong, Yingnan Han, Zijie Guo, Tianshuo Peng, Zhuo Liu, Yi Xie, Xiang Zhuang, Shengji Tang, Yue Fan, Runmin Ma, Shiyang Feng, Xiangchao Yan, Anran Liu, Peng Ye, Wenlong Zhang, Xiaosong Wang, Shufei Zhang, Chunfeng Song, Fenghua Ling, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * PJLab(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Agents-K1管道,将原始文档转化为智能体原生科学知识图谱,通过多模态解析器、GRPO训练的4B信息抽取骨干和三源智能体接口,实现科学信息抽取、知识图谱构建和多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15356 2026-07-20 cs.AI 版本更新 57%

RAD: Retrieval High-quality Demonstrations to Enhance Decision-making

RAD:检索高质量示范以增强决策

Lu Guo, Yixiang Shan, Zhengbang Zhu, Qifan Liang, Lichang Song, Ting Long, Weinan Zhang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University, Changchun, China(吉林大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对离线强化学习泛化能力受限问题,提出RAD方法,通过引入检索机制,从离线数据集检索高回报可达状态作目标,利用生成模型生成子轨迹规划,经实验验证该方法在多基准测试中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 57%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15193 2026-07-17 cs.AI 新提交 57%

Plover: Steering GUI Agents through Plan-Centric Interaction

Plover:通过以计划为中心的交互来操控图形用户界面代理

Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Bosch Research North America(博世北美研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对现实中GUI自动化难题,提出以计划为中心的Plover系统,通过规划器-执行器架构,支持多方式监督与修正,经形成性研究和评估表明,该系统能让GUI自动化更透明、可控与可适应,利于修复故障。

详情

展开后加载摘要…

URL PDF HTML 收藏