VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience
VCE-Skill:利用版本变更经验增强技能自进化
专题命中 工具调用 :tool-use(abstract);分类 cs.AI
AI总结 本文提出VCE-Skill,将公共技能变更提炼为结构化版本变更经验并与轨迹提议自适应融合,提升了技能自进化的平均分数,增强了跨模型迁移性能,拓展了技能自进化的先验知识来源。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
VCE-Skill:利用版本变更经验增强技能自进化
专题命中 工具调用 :tool-use(abstract);分类 cs.AI
AI总结 本文提出VCE-Skill,将公共技能变更提炼为结构化版本变更经验并与轨迹提议自适应融合,提升了技能自进化的平均分数,增强了跨模型迁移性能,拓展了技能自进化的先验知识来源。
当工具支持的技能检索失效时:可执行能力检索中的源风格崩溃
机构 * University of Manchester(曼彻斯特大学) ; University of Sheffield(谢菲尔德大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 该研究针对可执行能力检索中出现的源风格崩溃问题,提出源感知路由方法ToolScout,利用TF-IDF指纹提升检索覆盖率,验证了该方法的有效性。
Ventor-QTest:威胁模型驱动的供应商托管大语言模型API验证
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 Ventor-QTest是一种无需目标API概率信息的复合黑盒审计方法,通过AFL和EFL指标审计供应商托管LLM API质量,可反映长视野任务的极端保真度损失,开源实现可获取。
大语言模型辅助的科学文献队列发现
专题命中 工具调用 :planning(abstract);分类 cs.CL
AI总结 该研究开发了问题驱动框架,通过PubMed API检索文献,用大语言模型提取队列名称,在青少年攻击行为遗传学用例中,补充了队列目录未覆盖的17个合格队列。
证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。
Comments Preprint. 18 pages, 14 figures, 7 tables
面向安全的大语言模型智能体:规范、验证与执行的综述
机构 * The University of Manchester(曼彻斯特大学) ; The University of Greenwich(格林威治大学) ; Technology Innovation Institute(技术创新研究院)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。
Comments 28 pages
OGX:开源、厂商中立的生成式AI应用服务器
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标
通过可处理提议缓解局部约束解码中的偏差
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 工具调用 :function calling(abstract);分类 cs.CL
AI总结 针对局部约束解码中因短视掩码导致的采样偏差,提出基于张量化有限自动机的全局约束解码提议和概率全局约束解码提议,结合序贯蒙特卡洛方法实现无偏采样,在函数调用、关键词生成和SQL生成任务中显著减少所需粒子数并加速收敛。
Comments ICML 2026
MedMCP-Calc:通过MCP整合建立LLMs在真实医疗计算场景中的基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 MedMCP-Calc通过MCP整合建立首个LLMs在真实医疗计算场景的基准测试,揭示模型在多步骤计算和外部工具利用上的不足,并开发CalcMate实现开源模型的最佳性能。
Comments Accepted to the ACL 2026 Main Conference as an Oral Presentation
学习运行电力网络:受AlphaZero启发的有效拓扑控制方法
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 针对电网拓扑控制的组合空间与约束问题,研究受AlphaZero启发的模型方法,发现优化的AlphaZero达98.43%生存能力,需结合领域启发式、二元奖励与受限观测空间。
Comments 10 pages, 9 figures. Accepted for publication in ACM SIGENERGY Energy Informatics Review, Volume 6, Issue 3, September 2026
修复,而非改进:分解工具调用弃权中的约束解码
机构 * Redrob
专题命中 工具调用 :function calling(abstract);分类 cs.CL
AI总结 该研究针对工具调用弃权问题,分解约束解码的作用,发现修复格式约束的效果优于改进,且两项预注册语言声明不成立。
Comments 24 pages, 4 figures, 17 tables
TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。
Comments 23 pages, 12 figures, 20 tables, 2 algorithms
@skills:你所需的全部注意力
机构 * SylphAI(西尔菲人工智能公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。
Comments 7 pages main, 23 pages in total with appendix, 6 figures
基于技能-工具链进化的自演化具身智能体
机构 * Microsoft Research(微软研究院) ; Northeastern University(东北大学)
专题命中 工具调用 :agent(abstract);分类 cs.CL
AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。
成本不确定性下面向物理互联网供应链优化的图神经网络引导遗传算法
专题命中 工具调用 :planning(abstract);分类 cs.LG
AI总结 针对成本不确定的物理互联网三级供应链优化问题,构建确定性与最小最大遗憾模型,提出GNN-GA算法,实验显示其在多实例上优于标准GA,学习到的初始化是主要改进来源。
Comments 6 pages
ArchAgent v2:数据预取锦标赛的案例研究
机构 * Google(谷歌公司) ; University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 本研究提出ArchAgent v2框架,通过级联进化搜索和硬件可实现性反馈循环,在DPC4中自动设计出性能优于人工方案的三级预取器,为计算机架构师提供了自动化智能体发现的实用工具。
VERDI:检索并非持续世界模型优化的迁移
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 本文针对基础世界模型优化中策略难迁移的问题,提出VERDI框架,通过构建优化指纹、检索假设并经目标侧验证来实现持续优化,可降低搜索与GPU成本,减少负迁移并提升迁移结果预测准确率。
Comments 28pages, 13figures,conference
不确定但确定:揭示扩散语言模型中的表示-置信度差距
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。
CommitKV:面向多轮智能体的、基于提交转换的生命周期感知KV缓存压缩
机构 * Xiamen University(厦门大学) ; WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 CommitKV通过提交转换识别KV生命周期,区分休眠与可安全移除信息,在多轮智能体中降低内存占用、加速推理且准确率优于现有KV缓存压缩方法。
学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。
Comments 15 pages, 4 figures
跨模型价值比较中的两个混淆因素:响应确定性和访问约束
机构 * KITECH(韩国产业技术评价院) ; National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。
Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files
READER: 基于提取表示的鲁棒证据作者身份解码
机构 * National University of Singapore(新加坡国立大学) ; Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。
BONSAI:基于可进化性的技能树搜索
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究提出BONSAI技能优化框架,基于可进化性的蒙特卡洛树搜索优化冻结智能体的技能,在30B智能体和三个基准上,较无技能智能体及GEPA、SkillOpt基线显著提升保留集准确率。
PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Southeast University(东南大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。
Comments 21 pages, 17 figures
规则手册下的近似多目标搜索
机构 * Iowa State University(爱荷华州立大学) ; Technion - Israel Institute of Technology(以色列理工学院)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 针对机器人规划中规则手册下多目标最优解计算成本高的问题,提出RA*pex算法,结合降维与规则层次处理,大幅提升计算效率。
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
HALT:面向检索增强搜索智能体的感知验证式停止策略
机构 * KAIST(韩国科学技术院)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。
Comments 23 pages, 6 figures. Code: https://github.com/Noverse0/HALT
何时与何地查看:用于高效长视频理解的自适应视觉证据调度
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。
参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。
Comments 15 pages, 8 figures
CRISP:用于训练高效深度搜索智能体的关键步骤感知
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。
Comments 15 pages, 6 figures