Low-complexity modular policies: learning to play Pac-Man and a new framework beyond MDPs
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG
Comments 23 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG
Comments 23 pages
StateM:通过工具链扩展在Terminal-Bench 2.1上达到95.3%的原始准确率,或实现15美元的前沿运行
专题命中 工具调用 :agent(abstract,comments);分类 cs.AI
AI总结 本研究提出智能体原生运行时StateM,通过工具链扩展优化智能体执行系统,在Terminal-Bench 2.1等基准上显著提升GPT-5.6、DeepSeek-V4 Flash等模型的任务准确率,大幅降低运行成本,验证了其有效性与泛化性。
Comments Harness Scaling, Semi-Self-Evolving Agent
PyVRP$^+$:基于LLM的元认知启发式进化方法用于车辆路径问题中的混合遗传搜索
机构 * Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学) ; University of Oxford(牛津大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI;autonomous agent(comments)
AI总结 本文提出PyVRP$^+$,通过LLM驱动的元认知启发式进化方法改进混合遗传搜索算法,发现更高效的启发式策略,提升VRP问题的求解性能。
Comments 18 pages, accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
注意边界:通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A
机构 * Independent Researcher(独立研究者)
专题命中 工具调用 :agent(abstract,comments);分类 cs.AI
AI总结 通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A,解决边界依赖认证和UI兼容性问题,实现可靠路由和稳定响应。
Comments 7 pages. Implementation and evaluation study of cross-boundary agent orchestration for Gemini Enterprise UI
专题命中 工具调用 :planning(abstract,comments);分类 cs.AI
Comments 8 pages, 6 figures, RA-L 2025 submission, Motion and Path Path Planning, Scheduling and Coordination, Robotics in Under-Resourced Settings
专题命中 工具调用 :planning(abstract,comments);分类 cs.AI
Comments Proceedings of ICAPS Workshop on Heuristics and Search for Domain-independent Planning (HSDIP) 2020, pp.1-8
专题命中 工具调用 :planning(abstract,comments);分类 cs.AI
Comments Source code of domain-specific solvers in multicore environment: https://github.com/jinnaiyuu/Parallel-Best-First-Searches Source code of classical planning in distributed environment: https://github.com/jinnaiyuu/distributed-fast-downward
Journal ref Yuu Jinnai and Alex Fukunaga. (2017). On Hash-Based Work Distribution Methods for Parallel Best-First Search. Journal of Artificial Intelligence Research (JAIR), 60, 491-548
专题命中 工具调用 :planning(abstract);agent(comments);multi-agent(comments)
Comments The 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023 Advances in Multi-Agent Learning - Coordination, Perception, and Control Workshop)
分析与修正大语言模型中的善意偏差
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 本研究识别出大语言模型存在的善意偏差,发现其稳定且随模型规模增大而增强,提出轻量对比校准法可修正该偏差,明确了对齐后的大语言模型作为人类替代者的适用场景与修正方法。
VisDocAgentBench:面向视觉丰富文档检索的智能体基准测试
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 该研究提出VisDocAgentBench基准,对比静态与智能体检索,发现视觉检索优于OCR文本检索,智能体可改善双桥项检索性能,为检索智能体发展提供方向。
StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Fudan University(复旦大学) ; Renmin University of China(中国人民大学) ; KAUST(阿卜杜拉国王科技大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。
Comments Accepted by EMNLP 2026. Project page: https://zheng977.github.io/StepGuard/
面向集体创新的自适应传输程序发现
机构 * Flowers AI & CogSci Lab(Flowers AI与认知科学实验室) ; Inria(法国国家信息与自动化研究所) ; IT University of Copenhagen(哥本哈根IT大学) ; Institute for Advanced Study in Toulouse(图卢兹高等研究院)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对集体创新任务,提出用LLM引导的进化搜索设计基于状态感知的传输协议,使集体性能较基准提升37%,协议可跨领域与群体迁移,为AI辅助设计协调基础设施提供了路径。
Comments CogSci 2026; longer version in prep
VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法
机构 * Tencent(腾讯)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。
SQLite 就足够了:使用 scrydb 的词汇、语义及混合搜索
专题命中 工具调用 :agentic(abstract);分类 cs.CL
AI总结 本研究推出 Python 库 scrydb,基于 SQLite 的 FTS5 和 sqlite-vec 扩展实现词汇、语义及混合搜索,经 IR 基准数据集验证,可为信息检索或智能体搜索下游任务提供轻量高效的解决方案。
Comments Software available at https://github.com/breuert/scrydb
WeMM-Embedding:微信多模态嵌入技术报告
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)
专题命中 工具调用 :agentic(abstract);分类 cs.CL
AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。
超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放
机构 * University of Southern California(南加州大学) ; Pohang University of Science and Technology (POSTECH)(浦项科技大学) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%
Comments Accepted to EMNLP 2026 Findings
面向大型语言模型的忠实知识图谱问答的组合式关系链
机构 * Sun Yat-sen University(中山大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。
CacheRouter:一种用于长尾工具发现的保留缓存的主模型隔离双路径工具路由架构
机构 * School of Mathematical Sciences, Beijing University of Posts and Telecommunications(北京邮电大学数学科学学院) ; School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) ; School of Science, Beijing Forestry University(北京林业大学理学院)
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 针对LLM工具使用中渐进式披露与提示词缓存的权衡,提出CacheRouter双路径路由架构,通过主模型隔离与工具路由通道设计提升缓存命中率,降低输入成本。
基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Nanjing University(南京大学)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI
AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。
Comments Manuscript
张量寻求布局:为机器学习编译器形式化布局选择
专题命中 工具调用 :planning(abstract);分类 cs.LG
AI总结 本文首次形式化机器学习编译器的布局选择问题,提出组合优化模型与算法,实现多种现有策略的统一,在AI加速器编译器上的实验验证了其效果,可分离成本模型误差与搜索质量。
用领域特定语言改进神经偏微分方程求解器的自动设计
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。
动态网络的在线设计
机构 * Peking University(北京大学) ; Institut Polytechnique de Paris(巴黎理工学院)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 本文提出一种基于蒙特卡洛树搜索的滚动时间规划方法,用于动态网络的在线设计,通过实时调整公交线路以适应随机需求,提升系统性能。
Comments 14 pages
无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问
机构 * National University of Singapore(新加坡国立大学)
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。
Comments 21 pages, 1 figure, Preprint
MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架
机构 * Apple(苹果公司)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。
Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox
基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试
专题命中 工具调用 :workflow(abstract);分类 cs.SE
AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。
Comments Under review
面向机器学习应用的网页视觉感知表示
机构 * Brno University of Technology(布尔诺理工大学) ; Faculty of Information Technology(信息技术学院)
专题命中 工具调用 :workflow(abstract);分类 cs.LG
AI总结 本文提出基于FitLayout的网页视觉感知表示与机器学习平台,支持数据集准备、机器学习输入获取,可用于训练图神经网络识别网页关键内容元素,保障结果可复现。
面向更好的多轮用户交互智能体:下一轮用户输入不止是上下文
机构 * Fudan University(复旦大学) ; Ant International, Ant Group(蚂蚁集团蚂蚁国际)
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 该研究针对多轮用户交互智能体的信用分配问题,提出FACA方法,在多领域测试中提升了8B和14B规模模型的性能,验证了下一轮用户反应可提供局部信用。
用米尔格拉姆范式测量大型语言模型对权威的服从性
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。
Comments 11 pages, 7 figures,
可自我进化的代理用于DFT实验能带不匹配的可解释诊断
机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。
Comments 6 pages, 4 figures
基于两阶段物理信息深度学习和统计混合模型的系数具有跳跃不连续性的偏微分方程反问题
机构 * School of Mathematics and Statistics(数学与统计学学院) ; Northwestern Polytechnical University(西北工业大学) ; Huazhong University of Science and Technology(华中科技大学) ; Xiangtan University(湘潭大学) ; Southern University of Science and Technology(南方科技大学) ; MOE Key Laboratory for Complexity Science in Aerospace(航空航天复杂科学教育部重点实验室) ; SandGold AI Research(SandGold AI研究院)
专题命中 工具调用 :workflow(abstract);分类 cs.LG
AI总结 提出两阶段物理信息深度学习框架,结合神经网络采样与统计推断,解决系数具有跳跃不连续性的PDE反问题,实现参数识别与解重构。