The PHOTON Wizard -- Towards Educational Machine Learning Code Generators
专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Published at the Conference on Robot Learning (CoRL) 2019
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
Comments Accepted for publication in the IEEE Proceedings of The 24 International Conference on Engineering of Complex Computer Systems (ICECCS 2019)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Accepted for the Machine Learning journal
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Full version of RLDM abstract
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments 6 pages, 5 figures
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments In ICML 2017. Website at https://pathak22.github.io/noreward-rl/
SkCC:面向跨框架LLM代理的可移植且安全的技能编译
机构 * Sun Yat-sen University(中山大学)
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。
Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/
机构 * Tel Aviv University(特拉维夫大学) ; NYU Tandon School of Engineering(纽约大学工程学院) ; New York University Abu Dhabi(纽约大学阿布扎克分校) ; Princeton Language and Intelligence(普林斯顿语言与智能) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
Comments ICML 2025; Project website https://enigma-agent.com
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
Comments Accepted to 2024 International Conference on Human-Agent Interaction (HAI)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI;AI agent(comments)
Comments 6 pages, 5 figures, Proceedings of the ICML 2024 Workshop on Trustworthy Multimodal Foundation Models and AI Agents
代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。
Comments 38 pages, 8 figures
SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。
基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议
机构 * Chalmers University of Technology(查尔姆斯理工大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。
Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026
SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。
评估用于教师模拟自动分析的大型语言模型
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究评估了DeBERTaV3、Llama 3等LLMs在教师教育数字模拟响应特征识别中的性能,发现Llama 3检测新特征更稳定,可为相关自动评估研究提供指导。
Comments Final published version in the Heliyon journal. Volume 12, Issue 14, September 2026, e45323. DOI: https://doi.org/10.1016/j.heliyon.2026.e45323
Journal ref Heliyon (September 2026), Volume 12, Issue 14, e45323
GitHub 拉取请求的 AI 对 AI 代码审查
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。
Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track
范畴论的AI现象学:一种第一人称进路
机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) ; Association for Mathematical Consciousness Science(数学意识科学协会)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。
Comments 38 pages, 11 figures
Journal ref R. Prentner (2026). Categorical AI Phenomenology: A First-Person Approach, Journal of Artificial Intelligence and Consciousness
软件任务中强化学习的奖励工程
专题命中 软件智能体 :autonomous agent(abstract);分类 cs.SE
AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。
Comments Accepted at EMNLP 2026 (Findings)
ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东方理工学院) ; Xi’an Jiaotong University(西安交通大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。
Comments 17 pages, 4 figures
FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体
机构 * Southeast University(东南大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。
Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: https://github.com/DEFENSE-SEU/FlowEvo
ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复
机构 * Huawei(华为) ; HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。
当代理失效:对LLM代理中bug的全面研究与自动化标记
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。
Comments Accepted at ISSRE 2026
LEGO-RL:利用原生强化学习实现编码智能体
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。
Comments Webpage: https://lego-rl.pages.dev
ORCA:基于可观测性的微服务故障程序修复
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
风力涡轮机维护日志标注框架:基于LLM驱动的数据校正与语义提取的可靠性智能增强
机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) ; Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)
专题命中 软件智能体 :workflow(abstract);分类 cs.CL
AI总结 提出一种利用大语言模型自动标准化和结构化风力涡轮机维护日志的方法,通过纠正系统代码、提取故障模式与维护动作分类,将非结构化文本转化为定量可靠性指标。
Comments An adjustable template containing the Python script architecture, applied dynamic prompts, and data schemas is hosted in an open-source GitHub repository: https://github.com/mvmalyi/llm-driven-wind-turbine-maintenance-log-labelling
JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。