SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
用于LLM重排序器的列表式交叉编码器微调与智能体指令微调:医疗流程重排序的系统性研究
专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL
AI总结 本文系统性对比列表式交叉编码器微调与智能体指令微调两种LLM重排序范式,在自建医疗流程重排序数据集上,发现1.09亿参数的ListNet微调交叉编码器性能优于40亿参数的Qwen3-Reranker-4B,参数量仅为后者1/37,相关成果已开源。
Comments 10 pages, 6 figures, 4 tables. Code available at https://github.com/matanf-healthee/listwise-crossencoder-reranking
面向异构编码智能体的技能的证据校准运行时重构
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL
AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。
Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence
FlashRT:用于引导智能体部署实时多模态应用的智能体框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; AMD(超威半导体公司) ; University at Buffalo(纽约州立大学水牛城分校)
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG
AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。
停止即停止:测量和修复智能体框架控制原语中的执行差距
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究生产型大语言模型智能体框架控制原语执行差距,用无模型差分探针发现漏洞及差距,提出SOUNDGATE修复,能强制执行多种属性,端到端阻止违规,释放合法效果。
Comments 32 pages, 3 figures, 11 tables. Code: pip install soundgate (PyPI)
AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化
机构 * alibaba(阿里巴巴集团)
专题命中 软件智能体 :agent(title);分类 cs.AI
AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。
Comments 7 pages, 2 figures, 3 tables
图形代理:用于科学代理的结构化执行图
机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。
编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。
Comments 8 pages of main content
SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案
专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。
基于双向重构-验证框架的代码智能体独立补丁验证
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。
Comments 8 pages
FailForge:从持续失败中提取过程能力到代码智能体
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 FailForge 框架将代码智能体的失败案例转化为训练信号,以边际成本恢复超26%失败实例,使 Qwen3.5-4B 在 SWE-bench Verified 上的解决率提升6.6个百分点,增益集中于最难问题。
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE
AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。
Comments Published as a conference paper at COLM 2026
超越能力边界:用于自进化大语言模型智能体的零阶优化
机构 * Beijing Institute of Technology(北京理工大学) ; Shenzhen MSU-BIT University(深圳北理莫斯科大学) ; Alaya Lab(阿莱亚实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出零阶自进化框架,通过扰动LLM的LoRA参数形成闭环自进化循环,结合并行扰动推理等机制,在多基准实验中显著提升了LLM智能体在困难样例上的表现。
孟德尔哥德尔机:基于比较进化的递归自改进编码智能体
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对现有自改进编码智能体仅利用单轨迹的缺陷,提出孟德尔哥德尔机,新增反应规范突变与跨谱系杂交两种自修改策略,经理论证明与实验验证,其在编码任务上的性能、效率及泛化性均优于基线方法。
Comments Project Page at https://reallcz.github.io/MGM; Code at https://github.com/RealLcz/MGM
Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索
机构 * ETH Zürich(苏黎世联邦理工学院) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; MiroMind
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。
Comments Published as a COLM paper
SpecPath:在合同等价的规范历史中测试编码智能体
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。
Comments 11 pages, 3 figures, 3 tables
激活探针:挖掘模型输出遗漏的表面代码安全信号
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。
Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026
SemPIC:学习语义位置无关的键值缓存
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 SemPIC通过训练启用LoRA的Writer编译文档KV,结合KV梯度检查点,提升了长上下文场景下的KV缓存性能,平均微F1值达0.60,接近全重计算效果。
权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习
专题命中 软件智能体 :agent(abstract)
AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。
Comments 9 pages, 4 figures, and 3 tables
Γ-鲁棒多选背包问题的 simultaneous 组-包络界
专题命中 软件智能体 :planning(abstract)
AI总结 本文针对Γ-鲁棒多选背包问题,提出 simultaneous 组-包络界方法,可同时界定阈值族,大幅加速松弛求解,在实验中实现2.37倍几何平均加速。
Comments 19 pages, 2 figures. Code and reproducibility materials: https://github.com/eric939/simultaneous-group-envelope-mckp
SymFT:基于符号Clifford–Pauli框架和稳定子坐标的通用容错量子电路模拟
专题命中 软件智能体 :planning(abstract)
AI总结 SymFT是一款高吞吐量容错量子电路模拟器,通过符号Clifford–Pauli框架分解和自适应稳定子坐标规划优化采样,在多种量子电路上实现了比Stim、Clifft、SOFT更优的采样性能。
Comments 28 pages, 1 figure, 5 tables; v2: update benchmark results and related work. SymFT is the second-generation successor to SOFT, see GitHub repository: https://github.com/haoliri0/SOFT
并非无障碍功能(A11y):安卓无障碍功能如何将移动智能体暴露于间接提示注入攻击
机构 * Radboud University Nijmegen(奈梅亨拉德堡德大学)
专题命中 GUI与网页智能体 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本文揭示安卓移动智能体框架因依赖未过滤的无障碍元数据,存在间接提示注入漏洞,经实证验证其攻击成功率达0.822,需强化零信任输入验证等安全措施。
智能体AI驱动的沉浸式模拟:用于高剂量率(HDR)近距离放射治疗的知识感知虚拟训练平台
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究提出一款智能体AI驱动的沉浸式模拟平台,用于HDR阴道圆柱近距离放射治疗虚拟训练,集成VR、移动计算与RAG技术,经原型验证可提供高保真无风险训练环境,具备合适延迟与高RAG支持质量。
面向GUI智能体的软件工程及与GUI智能体协同的软件工程
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。
MAESTRO:在具有GUI的对话代理中通过用户偏好适应GUI并引导导航
专题命中 GUI与网页智能体 :workflow(abstract,abstract_cn);agent(abstract);agentic(abstract)
AI总结 MAESTRO通过提取用户偏好并指导工作流导航,提升对话代理中GUI的适应性和导航效率,通过实验验证其有效性。
Comments 19 pages, 6 figures, 2 tables. Published at UIST '26. This is the camera-ready version, posted under CC BY 4.0
Journal ref Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA
带有单调规划代价的潜在世界模型用于图像目标导航
机构 * Drexel University(卓克索大学)
专题命中 GUI与网页智能体 :planning(title,abstract)
AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(title,abstract)
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准
机构 * Macau University of Science and Technology(澳门科技大学) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; FellouAI ; ARGUS Lab(ARGUS实验室) ; The University of Edinburgh(爱丁堡大学)
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。
Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/
JaleesBench:AI助手能否成为良好的精神陪伴?
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。
Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb