BKP: An R Package for Beta Kernel Process Modeling
BKP:用于贝塔核过程建模的R包
专题命中 工作流自动化 :workflow(abstract)
AI总结 该研究介绍了R包BKP,用于从多种响应数据估计概率曲面。它实现了贝塔核过程等模型,支持多种功能,如核加权证据借用等,通过可重现示例展示了在概率曲面估计、分类及实际数据建模等方面的应用。
Comments 56 pages, 19 figures, and 4 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
BKP:用于贝塔核过程建模的R包
专题命中 工作流自动化 :workflow(abstract)
AI总结 该研究介绍了R包BKP,用于从多种响应数据估计概率曲面。它实现了贝塔核过程等模型,支持多种功能,如核加权证据借用等,通过可重现示例展示了在概率曲面估计、分类及实际数据建模等方面的应用。
Comments 56 pages, 19 figures, and 4 tables
CreatiPoster:迈向可编辑和可控的多层平面设计生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Intelligent Creation(智能创作) ; Fudan University(复旦大学)
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究旨在解决平面设计难题,提出CreatiPoster框架,通过协议模型和条件背景模型生成可编辑多层构图,超越开源方法和商业系统,发布无版权语料库,推动AI辅助平面设计应用。
Locus:面向定向模糊测试的代理谓词合成
机构 * University of Chicago(芝加哥大学) ; University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Northwestern University(西北大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 Locus通过合成语义谓词提升定向模糊测试效率,发现多个未修补漏洞。
Journal ref ICSE '26: 2026 IEEE/ACM 48th International Conference on Software Engineering
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
CEO-Bench:智能体能否玩转长期博弈?
机构 * Princeton University(普林斯顿大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出CEO-Bench,通过模拟500天运营初创公司的任务,评估语言模型智能体在长期、不确定、动态环境下的综合决策能力。
上下文很重要:提高基于大语言模型的单元测试生成的实际可靠性
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究基于大语言模型的单元测试生成在实际应用中的问题,提出上下文感知工作流程CATGen,通过明确依赖、稳定框架、静态分析等改进设计,经评估在实际项目和基准测试中提升编译成功率与覆盖率,减少生成时间和消耗。
Comments 23 pages, 5 figures, 7 tables
Symbolon: 通过学习代码变换进行符号执行
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出Symbolon框架,自动学习多样化的代码变换并上下文敏感地应用,以缓解符号执行的路径爆炸和复杂约束问题,在32个真实程序上平均行覆盖率提升3.69倍,内存和求解时间分别降低29.2倍和123倍,并在Linux内核中发现21个新漏洞。
太阳邻域种群研究的概率框架:应用于SDSS-V和盖亚
专题命中 软件智能体 :planning(abstract)
AI总结 该研究针对SDSS-V太阳邻域普查样本选择效应问题,提出概率框架及正向建模方法,通过模拟数据集验证,利用盖亚数据发布19的数据展示其科学效用,公开代码为未来研究提供重要工具。
Comments 23 pages, 8 figures
用于移动网络资源分配的自解释强化学习
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 研究移动网络资源分配问题,核心方法是用自解释神经网络参数化PPO智能体策略并聚合局部解释为全局解释,主要贡献是性能接近最优深度学习方法且显著优于启发式方法,全局解释相关性强,在高风险强化学习中有潜力。
交互式医学-SAM2 GUI:基于Napari的半自动标注工具用于医学图像
机构 * Department of Biomechatronic Engineering, Sungkyunkwan University(生物机电工程系,全州大学) ; Department of Neurosurgery, Seoul National University Hospital, Seoul National University College of Medicine(神经外科,首尔国立大学医院,首尔国立大学医学院)
专题命中 GUI与网页智能体 :workflow(abstract);planning(comments)
AI总结 交互式医学-SAM2 GUI 提供基于Napari的本地工作流,实现高效的3D医学图像半自动标注与导出功能。
Comments Planning to submit JOSS (Journal of Open Source Software)
动态网络中通过移动代理进行广播:图属性与代理的相互作用
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 重新审视动态网络中广播问题,原研究认为边密度是区分解决问题所需代理数量的关键属性,本文通过构造不同边密度的图及算法,表明边密度并非正确区分属性,揭示其与代理数量关系较弱。
Comments 31 pages, 5 figures
Chronos漏洞:智能AI中基于时间持久性和内存欺骗的分类法
专题命中 记忆与上下文管理 :agentic(title);agent(abstract);autonomous agent(abstract);planning(abstract)
AI总结 研究人工智能中Chronos漏洞,形式化基于持久性攻击的威胁模型,指出传统端点内容过滤器不足,综合深度防御格局并分类新兴框架,应对智能体内存攻击等安全威胁。
机制很重要:知识图谱何时有助于强化学习
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 研究探讨知识图谱对强化学习的影响,通过对照研究改变任务、机制和质量,发现结构化KG在特定任务上提升样本效率,其价值与知识量有关,安全性取决于机制,为从业者使用KG指导RL提供具体指导。
状态依赖观测噪声在线性高斯主动推理中重新引入认知价值
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究线性高斯主动推理中认知价值缺失问题,提出状态依赖观测噪声方法,通过耦合协方差R(x)与潜在均值,使后验协方差和卡尔曼增益依赖行动,恢复认知驱动力,弥合对偶控制与主动推理差距。
Comments 44 pages, 2 figures. Companion software: cpomdp v0.4.2, archived at https://doi.org/10.5281/zenodo.21429863; development repository at https://github.com/inferogenesis/cpomdp
工作场所中人类与人工智能代理交互的用户体验原则框架
机构 * SAP SE(SAP公司) ; Hochschule Fresenius(弗赖辛大学) ; University of Missouri(密苏里大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 研究工作场所人类与人工智能代理交互的用户体验原则,采用多方法识别并验证八项核心原则框架及标准,为设计师和工程师提供指导方针,为相关实证研究奠定结构化基础。
Comments 6 pages, 1 figure, 1 table, to be published in the proceedings of Mensch und Computer 2026
DocOps:复杂文档操作中自主智能体的可验证基准
专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。
FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。
EvoDRC:一种用于自动修复DRC违规的自进化智能体框架
机构 * Arizona State University(亚利桑那州立大学) ; NVIDIA Corporation(英伟达公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 针对先进节点物理设计中DRC闭合瓶颈问题,EvoDRC提出自进化智能体框架,利用参考设计知识和目标设计经验初始化并进化修复技能,将布局分解后分配智能体,通过工具反馈和知识数据库提升修复效果,实验显示总体减少73.5%。
FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具
机构 * Microsoft Corporation(微软公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。
Comments 22 pages, 10 figures
AgentCgroup: 理解和控制AI代理的操作系统资源
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Virginia Tech(弗吉尼亚理工大学) ; UConn(康涅狄格大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 AgentCgroup通过意图驱动的eBPF资源控制器,解决多租户云环境中AI代理资源管理的粒度、响应性和适应性不匹配问题,提升隔离性和减少资源浪费。
以智能体为中心的动物姿态预测
机构 * HHMI Janelia Research Campus(霍华德·休斯医学研究所珍利亚研究园区)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 研究旨在从跟踪姿态训练以智能体为中心的动物行为自回归模型,引入相关框架及通用库,模型能捕捉果蝇群体社会行为分布,库可支持系统比较并适应新领域。
探索语音、个性与性别在人机交互中的相互作用
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究探讨用户能否通过语音识别人工代理的外向性,并分析感知个性与用户-代理同步性之间的关系,发现女性语音在区分外向性上更有效,而男性语音则不一致。
Journal ref https://www.frontiersin.org/articles/10.3389/fcomp.2026.1855830
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。
在自主商业中建立信任:可验证的全球事件时间线和支持人工智能的欺诈情报层
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究为智能商业提出可验证全球事件时间线,由规范事件模式等四组件构成,还引入欺诈标记和数据集谱系模型。原型实现实证结果显示,其在处理事件速度、验证时间、证明大小及验证性能上有优势。
Comments 18 pages, 4 tables, 1 figure. Preprint also available on Zenodo: https://doi.org/10.5281/zenodo.19060285
用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG
AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。
Comments 98 pages, 4 main figures, and 15 supplementary figures
作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)
AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。
Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试
机构 * Mozilla
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。
基于共识推理的Tsetlin机集成中的自主协作学习
机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。
作为微服务系统中风险约束干预决策的安全修复
机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) ; Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) ; School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。
CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。
Comments 20 pages, 7 figures