PromptMN: Pseudo Prompting Language
PromptMN: 伪提示语言
机构 * ICT Group(ICT集团)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出PromptMN,一种伪提示领域特定语言,通过紧凑的%前缀类型指令注释自然语言,减少上下文歧义,提升人机交互的清晰度和可审查性。
Comments 32 pages, 2 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
PromptMN: 伪提示语言
机构 * ICT Group(ICT集团)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出PromptMN,一种伪提示领域特定语言,通过紧凑的%前缀类型指令注释自然语言,减少上下文歧义,提升人机交互的清晰度和可审查性。
Comments 32 pages, 2 figures
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权
机构 * West Virginia University(西弗吉尼亚大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。
Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026
标签并非终点:MCP智能体安全评估中的处理泄露与构念效度
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 本研究针对MCP智能体安全评估中标签与行为事实的偏差问题,通过审计留存评估活动发现处理泄露现象,提出七环节完整性链及端点完整性检查器,完成活动受限的测量审计。
Comments 24 pages, 10 figures, 4 tables. Preprint
FastThaiG2P:面向语音智能体流水线的极速泰语字素转音素转换工具
机构 * AWS(亚马逊云科技)
专题命中 Agent评测 :agent(title);分类 cs.CL
AI总结 FastThaiG2P是一款极速泰语字素转音素转换工具,采用PyThaiNLP分词字典与归一化规则,亚毫秒级延迟,可支撑泰语TTS开发,经其处理的数据集训练出的StyleTTS 2模型合成语音清晰,实时率达0.25。
提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移
机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 Agent评测 :agentic(title);分类 cs.CL
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配
机构 * Università di Pisa(比萨大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。
淹没在例行公事中:多轮智能体训练中的信号稀释
机构 * Mila - Qu\'ebec AI Institute
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 本文提出决策密度ρ的概念,揭示多轮智能体训练中例行轮次导致信号稀释,并推导出轨迹级信噪比与ρ^{-1/2}成比例,实验验证了该缩放关系。
Comments Accepted at the FAGEN Workshop at ICML 2026, Seoul, South Korea. 14 pages, 9 figures
MiroBench:真实世界讨论的智能体模拟真实性基准测试
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Starc.Institute(Starc研究院)
专题命中 Agent评测 :agentic(title);分类 cs.AI
AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。
ProofJudge:基于工具的大语言模型(LLM)对Mathlib中形式化证明质量的评估工具
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出ProofJudge系统,通过智能体式LLM从五个维度评估Mathlib形式化证明质量,在218个声明数据集上验证其与人类偏好对齐度,发布开源制品支持相关研究。
Comments 4 pages, 1 figure, 1 table
提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析
机构 * Shenzhen Technology University(深圳技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang Lab(之江实验室) ; The Chinese University of Hong Kong(香港中文大学) ; HKUST (Guangzhou)(香港科技大学(广州))
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL
AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。
DeltaML-Bench:基于真实研究仓库评估机器学习智能体
机构 * Algorithmic Research Group(算法研究组)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究推出DeltaML-Bench基准,评估发现基于搜索的ARG框架可提升GPT-5在机器学习实验任务中的成功率,且能避免规范博弈,为自主ML智能体部署提供了关键考量
Comments 18 pages, 3 figures, 12 tables. Code and benchmark: https://github.com/AlgorithmicResearchGroup/deltaml-bench-public
绝非数字:将答案作为事实使用的AI系统的结构弃权
机构 * Apple Inc.(苹果公司)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。
Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics
DiG-bench:游戏中的发现
专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本研究发布DiG-bench基准,含70个需智能体通过交互实验发现规则的游戏,设7个难度级,部分公开部分私有,用于评估智能体在目标未知环境中发现新知识的能力。
迈向具身智能体的管控
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。
Comments Project page: https://eit-hai.github.io/thea
DuplexWorld:语音智能体能帮你度过一天吗?
机构 * Centific Global Solutions Inc.(森蒂菲克全球解决方案公司) ; University of Maryland(马里兰大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 DuplexWorld针对现有语音智能体评估基准的不足,构建含六大领域的156个场景开展评估,发现现有最优语音智能体在多维度仍有较大改进空间,并分析了相关性能与失败模式。
Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。
Comments 49 pages, technical report
TRACE:用于自动化上下文工程的轨迹归因
机构 * Amazon(亚马逊公司)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 TRACE是利用历史智能体轨迹挖掘上下文故障的自动化反馈循环,可在上下文层诊断修复超80%的生产AI智能体故障,归因率72.7%、修复有效性82%。
Comments 21 pages, 5 figures, 11 tables
重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。
Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories
LiveEvalBench:面向网页生成的开放世界评估
专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察
RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审
机构 * Shandong University(山东大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL
AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。
基准测试并非验证:金融大语言模型应用的系统级视角
机构 * Prometeia S.p.A.(普罗米特亚公司)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL、cs.SE
AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。
KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试
机构 * Beijing Normal University(北京师范大学) ; Beijing Jiaotong University(北京交通大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Peking University(北京大学) ; BAAI(北京智源人工智能研究院)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。
Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench
基于验证器的基准协同进化的自修改精益证明智能体
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 研究设计有效精益证明智能体的挑战,提出自进化精益证明智能体,其工作区可变,与基准协同进化,通过特定更新机制保持分数可比,经实验验证该方法能有效改善精益证明工作流程。
Comments 22 pages, 2 figures, 3 tables
EvoClawBench:智能体能否从自身运行中学习可复用技能?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Hithink Research(同花顺研究院)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE
AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。
YUKTI:从自然语言情境到稳健、可验证的决策——一种不确定性类型的命题IR、假设稳健帕累托前沿和遗憾证书
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究从自然语言情境生成稳健决策,核心方法是用类型命题图表示,经多求解器及分布帕累托交接耦合,并引入ARPF等。主要贡献是证明rho与决策遗憾关系,增加可追溯性,合成数据基础,通过多种验证方式展示方法有效性。
Comments 19 Pages , 21 figures
SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试
机构 * Duke Kunshan University(杜克昆山大学)
专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。
LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准
机构 * Aalto University(阿尔托大学) ; Tencent(腾讯) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Hong Kong Polytechnic University(香港理工大学) ; Aarhus University(奥胡斯大学) ; Technical University of Munich(慕尼黑工业大学)
专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。
Comments 34 pages with 8 figures
RLVP:惩罚路径,奖励结果
机构 * Pine AI(松果人工智能公司) ; University of Washington(华盛顿大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究在现实世界中智能体在线学习面临的挑战,提出“惩罚路径,奖励结果”方法,能在几乎零违规情况下实现高任务成功率,并给出有效惩罚的设计规则。