Top-$k$ Pareto Bandits: Hypervolume Regret for Multi-Objective Slate Selection
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
Comments 21 pages, 7 figures, 7 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
Comments 21 pages, 7 figures, 7 tables
CogArena:大语言模型认知能力结构的多方法评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。
Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena
评估强化学习智能体的模糊测试
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE
AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。
具有预算约束的在线公平分配
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究广义分配预算约束下离散公平分配的在线变体,确定有界密度扩展条件并获近似算法,研究资源增强及刻画保证改进,还开发学习增强框架,证明其性质及单独预测边际的不足。
用于海上监视中异构传感器选择的强化学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对异构海上传感器网络单船跟踪问题,提出信息增益引导的强化学习传感器选择框架,通过近端策略优化智能体选传感器,结合贝叶斯跟踪器估计船只状态,经模拟比较,该策略在单传感器激活下性能接近全传感且避免复杂计算。
Comments 5 pages, 4 figures, submitted to the IEEE MetroSea 2026 Conference: Special Session 13: Object Detection, Tracking, and Sensor Fusion for Maritime Situational Awareness
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
电信-GAIA:电信领域智能体的双语基准测试
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; stc(沙特电信公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。
数据准备基准:评估作为训练数据准备者的大语言模型
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究院) ; OriginHub Technology(源创科技)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。
在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试
机构 * Mozilla
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。
CircuitKIT:用于机理可解释性的电路发现、评估和应用工具包
专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.LG
AI总结 介绍CircuitKIT工具包,用于机理可解释性的电路分析。它通过可序列化表示连接工作流程,提供发现算法、声明式接口、电路诊断及应用模块,为电路分析提供通用基础设施,解决了现有方法碎片化问题。
HALLMARK:诊断大语言模型引用验证器中的三种失败模式
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。
Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)
VEHBench:用于大语言模型辅助振动能量采集器设计的阶段局部诊断基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.SE
AI总结 研究针对无电池物联网中振动能量采集器设计,引入VEHBench基准测试,评估大语言模型在耦合物理设计不同阶段的表现,通过763个任务及四个设计角色测试,发现模型能力依赖阶段,为评估、选择等工程大语言模型提供阶段感知基础。
用于大语言模型驱动的GPU内核生成的工具工程
机构 * Baidu, Inc.(百度公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。
Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest
2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛
机构 * University of Memphis(孟菲斯大学) ; QuantaInsight(量子洞察)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。
代码智能体LoRA微调的轨迹数据管理系统评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究代码智能体LoRA微调中轨迹数据管理,提出效率和风格两轴质量评分框架,经16个控制实验评估,揭示规模依赖的质量-数量权衡及错误重试率是主要子维度,为代码智能体监督微调提供可行手段与评估协议。
Comments 12 pages, 2 figures. Author's accepted manuscript of a paper published in the ICIC 2026 proceedings (oral presentation)
Journal ref In: Huang, D.S., Li, B., Zhang, Q., Bao, W. (eds) Advanced Intelligent Computing Technology and Applications. ICIC 2026. Lecture Notes in Computer Science, vol 16669, pp. 39-50. Springer, Singapore (2027)
当模型合并与联合多任务强化学习相抗衡时:任务向量几何分析
机构 * Aimpoint Digital Labs(Aimpoint数字实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究在强化学习中模型合并能否替代联合多任务训练,通过训练Qwen3 - 8B专家并合并,与联合训练模型对比,发现任务向量几何结构中方向和支持解耦,合并效果与联合训练相当,还发布了代码和统计数据。
库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距
机构 * QpiAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。
LessonBench-V1:用于评估人工智能课程生成代理的基准数据集
机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) ; Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。
OOD-RL-Bench:强化学习中分布外检测的基准框架
机构 * Deakin University(迪肯大学) ; Federation University Australia(澳大利亚联邦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对强化学习中分布外检测问题,提出OOD-RL-Bench框架,通过共享接口集成检测器与异常注入器,在LunarLander-v3环境评估其效用,揭示不同异常类型性能差异,还公开相关成果以便重现。
Comments 21 pages, 2 figures
通过人类反馈增强语言模型:自我提升之旅
机构 * Intel Corporation(英特尔公司)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究在信息检索系统中,通过整合辅助反馈RAG系统及人工参与,利用人类反馈优化主RAG系统性能,经多数据集测试验证方法有效,强调了其变革潜力,为自适应信息检索技术研究树立了先例。
Comments AIC 2025: The 10th International Workshop on Artificial Intelligence and Cognition (held as part of ECAI 2025). October 25-26, 2025. Bologna, Italy
高效在线比例采样及其在平滑在线学习中的应用
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究高维域在线比例采样问题,设计支持高效更新和采样的数据结构,在不同对手下证明数据结构深度界,应用于在线学习获高效无悔算法及次线性遗憾保证。
基于强化学习和人工反馈的车联网自适应异常检测
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文针对车联网运行中行为监测的挑战,提出集成强化学习、统计监测和人工反馈的在线异常检测框架,通过自注意力选择检测器、多检测器集成及人工再训练机制,在测试平台上实现持续自适应且避免灾难性遗忘。
Comments Accepted at the 30th IEEE International Conference on Emerging Technologies and Factory Automation (ETFA 2026), Special Session SS10: Evaluation Methods for Autonomous Cyber-Physical Systems' Behavior. 8 pages, 3 figures, 3 tables
全双工语音智能体的LALM音频评判的可靠性评估
机构 * Salesforce Applied AI Research(Salesforce应用人工智能研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究评估Gemini模型作为全双工语音智能体音频评判的可靠性,以Gemini 2.5 Flash为基准与人类评分者对比,测试多个维度,发现其在一些维度表现良好,不同模型有差异,确定部署需谨慎领域,为LALM部署提供实证依据。
Comments 28 pages total (12 main body, 1 reference, 15 appendix). In main body: 2 diagrams, 3 table, 2 charts
软件工程中智能体的可靠且与开发者一致的评估
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型驱动智能体评估技术的局限,提出基于实际软件开发实践的综合评估方法,通过污染感知、实际行为评估及轨迹感知基准指标,来弥合差距,实现可靠且与开发者一致的评估。
Comments International Conference on the Foundations of Software Engineering '26
Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程
机构 * UC San Diego(加州大学圣地亚哥分校) ; Snowflake AI Research(Snowflake人工智能研究院) ; University of Hong Kong(香港大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。
Comments 24 pages, 3 figures, 7 tables
EdgeBench:揭示从真实环境中学习的缩放定律
机构 * ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。
AI辅助软件开发生命周期的三阶段评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。
Flow-A11y:基于流程感知的无障碍性测试
机构 * University of Luxembourg(卢森堡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究现代网页应用因交互流程产生的无障碍性问题,提出Flow-A11y系统,通过在真实浏览器执行流程、记录运行时跟踪等方法,贡献为提高测试准确性及实现动态WCAG标准自动化评估。
使用Incognita评估基于社会分布式任务环境中行动的生成智能体
机构 * RedMind Research(RedMind研究)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。
SMOCS:用于在生产中简化机器学习系统部署、监控和优化的流框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对机器学习模型在运行环境部署维护的挑战,提出基于Kafka的SMOCS框架,通过分层抽象、三线程代理架构和配置驱动部署模型应对,可简化流程,且平台无关、容错、可扩展。