Measuring the intelligence of an idealized mechanical knowing agent
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
Comments 17 pages, CIFMA 2019
Journal ref Lecture Notes in Computer Science, vol 12226, 2020
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
Comments 17 pages, CIFMA 2019
Journal ref Lecture Notes in Computer Science, vol 12226, 2020
用于CT扫描中可靠且可审计的空间关系验证的模块化智能体
机构 * Ulm University(乌尔姆大学) ; Ulm University Hospital(乌尔姆大学医院) ; Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) ; TUM University Hospital(慕尼黑工业大学医院) ; Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。
Journal ref Published at the MICCAI 2026 Agentic AI for Medicine Workshop
$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。
Comments 12 pages, 2 figures, 6 tables
同行投票的大语言模型智能体压力测试:发现feed诱导的词汇趋同,但分布式来源无可靠的匹配暴露优势
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究通过PV-SST测试床开展实验,发现同行排名feed会诱导LLM智能体群体的词汇趋同,但未证实分布式来源相比单一来源具有可靠的立场改变优势。
Comments 9 pages, 3 figures. Code, frozen protocol, configurations, summary tables, and data are publicly available at https://github.com/ranausmanai/synthetic-social-networks and https://huggingface.co/datasets/ranausmans/synthetic-social-networks
MaliciousSkillBench:用于恶意智能体技能检测的综合基准
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。
Comments Project page: https://protectskills.github.io/MaliciousSkillBench/
Andy:用于严谨证明与自主研究的数学智能体
机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院) ; Key Laboratory of Intelligent Computing and Applications (Tongji University)(同济大学智能计算与应用重点实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 该研究提出自主数学智能体Andy,以自触发脉冲共识的已发表结果为基础,构建混合控制方案并验证同步条件,展现其提出问题、开发并验证严谨证明的能力。
Comments 20 pages, 4 figures, 3 tables, and 3 algorithms. Research logs, reports, and simulation code are available at https://github.com/mowaiwaim/Andy
SkillResolve-Bench:衡量和解决智能体技能检索中的同能力歧义
机构 * Huawei Technologies Ltd(华为技术有限公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对智能体技能库中同一能力族内不同技能的执行风险,提出SkillResolve-Bench基准和SkillResolve方法,通过候选族解析和代表性选择,在保持高召回率的同时将有害技能暴露率降至0。
Comments Preprint. 21 pages, 3 figures, 6 tables. Supersedes arXiv:2606.10388
基于确定性几何与受约束智能体视觉-语言优化的结构平面图到模型转换
机构 * University of Alberta(阿尔伯塔大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 该研究提出首个无需特定任务检测器训练的结构平面图转模型框架,经100张图基准评估,各构件指标优异,可高效修正绘图错误。
LadderTeam:双智能体阶梯式引出框架
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 LadderTeam是基于双智能体LLM架构的自动化UX线框图访谈框架,采用三种探测策略,经216次模拟访谈验证,实现高收敛率与可执行响应匹配率,且无主题偏离。
Comments 4 pages, 1 figure, 2 tables, Accepted in ACM AI Summit 2026
CARA:认知自适应推荐智能体
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对现有推荐方法未明确建模用户偏好转化为决策的局限,提出认知自适应推荐框架CARA,经亚马逊评论实验,其多数指标性能最优,较基线相对提升最高达10.15%。
BaT:构建具备阶段式评分标准的自演化医学研究智能体
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; NVIDIA(英伟达)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出BaT系统,结合Stage Bank与BiCuRL方法,使医学研究智能体在AutoMedBench-Lite上得分大幅提升,BaT-9B性能优于Claude Opus 4.6。
技能块:智能体应如何加载其技能?预加载、按需工具加载、渐进式披露与混合方式的缓存正确比较
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 该研究比较四种智能体技能加载方法,发现Hybrid等方法可显著减少token使用,且无质量损失,条件加载在技能大部分无需每轮使用时最有益。
智能体评估何时结束?结果终局性与跨单元分离
机构 * University of Michigan Law School(密歇根大学法学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对现有智能体评估将终点分数视为最终结果的问题,该研究提出结果终局性与跨单元分离两个条件,通过实验和协议审查指出当前评估的不足,并提出开放效应记录方案以完善评估。
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL
AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。
SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。
Comments 13 pages, ASE 2026
AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地
机构 * The University of Tokyo(东京大学) ; National Institute for Materials Science(国立材料科学研究所) ; RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.LG
AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。
生成无奖励的评判标准以减少智能体评估中的过度打分
机构 * Trinity College Dublin(都柏林三一学院) ; University College Dublin(都柏林大学学院) ; Dublin City University(都柏林城市大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。
音乐智能体系统:MACAT与MACataRT
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究开发了两款音乐智能体系统MACAT与MACataRT,分别用于智能体主导的表演与协作式即兴创作,基于个性化小数据集训练,以推动以人为核心的交互式生成式AI在音乐创作中的应用。
Comments In Proceedings of the Creativity and Generative AI NIPS (Neural Information Processing Systems) Workshop 2024
CAKE:面向前沿核函数演进的编译器-智能体协同设计
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA(英伟达公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。
CTBench:评估AI智能体在真实电信网络运维中的故障排查能力
机构 * Huawei Technologies(华为技术有限公司) ; Paris Research Center, Huawei Technologies(华为技术有限公司巴黎研究中心) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本研究提出CTBench基准,评估AI智能体的电信故障排查能力,发现其路径恢复表现好于根本原因分析,且资源消耗与诊断效果无必然关联。
REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规
Comments 6 figures, 4 tables. Supplementary material included
首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI
AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。
SkillsMetric:映射恶意智能体技能静态分析的检测边界
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。
Comments 6 pages, 3 figures, 3 tables
TelemetrySuffBench:智能体遥测是否足以用于故障起源诊断?
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 该研究推出TelemetrySuffBench基准,评估五个前沿语言模型的故障起源诊断能力,发现检测与定位存在差距,安全弃权(不执行)具强模型依赖性,需决策-来源链接与弃权保障。
Comments 10 pages, 3 figures, 4 tables
SkillEval:将智能体技能质量分解为可解释信号
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究针对现有智能体技能评估仅反映任务适配性的不足,提出可解释框架SkillEval,其可区分技能质量、关联下游任务性能,还能指导技能修订以提升任务通过率。
PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预
机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) ; Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) ; Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。
基于LLM的智能体评估统一框架的必要性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。
基于智能体的多视角聚合测试断言生成
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。
技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?
机构 * East China Normal University(华东师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL
AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。
对抗智能体系统中的知识篡改:一种拜占庭容错的安全协同RAG框架
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对RAG系统面临的知识篡改攻击问题,提出拜占庭容错的安全协同RAG框架SecureCollaRAG,通过多源知识验证机制与动态GNN可信度评分实现攻击防护,在非IID数据下保持鲁棒性。
Journal ref Proceedings of the ACM Web Conference 2026, pages 2661-2672, 2026