Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation
代理评估中的随机性:通过组内相关系数量化不一致性
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理评估中的随机性:通过组内相关系数量化不一致性
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。
人工智能代理在临床实践中的部署指南
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本文提出了一本面向实践者的指南,旨在解决生成式AI在临床实践中部署的挑战,强调数据整合、模型验证和治理等关键实施工作。
Comments Under review. 7 Tables, 2 Figures
一种通过振荡剪切流变仪评估聚合物悬浮液对活性剂黏弹性响应的协议
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出了一种通过振荡剪切流变仪评估活性剂对聚合物悬浮液黏弹性响应的协议,利用游泳行为与振荡板的对应关系,实现对黏弹性特性的量化分析。
AgriGPT-VL:农业视觉-语言理解套件
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。
VisChainBench: 一个多轮多图视觉推理基准,超越语言先验
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。
Comments 12 pages,13figures
AI驱动的逆合成回溯的普罗克鲁斯床:可重复评估的统一框架
机构 * Yale University(耶鲁大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RetroCast框架,通过标准化评估基础设施,揭示了基于搜索和序列的方法在可解性与路线质量上的差异,并释放了标准化数据库以促进可重复发展。
Comments 11 pages + 7 pages of SI. RetroCast is available on GitHub, see https://github.com/ischemist/project-procrustes. SynthArena is publicly available, see https://syntharena.ischemist.com/
一种基于深度学习的自适应多层蜜罐架构用于威胁行为分析
机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于深度学习的自适应多层蜜罐架构,通过强化学习实现威胁行为分析,旨在提高威胁情报质量并降低运营成本。
利用大语言模型实现离散控制器综合的自动语法错误修复
专题命中 Agent评测 :workflow(abstract);分类 cs.SE
AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。
BEDI:一种用于无人机上具身智能体评估的综合基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。
测绘MLLM景观:当前调研的元综述
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Indiana University(印第安纳大学) ; Purdue University(普渡大学) ; Emory University(埃默里大学) ; Sichuan University(四川大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; AppCubic ; Kyoto University(京都大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Rutgers University(罗格斯大学) ; National Taiwan Normal University(台湾师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL
AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。
Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions
MAVERIX:多模态音频视觉评估与识别指数
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。
Journal ref AAAI 2026
基于竞赛的绩效评估与系统性误分配:为什么强制排名系统产生随机结果
专题命中 Agent评测 :agent(abstract,comments)
AI总结 本文揭示强制排名系统因系统性误分配导致随机结果,指出其无法有效解决委托-代理问题,反而加剧了分配误差。
Comments 31 pages, 6 tables. Agent-based simulation demonstrating structural allocation failures in tournament-based forced distribution evaluation mechanisms. Includes sensitivity analyses across team bias levels, alternative distributions, and cutoff percentages
非单调流函数情况下的Kružkov型唯一性定理及其在瑞利问题解中的应用
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种非单调流函数下的Kružkov型唯一性定理,用于分析具有S型流函数的瑞利问题解的结构分类。
魔法城:基于语言的美学自适应城市生成与可控3D资产和布局
机构 * Sun Yat-sen University(中山大学)
专题命中 Agent评测 :agent(abstract)
AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。
Comments 13 pages, 6 figures
突破性成果的筛选
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了如何通过实物分配激励技术突破的及时披露,并应用于失业保险计划的设计。
Journal ref Theoretical Economics (2025), 20(4), 1323-1365