Contracting a crowd of heterogeneous agents
对异质群体的合同设计
专题命中 Agent评测 :agent(summary_cn,abstract)
AI总结 本文研究了大规模异质群体的最优合同设计问题,通过线性二次框架分析有限群体和连续极限问题,得到显式的最优合同和均衡努力,并证明了连续合同可以基于大样本评估以获得近似合同,从而在多 agent 交互场景中提供可扩展的近似方法。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
对异质群体的合同设计
专题命中 Agent评测 :agent(summary_cn,abstract)
AI总结 本文研究了大规模异质群体的最优合同设计问题,通过线性二次框架分析有限群体和连续极限问题,得到显式的最优合同和均衡努力,并证明了连续合同可以基于大样本评估以获得近似合同,从而在多 agent 交互场景中提供可扩展的近似方法。
在大型语言模型上进行深度数据研究:评估深度数据研究
专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。
Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026
KISS - 地球科学的科学模拟知识基础设施:一种智能体的支架
机构 * State Key Laboratory of Water Disaster Prevention, Hohai University, Nanjing(水利灾害预防国家重点实验室,河海大学,南京) ; Yangtze Institute for Conservation and Development, Hohai University, Nanjing(长江保护与发展研究院,河海大学,南京) ; Department of Bioresource Engineering, McGill University, Sainte-Anne-de-Bellevue, Quebec, Canada(生物资源工程系,麦吉尔大学,圣安妮-德-贝尔贝夫,魁北克,加拿大) ; Ottawa Research and Development Centre, Agriculture & Agri-Food Canada, Ottawa, Ontario, K1A 0C6, Canada(渥太华研发中心,加拿大农业与食品部,渥太华,安大略,K1A 0C6,加拿大) ; College of Water Conservancy and Hydropower Engineering, Hohai University, Nanjing(水利水电工程学院,河海大学,南京) ; Meta Platforms Inc.(Meta平台公司) ; Nanjing Hydraulic Research Institute, Nanjing(南京水利研究院)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本文提出KISS,一种用于科学模拟的知识基础设施,通过将专业知识外化为经过验证的建模操作符、分阶段的领域协议和诊断恢复机制,使智能体能够生成物理合理且可验证的端到端模拟,从而降低非专业用户与过程模拟之间的接入门槛,并促进建模社区的整合。
STRIDE:一种用于可靠自动方程发现的自反思代理框架
机构 * Central South University(中南大学) ; Pengcheng Laboratory(鹏城实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出STRIDE框架,通过协调数据感知生成、混合拟合评估、批评-执行器修复和多样性保持语义记忆,提升自动方程发现的可靠性,实验表明其在多个LLM基础上提升了准确性、OOD鲁棒性和结构恢复能力。
Comments 23 pages, 15 figures
一种随机代理模型用于模拟肿瘤-免疫动态并评估治疗策略
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出一种随机代理模型,整合细胞异质性、空间细胞间相互作用和药物抗性进化,用于模拟肿瘤生长和免疫反应,并评估不同治疗策略的效果。
Comments 26 pages, 13 figures
Journal ref MBE, 2026, 23(5):1402-1436
为AI控制的集束监控:多样信号胜过更多计算
机构 * Yale University(耶鲁大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。
PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; Microsoft Research Asia(微软亚洲研究院) ; Microsoft Gaming(微软游戏) ; Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。
Comments ACL 2026 Findings
TOBench:面向真实世界工具使用代理的任务导向多模态基准
机构 * Nanjing University(南京大学) ; Huazhong University of Science and Technology(华中科技大学) ; Southwest Jiaotong University(西南交通大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。
Comments Github: https://github.com/Pi3AI/TOBench
抑制注意力:因果注意力门控用于自动驾驶中的鲁棒轨迹预测
机构 * University of Alberta(阿尔伯塔大学) ; Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大诺亚实验室) ; Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.LG
AI总结 本文提出CRiTIC模型,通过因果发现网络识别agent间因果关系,并引入因果注意力门控机制提升轨迹预测的鲁棒性和泛化能力,实验表明模型在对抗非因果扰动时鲁棒性提升54%。
Comments Accepted ICRA 2025
MLReplicate:用于机器学习可重复性自主研究系统的基准测试
机构 * TIB—Leibniz Information Centre for Science and Technology(蒂宾根-莱比锡信息科学与技术研究中心) ; L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心)
专题命中 Agent评测 :agent(abstract,abstract_cn);workflow(abstract);分类 cs.LG
AI总结 本文提出MLReplicate基准测试,评估自主研究系统在机器学习可重复性方面的性能,发现计算规模并非决定性因素,且系统间存在显著差距。
OmniCode: 一个评估软件工程代理的基准
机构 * Cornell University(康奈尔大学) ; Independent contributor(独立贡献者) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; Jadavpur University(贾瓦伊普尔大学) ; New York University(纽约大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。
LLMs能否像消费者一样思考?通过ConsumerSimBench进行大众级反应重建的基准测试
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出ConsumerSimBench基准,通过1553个真实中国社交媒体话题和23122个原子化、规则审核过的标准,评估LLM在模拟消费者反应方面的能力,揭示了前沿模型在预测高语境中文消费者讨论中实际关心内容方面的不足。
CrossView Suite: 利用数据集、模型和基准 harnessing MLLMs 的跨视图空间智能
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 该研究提出CrossView Suite,通过开发CrossViewSet、CrossViewBench和CrossViewer三个组件,解决跨视图推理中的数据稀缺、评估不足和对齐机制缺失问题,提升多视图空间理解能力。
超越扩展:智能体正走向边缘
机构 * University of Cambridge(剑桥大学) ; University of Macau(澳门大学) ; Nanjing University(南京大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG
AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。
Causely: 企业AI中的因果智能层 一项关于SRE和可靠性工作流的基准研究
机构 * Causely
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出Causely,一种企业AI的因果智能层,通过维护环境拓扑、属性依赖性和因果关系的结构化表示,为AI代理提供语义和因果基础,以诊断、评估影响并安全地在生产环境中操作。通过在受控环境下注入故障的24微服务OpenTelemetry演示应用进行基准研究,评估了Causely的价值主张。
基于大语言模型的教育代理的综述
机构 * Department of Education and Human Services, College of Education, Lehigh University(教育与人类服务学院,教育学院,莱维大学) ; Department of Community and Global Health, College of Health, Lehigh University(社区与全球健康学院,健康学院,莱维大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文综述了大语言模型在教育环境中的应用,探讨了教育代理的设计维度、发展趋势及研究空白,为未来研究提供指导。
ClawForge: 为命令行代理生成可执行的交互式基准测试
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Southern California(南加州大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。
《白兔在奇幻世界:在线自监督动态发现用于可执行世界模型》
机构 * Korea University(韩国大学) ; Kyung Hee University(庆熙大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 该研究探讨了在先验错配情况下,如何通过交互证据自监督学习可执行世界模型,引入了Alice系统,通过失败的候选更新作为结构信号,发现并改进动态,从而提升可执行世界模型的学习效果。
WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Stanford University(斯坦福大学) ; The University of Hong Kong(香港大学) ; Princeton University(普林斯顿大学) ; Chinese Academy of Sciences(中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 Agent评测 :planning(abstract,abstract_cn)
AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。
CLARA: 一个增强分析仪表盘,用于协作素养
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文提出CLARA,一种基于语义推理和增强的智能分析系统,通过提取转录文本的语义表示作为分析工具,提升协作质量评估和检索性能。
Comments 15 pages, 1 figure. Accepted at AIED 2026
ClawGym:一种构建有效Claw代理的可扩展框架
机构 * Gaoling School of Artificial Intelligence(人工智能学院) ; Renmin University of China(中国人民大学) ; IQuest Research(IQuest研究) ; Beihang University(北航)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出ClawGym框架,用于构建Claw式个人代理的全生命周期,通过合成可验证训练数据和强化学习方法提升代理效能。
DocReward: 一种用于文档结构化和风格化的文档奖励模型
机构 * CUHK(香港大学) ; UCAS(中国科学技术大学) ; XJTU(西安交通大学) ; UMich(密歇根大学) ; Microsoft(微软)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出DocReward,一种用于评估文档结构和风格的奖励模型,通过构建包含117,000对文档的DocPair数据集,采用Bradley-Terry损失训练,有效提升了文档生成的结构和风格专业性。
CounterRefine:用于事实问答中推理时知识修复的答案条件计数证据检索
机构 * Ryquo ; App-In Club
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 CounterRefine通过在推理时检索特定证据并进行约束性修正,提升事实问答的准确性,实验表明其在多个基准测试中有效改进了基础模型的表现。
Comments Accepted at the 4th Workshop on Towards Knowledgeable Foundation Models at ACL 2026
LEAF:一个用于事件增强预测的活体基准
机构 * Google(谷歌) ; University of Virginia(弗吉尼亚大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LEAF,首个用于事件增强预测的活体基准,通过递归检索代理系统和双代理交叉验证,提供全面相关文本辅助预测,评估LLM在复杂真实场景中的预测能力。
Comments 12 tables, 6 figures, 39 pages
当动作消失时:自我对战强化学习中的对抗性动作移除
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究了自我对战强化学习中的对抗性动作遮蔽,发现学习的遮蔽比随机遮蔽和学习扰动基线更具破坏性,揭示了动作可用性作为自我对战RL中的新鲁棒性表面。
Comments 17 pages, 2 figures, 18 tables
SkillGenBench: 评估LLM代理技能生成流水线的基准测试
机构 * SJTU(上海交通大学) ; XJTU(西安交通大学) ; NUS(新加坡国立大学) ; QuantaAlpha(量子Alpha) ; THU(清华大学) ; SUFE(上海财经大学) ; NTU(国立.ntu) ; PKU(北京大学) ; UCAS(中国科学技术大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。
SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Pacific Northwest National Laboratory(太平洋西北国家实验室) ; National Renewable Energy Laboratory(国家可再生能源实验室)
专题命中 Agent评测 :tool use(abstract);分类 cs.AI
AI总结 该研究提出SCICONVBENCH基准,用于评估LLM在计算科学任务公式化中的多轮澄清能力,重点在于获取缺失信息和解决请求中的矛盾,通过结构化任务本体和基于标准的评估框架,系统测量LLM在澄清行为、对话基础性和最终规格忠实度三个维度上的表现。
并非你所要求的:家庭机器人操作中的字体攻击
机构 * Cyber Security Lab(网络安全实验室) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; State College, USA(州立学院,美国)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。
Comments 10 pages, 1 figure, IEEE conference format
ScarfBench:企业Java应用跨框架应用迁移的基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本文提出ScarfBench,一个用于评估企业Java应用跨框架迁移行为保持性的基准测试,通过专家编写实现三元组,涵盖Spring、Jakarta EE和Quarkus框架,生成102个变体和204个定向重构任务,评估了五种最先进的编码代理,并揭示了不同框架方向和架构层的难度差异。
TeleCom-Bench: 大型语言模型在工业电信应用中还有多远?
机构 * ZTE Corporation(中兴通讯)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出TeleCom-Bench,一个包含12个评估集和22678个精选样本的全面基准,旨在评估大型语言模型在电信领域的综合能力,揭示其在工业流程中的执行能力缺口。
Comments Accepted by KDD 2026