Artificial Organisations
人工组织
机构 * University of Southampton(南安普顿大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
人工组织
机构 * University of Southampton(南安普顿大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。
Bench-MFG:用于在平稳均场博弈中学习的基准测试套件
机构 * University of Cambridge(剑桥大学) ; NYU Shanghai(纽约大学上海分校) ; NYU Center for Data Science(纽约大学数据科学中心) ; Earth Species Project(地球物种计划) ; NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai(纽约大学上海分校数学科学研究所)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 Bench-MFG提出了一套用于评估MFG学习方法的基准测试套件,通过分类问题类型和生成随机实例,提供标准化的实验框架和评估指南。
一个增强科学表格及图表分析的代理
机构 * College of William \& Mary ; The Allen Institute for AI (AI2)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。
世界工作流:一个将世界模型引入企业系统的基准
专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。
生成本体:当结构化知识学会创造
机构 * Dynamind Research(Dynamind研究)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 生成本体通过融合本体结构与LLM创造力,实现结构化知识生成,展示了在桌游设计中的有效性及跨领域应用潜力。
Comments 19 pages, 12 figures, 8 tables. v2: added empirical evaluation (3 studies: ablation, benchmark, reliability), expanded related work, discussion section, appendices. Code available at https://github.com/bennycheung/GameGrammarCLI
ComfyBench:在ComfyUI中基于LLM的代理自主设计协作AI系统的基准测试
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 ComfyBench通过评估基于LLM的代理在ComfyUI中自主设计协作AI系统的能力,提出ComfyAgent框架,展示其在任务解决中的性能与潜力。
IntentRL: 通过强化学习训练主动的用户意图代理以进行开放性深度研究
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 IntentRL通过强化学习训练主动用户意图代理,提升开放性深度研究的意图识别与任务性能。
Comments Preprint
从任务解决到在LLM代理中的鲁棒现实适应
机构 * Megagon Labs(梅加戈恩实验室)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了LLM代理在现实环境中的鲁棒适应能力,发现任务解决与实际部署鲁棒性存在显著差距,揭示了在部分可观测性和噪声环境下代理的决策挑战。
PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估
机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。
ASP-Bench: 从自然语言到逻辑程序
机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。
BMG-Q:局部双图匹配图注意力Q学习用于拼车订单调度
机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系) ; Intelligent Transportation Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)智能交通 thrust,系统中心) ; Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(香港理工大学航空与航空工程系)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 BMG-Q通过局部双图匹配图注意力Q学习提升拼车订单调度的决策效率与鲁棒性。
Journal ref IEEE Transactions on Intelligent Transportation Systems ( Volume: 26, Issue: 10, October 2025)
TOM-SWE:软件工程代理的用户心理建模
机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。
Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法
机构 * Google(谷歌) ; Google DeepMind(谷歌DeepMind) ; Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。
Comments Accepted to C4ML@CGO'26
OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。
Comments 23 pages
MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准
机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。
辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估
机构 * Martian ; NUS(新加坡国立大学) ; MIT(麻省理工学院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG
AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。
Journal ref EACL 2026
终端基准:在命令行界面中对硬、现实任务的智能体基准测试
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 终端基准2.0通过89个计算机终端环境中的硬任务,评估智能体在现实任务中的表现,并揭示模型改进方向。
由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势
机构 * Communication University of China(中国传媒大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。
DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。
Comments 6 pages, 5 figures
更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。
Comments 36 pages, 14 figures
LLM Review: 通过盲审同行反馈增强创造性写作
机构 * Harvard University(哈佛大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。
AutoContext:LLM代理的实例级上下文学习
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 AutoContext通过解耦探索与任务解决,为LLM代理构建结构化的实例上下文,显著提升了任务执行效率。
证明时间:评估科学思想判断的基准
机构 * Harvard University(哈佛大学) ; Mass General Brigham(麻省总医院) ; Boston Children’s Hospital(波士顿儿童医院) ; Brandeis University(布兰迪大学) ; Yale University(耶鲁大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL
AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。
Comments under review
自我验证就是通过日本司法考试所需
机构 * Keio University(.keio大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。
半重叠多臂老虎机最佳臂识别用于序列支持网络学习
机构 * Department of Artificial Intelligence and Systems Engineering(人工智能与系统工程系) ; Budapest University of Technology and Economics(布达佩斯技术与经济大学) ; E-Group ICT Software Zrt.(E-Group ICT软件公司)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出半重叠多臂老虎机模型,用于高效学习支持网络,改进多老虎机最佳臂识别的误差界并提升性能保证。
Comments 29 pages, 2 figures
针对计算流体力学模拟的大型语言模型微调
机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) ; HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。
Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)
利用大语言模型对生物医学文本进行plain language改编:评估指标的比较
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。
Comments 5 pages, 1 figure
SoMe:一种用于基于大语言模型的社会媒体代理的现实基准
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。
Comments Accepted by AAAI 2026
数学与编码是通用AI的通用基准
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了数学和编码在AI评估中的通用性,证明了编码任务在电池空间中的稠密性,而纯数学并非如此,揭示了形式数学作为递归自我改进的自然起点。
AI透明度地图:框架、评分与实时模型卡片评估流程
机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) ; Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。