EgoTaskQA: Understanding Human Tasks in Egocentric Videos
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Published at NeurIPS Track on Datasets and Benchmarks 2022
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Published at NeurIPS Track on Datasets and Benchmarks 2022
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
Comments ICLR 2021; Data, code, and videos are available at alfworld.github.io
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
Comments Journal extension of the ICRA2020 paper (arXiv:1911.04074)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
Comments Transportation, Springer Verlag, 2019
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 14 pages, 8 figures; Accepted by IEEE/ACM TRANSACTIONS ON AUDIO, SPEECH, AND LANGUAGE PROCESSING
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract)
Comments Paper presented at the Symposium on Applied Urban Modelling. Cambridge, England. June 27-29, 2018. arXiv admin note: substantial text overlap with arXiv:1802.09335
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 23 pages, 18 figures, CVPR 2017 camera-ready, results on VisDial v0.9 dataset, Webpage: http://visualdialog.org
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。
Comments Preprint
TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权
机构 * West Virginia University(西弗吉尼亚大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。
Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026
标签并非终点:MCP智能体安全评估中的处理泄露与构念效度
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 本研究针对MCP智能体安全评估中标签与行为事实的偏差问题,通过审计留存评估活动发现处理泄露现象,提出七环节完整性链及端点完整性检查器,完成活动受限的测量审计。
Comments 24 pages, 10 figures, 4 tables. Preprint
FastThaiG2P:面向语音智能体流水线的极速泰语字素转音素转换工具
机构 * AWS(亚马逊云科技)
专题命中 Agent评测 :agent(title);分类 cs.CL
AI总结 FastThaiG2P是一款极速泰语字素转音素转换工具,采用PyThaiNLP分词字典与归一化规则,亚毫秒级延迟,可支撑泰语TTS开发,经其处理的数据集训练出的StyleTTS 2模型合成语音清晰,实时率达0.25。
单循环智能体自摘要下的AI安全护栏存续性
专题命中 Agent评测 :agentic(title);分类 cs.AI
AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。
DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?
机构 * IBM Research(IBM研究院)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。
提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移
机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。
领域感知智能体技能检索
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 本研究针对终身学习智能体技能检索瓶颈,提出领域感知的技能表示方法,通过保留技能的多字段结构计算相似度,在 SkillRet 和 SRA-Bench 基准上取得优于拼接基线的检索效果,且优势随技能库规模增大而提升。
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 Agent评测 :agentic(title);分类 cs.CL
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准
机构 * National Taiwan University(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。
Comments 19 pages
PAIR:面向多轮代理优化的前缀感知内部奖励模型
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。
Comments Under Review
一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配
机构 * Università di Pisa(比萨大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。
版权法合规性的智能体评估
专题命中 Agent评测 :agentic(title);分类 cs.CL
AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。
Comments ICML 2026 Spotlight
边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征
机构 * Biocomplexity Institute(生物复杂性研究所)
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。
Comments 28 pages, 10 figures, preliminary version; not final
淹没在例行公事中:多轮智能体训练中的信号稀释
机构 * Mila - Qu\'ebec AI Institute
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 本文提出决策密度ρ的概念,揭示多轮智能体训练中例行轮次导致信号稀释,并推导出轨迹级信噪比与ρ^{-1/2}成比例,实验验证了该缩放关系。
Comments Accepted at the FAGEN Workshop at ICML 2026, Seoul, South Korea. 14 pages, 9 figures
使用本体约束的LLM代理自动化标准化遗留生物医学元数据
机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) ; Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。
BadScientist: 研究代理能否写出令人信服但不严谨的论文来欺骗LLM审稿人?
机构 * University of Washington(华盛顿大学) ; King Abdulaziz City for Science and Technology(卡布斯科学与技术城) ; HUMAIN
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 提出BadScientist框架,通过无需真实实验的呈现操纵策略生成造假论文,揭示LLM审稿系统存在系统性漏洞,造假论文接受率高达一定水平,且审稿人存在“担忧-接受冲突”,当前检测方法效果有限。
Comments ACL 2026; Project Page at https://bad-scientist.github.io/
MiroBench:真实世界讨论的智能体模拟真实性基准测试
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Starc.Institute(Starc研究院)
专题命中 Agent评测 :agentic(title);分类 cs.AI
AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。
技能图谱:面向大规模智能体技能的依赖感知结构检索
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学) ; Brown University(布朗大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Lehigh University(莱斯大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。
Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills
AlignEvoSkill: 迈向知识感知与任务对齐的智能体技能进化
机构 * Singapore Management University(新加坡国立大学)
专题命中 Agent评测 :agent(title);分类 cs.CL
AI总结 提出AlignEvoSkill框架,通过联合建模知识覆盖和任务对齐,从失败轨迹中识别知识标签、检索并适配候选技能,再基于知识覆盖和任务对齐分数筛选高质量技能,在3个基准和4个LLM骨干上相对提升34.7%,实现技能进化新SOTA且成本更低。
为什么你的深度研究智能体会失败?关于完整研究轨迹中的幻觉评估
机构 * Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 针对深度研究智能体(DRA)在完整研究轨迹中累积的幻觉问题,提出从结果评估转向过程感知评估的PING分类法和细粒度评估框架,并构建DeepHalluBench基准,实验揭示系统性的可靠性差距。