arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 432 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 74 篇

2603.09551 2026-05-27 cs.CV 50%

GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision

GeoSolver: 利用细粒度过程监督扩展遥感中的测试时推理

Lang Sun, Ronghao Fu, Zhuoran Duan, Haoran Liu, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology(计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出GeoSolver框架,通过构建大规模过程监督数据集Geo-PRM-2M和训练过程奖励模型GeoPRM,结合过程感知树GRPO强化学习算法,实现遥感中可验证的逐步推理,在多个基准上达到最优性能并支持测试时扩展。

Comments Code: https://github.com/yourname/GeoSolver

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07996 2026-05-27 cs.CV 50%

Structured Relational Reasoning for Group Activity Assessment

结构化关系推理用于群体活动评估

Thinesh Thiyakesan Ponbagavathi, Chengzheng Yang, Alina Roitberg

机构 * University of Stuttgart(斯图加特大学) University of Hildesheim(希尔德斯海姆大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出ProGraD框架,利用冻结视觉基础模型和轻量级GroupContext Transformer,通过结构化关系推理在单次前向传播中联合推断群体位置、成员关系和活动,仅用10M参数即在Cafe和Social-CAD基准上取得最优性能。

Comments Accepted to CVPR 2026 Workshop (SAUAFG)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 87 篇

2605.25510 2026-05-27 cs.CL 92%

The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models

好奇心时代遇上AI时代:大型语言模型中的儿童安全基准测试

Samee Arif, Angana Borah, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对7-11岁儿童使用LLM的安全性问题,提出基于发展心理学的KIDBench基准,通过隐式线索和显式年龄指令提升安全性,并开发了儿童安全评估器KIDGuardLlama和响应模型KIDLlama。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23651 2026-05-27 cs.CL 92%

How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

大型语言模型有多像人类?一个语域感知的语言评估框架

Björn Nieth, Marianna Gracheva, Michaela Mahlberg, Bjoern Eskofier, Emmanuelle Salin

机构 * Department Artificial Intelligence in Biomedical Engineering (AIBE)(人工智能生物医学工程系) Department of Digital Humanities and Social Studies (DHSS)(数字人文与社会科学系) University of Birmingham(伯明翰大学) Chair of AI-supported Therapy Decisions(人工智能支持治疗决策教授职位) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute of AI for Health, Helmholtz Zentrum München(健康人工智能研究所,海德堡中心慕尼黑)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一个基于语域感知的评估框架,通过比较人类参考语料库与LLM生成文本的词汇语法特征分布(使用最大均值差异和Biber的67个特征),发现LLM偏离人类基线,且最接近人类的模型取决于语域而非模型大小。

Comments 8.5 pages (main) + 31 pages appendix, 29 figures, 10 tables. Code and data: https://github.com/BjoernNieth/Register_Aware_LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07085 2026-05-27 cs.HC cs.AI cs.CY 92%

The AI Cognitive Trojan Horse: How Large Language Models May Bypass Human Epistemic Vigilance

AI认知特洛伊木马:大型语言模型如何绕过人类认知警觉

Andrew D. Maynard

机构 * School for the Future of Innovation in Society, Arizona State University(未来创新社会研究所,亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出“认知特洛伊木马”假说,认为LLM通过优化产生的“诚实非信号”特征(流畅性、帮助性、表面无私)可能绕过人类进化出的认知警觉机制,导致用户高估其可信度。

Comments 16 pages, 20 references. v2: Added brief discussion situating "honest signals" terminology in evolutionary biology (Sec. 3), with two added citations (Zahavi 1975; Maynard Smith & Harper 2003). No changes to argument or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26955 2026-05-27 cs.CL cs.AI 92%

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

JuICE:评估LLM裁判识别文化错误的基准

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh

机构 * KAIST(韩国科学技术院) Google(谷歌) Universitas Gadjah Mada(加查马达大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出JuICE基准,包含7470个文化语言错误标注的多语言数据集,用于评估LLM裁判在长文本中识别深层文化错误的能力,发现最强模型F1仅0.52且常遗漏本地人易识别的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27083 2026-05-27 cs.CL cs.CR 92%

On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning

反事实知识训练在LLM遗忘中的隐藏代价

Xiaotian Ye, Xiaohan Wang, Mengqi Zhang, Shu Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络计划、人工智能研究所、中国科学院自动化研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现反事实微调(CFT)在LLM遗忘中存在知识冲突和幻觉溢出两大问题,并引入扩展基准RWKU+及诊断工具进行系统分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26770 2026-05-27 cs.CL 92%

Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids

质量而无用:LLM生成的XAI叙事作为信任启发而非决策辅助

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Alexander Silbersdorff, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) Hochschule Bielefeld(比勒菲尔德大学) TU Clausthal(Clausthal 技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过五个受控实验,研究LLM生成的高质量自然语言解释在时间序列能源预测中是否提升任务准确性,发现解释不改善准确性但膨胀自信,存在质量-有用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03089 2026-05-27 cs.CL cs.AI cs.LG 91%

Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information

基于受控保留信息的仅解码器LLM归因忠实性评估

Xin Huang, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有软扰动忠实性指标因保留词数不同导致评估偏差的问题,提出π-Soft-NC和π-Soft-NS框架,通过控制期望保留概率公平比较归因方法,并引入专用于自回归解码器LLM的梯度归因方法Grad-ELLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13626 2026-05-27 cs.LG 91%

Benchmark Leakage Trap: Can We Trust LLM-based Recommendation?

基准泄露陷阱:我们能信任基于LLM的推荐吗?

Mingqiao Zhang, Qiyao Peng, Yinghui Wang, Hongtao Liu, Yumeng Wang

机构 * Nanjing University(南京大学) Tianjin University(天津大学) Beijing Institute of Control and Electronic Technology(北京控制与电子技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文识别并研究了基于大语言模型的推荐系统中基准数据泄露问题,通过模拟多种泄露场景揭示了泄露对性能评估的误导性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06580 2026-05-27 cs.CL 91%

Stylistic Evolution and LLM Neutrality in Singlish Language

新加坡英语中的文体演变与LLM中立性

Linus Tze En Foo, Weihan Angela Ng, Wenkai Li, Lynnette Hui Xian Ng

机构 * Independent Researcher(独立研究者) ETH Zürich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析十年间非正式数字信息的文体变化,研究大型语言模型(LLM)能否生成时间中立的输出,发现文体可分离性随时间距离增加,且LLM在真实性和时间中立性之间存在结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15073 2026-05-27 cs.AI cs.CL 91%

Multi-Agent Causal Discovery Using Large Language Models

多智能体因果发现使用大型语言模型

Hao Duong Le, Xin Xia, Haijie Xu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出多智能体因果发现框架MAC,通过元融合机制结合自主选择SCD算法的辩论编码模块和基于元数据的对抗性辩论模块,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-05-27 cs.CL cs.AI cs.LG 90%

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26911 2026-05-27 cs.AI 90%

TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews

TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强型代理

Hanqi Duan, Xiang Li

机构 * East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM生成的同行评审难以检测缺陷的问题,提出TADDLE工具增强型代理,通过四个专用分析工具和两阶段半监督学习,在二元检测和多标签分类任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20251 2026-05-27 cs.SE cs.AI 90%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08455 2026-05-27 cs.LG cs.PL cs.SE 90%

CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

CUDABeaver:基于LLM的自动化CUDA调试基准测试

Shiyang Li, Haoyang Chen, Mattia Fazzini, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出CUDABEAVER基准,通过协议条件指标pass@k(M,C,A)评估LLM修复CUDA代码的能力,揭示性能损失容忍度对成功率的影响。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11460 2026-05-27 cs.CL 90%

ADRD-Bench: A Preliminary LLM Benchmark for Alzheimer's Disease and Related Dementias

ADRD-Bench:阿尔茨海默病及相关痴呆症的初步大语言模型基准

Guangxin Zhao, Jiahao Zheng, Malaz Boustani, Jarek Nabrzyski, Yiyu Shi, Meng Jiang, Zhi Zheng

机构 * Electrical Engineering, University of Notre Dame(诺丁汉大学电气工程系) Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系) School of Medicine, Indiana University(印第安纳大学医学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准对阿尔茨海默病及相关痴呆症覆盖不足的问题,提出ADRD-Bench,包含统一问答和照护问答两部分,评估了36个LLM,发现顶级模型准确率高但推理质量不稳定。

Comments Update article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05899 2026-05-27 cs.AI 90%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05305 2026-05-27 cs.CL 90%

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

SONAR-LLM:在句子嵌入中思考、以令牌说话的自回归Transformer

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

机构 * FusionBrain Lab, AXXX(融合大脑实验室,AXXX) T-Tech MSU(莫斯科大学) DS-NLP Group, AXXX(自然语言处理组,AXXX)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SONAR-LLM,一种在连续SONAR嵌入空间“思考”但通过令牌级交叉熵监督的解码器-only Transformer,融合语义抽象与似然训练信号,在39M至1.3B参数规模上取得有竞争力的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14321 2026-05-27 cs.MA cs.CL 90%

Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems

超越自我对话:基于LLM的多智能体系统的通信中心综述

Bingyu Yan, Zhibo Zhou, Litian Zhang, Lian Zhang, Ziyi Zhou, Dezhuang Miao, Zhoujun Li, Chaozhuo Li, Xiaoming Zhang

机构 * School of Cyber Science and Technology, Beihang University, Beijing 100191, China(信息科学与技术学院,北京航空航天大学,北京100191,中国) The College of Cyber Security/College of Information Science and Technology, Jinan University, Guangzhou, China(网络安全学院/信息科学与技术学院,暨南大学,广州,中国) School of Computer Science and Engineering, Beihang University, Beijing 100083, China(计算机科学与工程学院,北京航空航天大学,北京100083,中国) School of Cyber Science and Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(信息科学与技术学院,北京邮电大学,北京100876,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从通信视角综述基于大语言模型的多智能体系统,提出一个整合系统级和系统内部通信的结构化框架,分析智能体交互机制、挑战及未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50857-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15787 2026-05-27 cs.CL cs.IR 90%

Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

交互式智能体:通过角色扮演的LLM-LLM交互模拟咨询师-来访者心理咨询

Huachuan Qiu, Zhenzhong Lan

机构 * School of Engineering, Westlake University(西lake大学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Interactive Agents框架,通过LLM-LLM角色扮演生成高质量心理咨询对话数据,解决隐私、成本和扩展性问题,并验证其治疗有效性和模型性能。

Comments Accepted to *SEM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07231 2026-05-27 cs.CL cs.AI 90%

EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models

EconCausal: 面向大语言模型的上下文感知经济推理基准

Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) Data Science for Humanity Group, MPI-SP(马克斯·普朗克所际数据科学为人类集团) School of Computing, KAIST(韩国科学技术院计算学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出EconCausal基准,包含从顶级经济金融期刊提取的10,490个上下文标注因果三元组,评估大语言模型在指定上下文中推断因果方向及随上下文变化调整判断的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26269 2026-05-27 cs.CR 89%

AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents

AgentSecBench:测量LLM智能体中的提示注入、隐私泄露和工具使用完整性

Faruk Alpay, Taylan Alpay

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出AgentSecBench框架,通过定义意图到执行的无干扰游戏,系统评估LLM智能体在指令完整性、检索机密性和能力完整性方面的安全风险,并实验验证防御措施的有效性。

Comments 24 pages, 3 figures. Ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27015 2026-05-27 cs.CL 89%

PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions

PersLitEval:波斯文学问题上的细粒度基准与LLM评估

Ruhallah Niazi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算信息与技术学院,慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PersLitEval基准,包含4514道波斯文学多选题,评估六种LLM在十种提示策略下的表现,发现模型在概念相似性任务上准确率高,但在拼写和构词等正式语言分析上困难,且提示策略显著影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26365 2026-05-27 cs.CL 89%

Cultural Value Alignment Via Latent Activation Steering in Large Language Models

大型语言模型中通过潜在激活引导的文化价值对齐

Trung Duc Anh Dang, Sarah Masud

机构 * University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 提出一种基于场景行为探测和潜在激活引导的框架,用于评估和干预LLMs的文化价值,发现文化价值以耦合结构编码,限制了精确对齐。

Comments ACL 2026 Student Research Workshop (Non-Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08946 2026-05-27 cs.CY 89%

Authorship Attribution in the Era of LLMs: Problems, Methodologies, and Challenges

LLM时代的作者身份归属:问题、方法与挑战

Baixiang Huang, Canyu Chen, Kai Shu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文系统综述了LLM时代作者身份归属的四个代表性问题和挑战,包括人类文本归属、LLM生成文本检测、LLM生成文本归属以及人机合著文本归属,并探讨了泛化性和可解释性等关键问题。

Comments ACM SIGKDD Exploration. 12 pages. Additional resources, including a regularly updated list of related papers, and LLM-generated text detectors, are available at https://llm-authorship.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27210 2026-05-27 quant-ph cs.AI 89%

Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation

Qiskit QuantumKatas: 为LLM评估改编微软的量子计算练习

Juan Cruz-Benito, Ismael Faro

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文将微软的QuantumKatas量子计算课程从Q#移植到Qiskit,并构建评估框架,用于系统评估大型语言模型在量子计算任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20530 2026-05-27 cs.AI cs.CL cs.LG cs.SE 88%

AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

AgentAtlas:超越LLM智能体的结果排行榜

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgentAtlas框架,通过控制决策分类法和轨迹故障词汇表,将智能体评估从结果成功分离为控制决策质量和轨迹质量,并揭示仅依赖结果排行榜的测量风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26079 2026-05-27 cs.CL 88%

Automated Benchmark Auditing for AI Agents and Large Language Models

AI智能体与大语言模型的自动化基准审计

Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

机构 * Duke University(杜克大学) Together AI Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21106 2026-05-27 cs.CL cs.IR 88%

BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback

BESPOKE:通过诊断反馈进行搜索增强型大语言模型个性化的基准测试

Hyunseo Kim, Sangam Lee, Kwangwook Seo, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(人工智能系,延世大学,首尔,大韩民国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出BESPOKE基准,通过收集真实用户历史并配对细粒度偏好分数与反馈,系统评估搜索增强型大语言模型在个性化信息检索任务中的表现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏