arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 90%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 90%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 90%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23765 2026-07-28 cs.LG cs.AI 新提交 90%

WISERouter: LLM Routing with Workload Budget Constraint

WISERouter:具有工作负载预算约束的大语言模型路由

Yifei Li, Zihui Gao, Laks V. S. Lakshmanan

机构 * The University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模使用LLMs成本高的问题,将LLM路由建模为约束上下文多臂老虎机问题,提出WISERouter框架,支持离线和在线学习。证明WR-Online有次线性遗憾界,实验表明WR-Offline性能超基线且更守预算,WR-Online用较少探索数据达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23121 2026-07-28 cs.IR cs.CL cs.LG 新提交 90%

SMART: LLM-Augmented Hybrid Retrieval for Dynamic Product Ads

SMART:用于动态产品广告的大语言模型增强混合检索

Congfei Zhang, Jingxiao Ma, Xiaodong Liu, Hsiang-wei Chao, Siman Wang, Ge Liu, Shantanu Aggarwal, Vincent Zhang, Meghana Missula, Rachel Liao, Zichu Li, Xiao Bai, Yunzhi Zhou, Yajun Wang, Zhe Liu, Jinchao Li, Yu Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究动态产品广告中重定向和开拓新客户的平衡问题,提出SMART方法,通过规则与LLM生成查询结合及质量门控管理成本,经实验验证,该方法有效提升广告转化率,降低LLM成本。

Comments To be published in the 20th ACM Conference on Recommender Systems (recsys'26), September 27 - October 2, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20864 2026-07-24 cs.LG cs.CL 新提交 90%

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

位置偏差隐藏在天花板效应背后:LLM基准测试的排列诊断

Hiroki Tamba

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究LLM基准测试中位置偏差问题,引入inspect_permute工具对四个供应商在五个MMLU主题上进行测试,发现位置偏差仅在特定准确率区间可检测,明确了可检测区域及两种机制类型,界定了位置偏差测量范围,使核心问题可验证。

Comments 25 pages, 4 figures, 2 appendices. Code, data, and preregistration verification at https://github.com/TambaClan/inspect_permute. Companion paper: arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19415 2026-07-23 q-bio.QM cs.AI cs.CL 新提交 90%

Auditing Retrieval-Augmented LLM Hypotheses for Longitudinal Cell Painting Morphology

纵向细胞绘画形态学的检索增强大语言模型假设审计

Gilchan Park, Guang Zhao, Byung-Jun Yoon, Shinjae Yoo

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对纵向细胞绘画形态学,提出检索增强解释框架,结合多方面证据使LLM生成可审计假设,引入两个定量审计测试,通过实验验证其有效性,产生了可证伪的生物学假设,揭示低剂量率下的适应性表型。

Comments Accepted for publication at ACM BCB 2026. This is the author's version. The definitive Version of Record is available at [https://doi.org/10.1145/3807503.3819448](https://doi.org/10.1145/3807503.3819448)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07469 2026-07-09 cs.CL cs.AI 新提交 90%

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注

Andrea Scarinci, Virginia Negri, Brayan Impata, Suleiman Khan, Victor Martinez, Marcello Federico

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 90%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02368 2026-07-03 stat.ML cs.AI cs.LG math.DG 新提交 90%

The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22737 2026-07-03 cs.AI cs.CL cs.SE 新提交 90%

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval:有状态智能体评估中LLM评判的确定性替代方案

Jeffrey Flynt

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。

Comments Streamlined entry point into framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 90%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01233 2026-07-02 cs.CL cs.AI 新提交 90%

Measuring the Gap Between Human and LLM Research Ideas

衡量人类与LLM研究想法之间的差距

Ziyu Chen, Yilun Zhao, Arman Cohan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文构建大规模评估框架,通过逆向工程提取论文核心想法,引入双轴研究品味分类法,发现LLM想法集中在桥梁式机会和综合方法,而人类想法分布更广,揭示两者系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 90%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24901 2026-06-25 cs.LG cs.AI 新提交 90%

LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning

LLM演化作为行业规模生态系统:持续学习的生命周期视角

Hao Jiang, Enneng Yang, Guojie Zhu, Yibin Chen, Yunkun Xu, Zifu Kou, Jiayi Li, Chong Chen, Zhao Cao, Li Shen

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 从生态系统视角重新定义工业级LLM持续学习为闭环更新与发布问题,识别三大挑战,提出五项生命周期设计原则,并评估其成熟度与部署蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24679 2026-06-25 cs.LG cs.AI 新提交 90%

FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction

FlowPipe: 基于条件生成流网络的LLM增强数据准备流水线构建

Kunyu Ni, Lei Cao, Jie He, Xiaotong Zhang, Jianfeng Jin, Junyu Dong, Yanwei Yu

机构 * Ocean University of China(中国海洋大学) University of Arizona(亚利桑那大学) University of Science and Technology Beijing(北京科技大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FlowPipe框架,利用条件生成流网络(C-GFlowNets)和LLM语义调制,解决数据准备流水线自动构建中的组合优化和稀疏搜索问题,在74个数据集上平均准确率提升11.96%,训练收敛速度提升12.5倍。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交 90%

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22203 2026-06-23 cs.CL cs.AI cs.MA cs.SI 新提交 90%

When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies

何时涌现共识是真实的?一种测量耦合增益与LLM智能体社会的有效性诊断

Dongxu Yang

机构 * DeepLethe

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM智能体社会中的涌现共识或极化现象,提出基于反事实扰动的耦合增益测量方法,并建立有效性诊断工具,区分真实社会动态与模型伪影。

Comments 13 pages (incl. appendix with proofs), 7 figures. Code and per-run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 90%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21098 2026-06-23 cs.CL cs.AI 新提交 90%

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

基于LLM的多参考评估方法用于短语边界标注的高效稳健评估

Younghan Park, Hoyeon Lee, Hawon Jeong, Jong-Hwan Kim

机构 * NAVER Cloud(NAVER云) Yonsei University(延世大学) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出基于LLM的多参考评估方法(LMRE),通过生成多个有效短语边界解决单参考评估的局限性,在韩语测试中与人类判断一致性更强。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20668 2026-06-23 cs.CR cs.AI cs.LG 新提交 90%

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

BELLS-O:评估LLM监督系统的运营权衡

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia

机构 * University of Graz, Graz, Austria(格拉茨大学) Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19111 2026-06-18 cs.CL cs.AI cs.MA 新提交 90%

Leadership as Coordination Control: Behavioral Signatures and the Recovery-Advantage Boundary in Multi-Agent LLM Teams

领导力作为协调控制:多智能体LLM团队中的行为特征与恢复优势边界

Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究多智能体LLM团队中过程级协调控制何时增加价值,通过行为特征和消融实验发现,控制器的优势仅在初始多数投票不可靠、任务可恢复且无指导交互无法修复时出现,验证了权变理论。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 90%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(title);large language model(abstract);language model(abstract)

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15899 2026-06-16 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 90%

SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

SkillVetBench: 基于LLM评判的多维安全风险评估开源LLM智能体技能

Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * SUPREME Lab, University of Texas at El Paso, Texas, USA(SUPREME实验室,德克萨斯理工大学埃尔帕索分校,德克萨斯州,美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SkillVetBench,利用LLM作为评判器对开源LLM智能体技能进行多维安全风险评估,引入五维技能智能体风险评分(SARS)和CVSS v4.0向量分解,在78个恶意技能上实现零假阴性,22个良性技能上零假阳性。

Comments The main research paper is submitted to NeurIPS 2027, it is in under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 90%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13685 2026-06-15 cs.CL cs.AI 新提交 90%

The Coin Flip Judge? Reliability and Bias in LLM-as-a-Judge Evaluation

抛硬币的裁判?LLM作为评估者的可靠性与偏见

Abel Yagubyan

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM作为评估者在重复评估中的不可靠性,发现偏好翻转率平均13.6%,存在位置偏见,并建议多轮聚合和不确定性报告。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12699 2026-06-12 cs.LG cs.AI 新提交 90%

LLM-Powered Personalized Glycemic Assessment in Type 2 Diabetes with Wearable Sensor Data

基于可穿戴传感器数据的2型糖尿病个性化血糖评估:LLM驱动方法

Yifan Gao, Yanmin Gong, Yun Shi, Yuanxiong Guo

机构 * Department of Information Systems and Cybersecurity, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering Medicine, Texas A&M University(德克萨斯农工大学工程医学院) Department of Family and Community Medicine, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校家庭与社区医学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GlyLLM框架,利用大语言模型整合可穿戴传感器数据和结构化元数据,实现个性化血糖动态建模,在血糖预测和糖尿病分类任务上分别比传统ML方法提升13.66%和13.08%。

Comments The 14th IEEE International Conference on Healthcare Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11762 2026-06-11 cs.CL cs.AI 新提交 90%

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

语言模型在开放式任务中的自动化创造力评估

Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

机构 * Raffles Institution(莱佛士书院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学人工智能医学中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种领域无关的自动化框架,通过语义熵和检索式多智能体评估,量化LLM在开放式任务中的发散与收敛创造力,并在问题解决、研究构思和创意写作三个领域验证其有效性。

Comments Accepted to ACL 2026 (Main Conference). 35 pages, 16 figures. Code: https://github.com/tanminsen/creativity-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11686 2026-06-11 cs.CL cs.AI 新提交 90%

Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness

层隔离评估:使用无LLM、回归锁定的测试工具对生产级LLM代理的确定性框架进行门控

Sawyer Zhang, Alexander Wang, Sophie Lei

机构 * Lumivate (Lumi)(Lumivate(Lumi))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出层隔离评估方法,将LLM代理分解为固定层次,用确定性无LLM测试套件逐层检测回归,证明聚合指标会掩盖局部退化,而逐层基线门控可准确定位。

Comments 12 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10315 2026-06-10 cs.CL cs.AI 新提交 90%

Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents

捕捉五分之一:LLM作为评判员在生产环境多轮交易代理中的盲点

Sawyer Zhang, Alexander Wang, Sophie Lei

机构 * Lumivate (Lumi)(Lumivate(Lumi))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究部署的餐饮订购代理中LLM评判员对真实缺陷的召回率,发现其仅捕获22%的系统性问题,主要因评分标准缺乏状态跟踪等行为维度,且路由机制导致缺陷被错误分类。

Comments 13 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏