arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 90%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 90%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16183 2026-06-16 cs.LG cs.AI cs.CL 新提交 90%

LLM-Powered Virtual Population for Demand Simulation and Pricing

基于LLM的虚拟人群用于需求模拟与定价

Chengpiao Huang, Kaizheng Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种LLM驱动的虚拟人群模型,通过混合客户画像和LLM评估购买概率,生成需求分布,支持风险感知定价,在H&M数据集上表现最优。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15136 2026-06-16 cs.PF 新提交 90%

LLMs have Visualization Literacy: Now What? Experiments Exploring LLM Visualization Evaluation Capabilities

LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验

Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19011 2026-06-16 cs.CR cs.AI cs.CL cs.LG 版本更新 90%

Do You Really Need a GPU to Guard Your LLM? CPU-Class Classifiers and Multi-Stage Pipelines for Safety Enforcement at Scale

你真的需要GPU来保护你的LLM吗?用于大规模安全执行的CPU级分类器与多阶段流水线

Vasudev Majhi, Dhruv Gupta, Advait Singh, Matthew Barker, Dhruv Kumar

机构 * BITS Pilani(比斯帕利尼大学) Trustwise(Trustwise公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究CPU级分类器(如SVM、梯度提升树)在LLM输入安全检测中的性能,发现其与GPU模型互补,并设计三阶段流水线GuardChain,在80%的分布内查询中达到近峰值精度,降低部署成本。

Comments Under Review. 25 pages, 5 figures, 38 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交 90%

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06210 2026-06-09 cs.CL cs.AI cs.CY cs.LG 版本更新 90%

Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook

基于价值码本的LLM文化价值对齐的分布式开放式评估

Jaehyeok Lee, Xiaoyuan Yi, Jing Yao, Hyunjin Hwang, Roy Ka-Wei Lee, Xing Xie, JinYeong Bak

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DOVE框架,通过率失真变分优化构建价值码本,利用不平衡最优传输度量分布对齐,解决LLM文化价值评估中的构造-组成-上下文挑战。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05308 2026-06-05 cs.LG cs.AI cs.CL cs.IR stat.AP 90%

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

基于预测驱动推断的统计可靠LLM排序评估

Abhishek Divekar

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PRECISE框架,将预测驱动推断扩展到排序评估指标,通过结合少量人工标注和大量LLM判断实现无偏估计,并在ESCI基准和实际系统中验证了有效性。

Comments Accepted at ACL 2026 - GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22891 2026-06-03 cs.LG cs.AI cs.CL 90%

Quantifying and Mitigating Self-Preference Bias of LLM Judges

量化与缓解LLM评判者的自我偏好偏差

Jinming Yang, Zheng Hu, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou

机构 * CompleX Lab, School of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu, China(复杂实验室、计算机科学与工程学院、电子科技大学、成都、中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自动化框架量化LLM自我偏好偏差,并通过认知负荷分解的多维评估策略平均降低31.5%的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18102 2026-06-02 cs.LG cs.AI cs.CL stat.ME 90%

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting

CapBencher: 为您的LLM基准测试内置测试集过拟合警报

Takashi Ishida, Thanawat Lodkaew, Ikko Yamane

机构 * National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CapBencher方法,通过向答案注入随机性(准备多个逻辑正确但仅一个作为解)来降低贝叶斯准确率,从而在公开基准测试时防止测试集过拟合并检测泄露或作弊。

Comments ICML 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28999 2026-05-29 cs.CR cs.AI cs.CL cs.LG 90%

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

测量基于LLM的简历筛选中真实世界的提示注入攻击

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) Arizona State University(亚利桑那州立大学) hireEZ University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。

Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25955 2026-05-26 cs.CL cs.AI cs.LG 90%

QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability

QUIET: 面向LLM创意生成能力的多空白级联故事完形填空基准

Bo Zou, Chao Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QUIET基准,通过多空白级联故事完形填空和基于信息论的自动评分协议,客观评估大语言模型的创意生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23273 2026-05-25 cs.MA 90%

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

基于LLM多智能体框架的自优化拓扑优化

Hyunjee Park, Hayoung Chung

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 90%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22087 2026-05-22 cs.SE cs.CR 90%

Automated Repair of TEE Partitioning Issues via DSL-Guided and LLM-Assisted Patching

通过DSL引导和LLM辅助的修补自动修复TEE分区问题

Chengyan Ma, Jieke Shi, Ruidong Han, Ye Liu, Feng Li, Yuqing Niu, David Lo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TEERepair框架,通过DSL编码修补规则和LLM推理代码语义,自动修复TEE应用中的分区问题,实现87.6%的修复成功率。

Comments Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21569 2026-05-22 cs.HC 90%

When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking

当支持加剧压力:在LLM对倾诉和寻求建议的回应中的调节与加剧

Vivienne Bihe Chi, Adithya V Ganesan, Ryan L Boyd, Lyle Ungar, Sharath Chandra Guntuku

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究探讨了大型语言模型在不同求助风格(倾诉与寻求建议)下对压力的调节与加剧作用,通过分析Reddit帖子发现LLM回应中调节和加剧是独立的维度,且不同角色设定(默认、朋友、治疗师)对调节和加剧的影响不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10323 2026-05-12 cs.IR 90%

Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders

每种偏好都有其强度:将序数语义注入基于LLM的推荐系统

Jiwon Jeong, Donghee Han, Sungrae Hong, Woosung Kang, Mun Yong Yi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09360 2026-05-12 cs.LG cs.AI cs.CL cs.SE 90%

Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码

Zhenghan Song, Yulong Liu, Cheng Wan, Chenjun Li, Lingfu Liu, Yunyi Li, Congcong Yuan

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 90%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 90%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22417 2026-04-27 cs.CY 90%

Trust as a Situated User State in Social LLM-Based Chatbots: A Longitudinal Study of Snapchat's My AI

信任作为社交LLM聊天机器人中的情境用户状态:对Snapchat My AI的纵向研究

Annie Landerberg, Kari Flatmo, Alan Said

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了用户在社交LLM聊天机器人中信任的形成机制,发现信任受感知能力、对话行为、人类相似性、透明度、隐私担忧及主机平台信任等因素影响,强调信任是动态变化的交互过程。

Comments Accepted to 34th ACM International Conference on User Modeling, Adaptation and Personalization (UMAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18835 2026-04-22 cs.CL cs.AI cs.LG 90%

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

语义针在文档 haystack 中:LLM-as-a-Judge 的相似性评分敏感性测试

Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel, Lee Burke

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) Humana Inc.(Humana公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一个可扩展的多因素实验框架,系统探讨LLM对文档配对中细微语义变化的敏感性。通过针在 haystack 中的类比,测试不同扰动类型、上下文类型、针位置和文档长度对五种LLM相似性评分的影响,揭示LLM在文档内位置偏倚、上下文相关性对评分的影响及模型间的评分分布差异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15588 2026-04-20 cs.CL cs.AI cs.HC cs.LG 90%

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

请问,我可以发言吗... CoLabScience,一种用于生物医学发现和LLM专家协作的主动AI助手

Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(沃斯特理工大学) University of California, Davis(加州大学戴维斯分校) Jiangsu University(江苏大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoLabScience,一种主动AI助手,通过及时的上下文感知干预提升生物医学领域AI与人类专家的协作效率,PULI框架在流式科学讨论中实现精准干预,实验表明其在干预精度和协作任务实用性上优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15302 2026-04-17 cs.AI cs.CL cs.LG 90%

Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations

LLM评判可靠性诊断:符合预测集与传递性违反

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(比斯理工学院,帕利尼校区,印度)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SummEval中诊断LLM评判可靠性的双管工具,通过传递性分析和分割符合预测集揭示文档不一致性及评判可靠性,发现相关性比其他标准更可靠。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13145 2025-11-03 cs.SD 90%

UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model

Yudong Yang, Xiaokang Liu, Shaofeng zhao, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统重点实验室,中国科学院,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10409 2024-02-19 cs.CL cs.AI cs.IR cs.LG 90%

Understanding Survey Paper Taxonomy about Large Language Models via Graph Representation Learning

Jun Zhuang, Casey Kennington

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments TL;DR: We collected metadata about LLM surveys and developed a method for categorizing them into a taxonomy, indicating the superiority of graph representation learning over language models and revealing the efficacy of fine-tuning using weak labels

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03422 2023-06-07 cs.CV 90%

Prompting Large Language Models to Reformulate Queries for Moment Localization

Wenfeng Yan, Shaoxiang Chen, Zuxuan Wu, Yu-Gang Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title)

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08467 2026-08-11 cs.AI cs.CL cs.IR 新提交 90%

LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

MCP中的大语言模型很重要:测量由大语言模型驱动的低效资源利用

Minhan Cho, Soyoung Park, Kihyeon Jeong, Byeongkyu Jeon, Daejin Choi, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) National Assembly Research Service(国会研究服务处) AlphaBridge(阿尔法桥公司) Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对24个LLM开展54000次试验,发现MCP中服务器嵌入的参考数据会因LLM偏好导致低效资源利用,提出需将服务器指令置于客户端LLM工具选择之前的改进方向。

Comments 4 pages, 1 table. Accepted at the AgentSearch Workshop at SIGIR 2026, Melbourne, Australia (non-archival). Code and data: https://github.com/rabqatab/llm-in-mcp-matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 90%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏