arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2606.12117 2026-06-11 cs.CL cs.AI 新提交 92%

Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

软提示调优用于公平且高效的LLM基准评估

Selen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha 研究实验室) TU Darmstadt(达姆施塔特工业大学) Hessian.AI(黑森人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出软提示调优方法,通过优化少量软提示向量使基础模型适应基准格式,公平评估其真实知识,效率高且无需完整后训练。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17717 2026-06-11 cs.AI cs.LG 版本更新 92%

A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data

评估LLM生成数据的质量与可信度综述

Kaituo Zhang, Mingzhi Hu, Hoang Anh Duy Le, Fariha Kabir Torsha, Zhimeng Jiang, Minh Khai Bui, Chia-Yuan Chang, Yu-Neng Chuang, Zhen Xiong, Ying Lin, Guanchu Wang, Na Zou

机构 * University of Houston(德克萨斯大学休斯敦分校) Worcester Polytechnic Institute(沃思利理工学院) Rice University(里德大学) Texas A&M University(德克萨斯农工大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学) University of North Carolina at Charlotte(北卡罗来纳州立大学夏洛特分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM数据审计框架,从质量和可信度两个维度系统分类评估指标,分析六种模态数据生成方法的评估缺陷并给出改进建议。

Comments Published at TMLR. Title changed in the final version

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08400 2026-06-09 cs.SE cs.AI cs.CL 新提交 92%

Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

历史与模型对LLM评分的影响:高级软件工程课程研究

Qilin Zhou, Zhuo Wang, Yue Li, W. K. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对研究生阅读报告评分负担重的问题,提出人机协同的LLM辅助评分流程,基于180份作业评估Grok和GPT的评分一致性与人类对齐,发现交互历史导致评分标准漂移,需特定操作缓解不公平。

Comments 5 pages, accepted by ISET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06614 2026-06-08 cs.CL cs.AI cs.HC 新提交 92%

Re-Centering Humans in LLM Personalization

重新将人类置于LLM个性化中心

Lechen Zhang, Jiarui Liu, Tal August

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM个性化在合成数据与人类数据上的性能差距,通过收集人类对话和判断揭示系统在属性提取、相关属性配对和个性化响应生成阶段的局限性,并引入轻量级训练干预以缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05751 2026-06-08 cs.CL cs.AI 版本更新 92%

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns

分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式

Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) AMD Silo AI University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出框架评估LLM生成说服性语言时受接收者性别、发送者意图和输出语言的影响,发现所有模型均存在显著的性别差异,反映性别刻板印象的语言倾向。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06235 2026-06-05 cs.LG cs.AI 92%

Design a Reliable LLM-Integrated Interface for Mortality Forecasting

设计一个可靠的LLM集成接口用于死亡率预测

Thi Kim Ngan Nguyen

机构 * Curtin University(Curtin大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一个结合大语言模型(LLM)的接口,通过自然语言输入驱动确定性预测流程,在保持统计精度的同时提升非专家用户的可及性。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05180 2026-06-05 cs.CL cs.AI 92%

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

从评分到解释:评估基于量规的教学质量评估中的SHAP和LLM理由

Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Lund University(吕勒奥大学) University of Tübingen(图宾根大学) Stanford Graduate School of Education(斯坦福大学教育研究生院) Harvard Graduate School of Education(哈佛大学教育研究生院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合SHAP和LLM理由的框架,用于基于量规的评分模型的可解释性,并在课堂转录数据上评估其忠实性和可迁移性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01400 2026-06-02 cs.CL cs.AI 92%

Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs

一致且独特:基于相似图最大独立集提示选择的LLM基准测试效率

Denica Kjorvezir, Marko Djukanović, Ana Gjorgjevikj, Gjorgjina Cenikj, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(计算机系统部,乔塞夫·斯塔芬研究所,卢布尔雅那,斯洛文尼亚) Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(乔塞夫·斯塔芬国际研究生学院,卢布尔雅那,斯洛文尼亚) Center for Astrophysics and Cosmology, University of Nova Gorica, Nova Gorica, Slovenia(天体物理与宇宙学中心,诺瓦戈里察大学,诺瓦戈里察,斯洛文尼亚)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于相似图最大独立集的提示选择框架,通过选择多样且非冗余的子集,在保持LLM排名一致性的同时显著减少基准测试成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21140 2026-06-02 cs.LG cs.CL stat.AP stat.ML 92%

How to Correctly Report LLM-as-a-Judge Evaluations

如何正确报告LLM作为评估者的评估结果

Chungpa Lee, Thomas Zeng, Jongwon Jeong, Jy-yong Sohn, Kangwook Lee

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM作为评估者时存在偏差的问题,提出一种插件式校正框架,实现无偏估计和统计原理的不确定性量化,并证明在分布偏移下仍保持无偏性。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-05-29 cs.CL cs.AI cs.CR 92%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27789 2026-05-28 cs.AI cs.CL 92%

A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test

固定预算、聚类感知的 LLM-as-a-Judge 评估标准:多跳 RAG 压力测试

Camilo Chacón Sartori, José H. García

机构 * Catalan Institute of Nanoscience and Nanotechnology(加泰罗尼亚纳米科学与纳米技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多跳 RAG 系统评估中的统计偏差问题,提出一种固定预算、聚类感知的 LLM-as-a-Judge 比较标准,并通过遗传算法证据选择器 GADMEC 在 400 个多跳问题上进行压力测试,揭示聚类感知推断改变了实证结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27388 2026-05-28 cs.CL cs.AI cs.SI 92%

Modeling Community Attitude through Reaction Tone: A Human-AI Collaborative Framework for Evaluating LLM Alignment with Linguistic Behaviors in Online Communities

通过反应语气建模社区态度:评估LLM与在线社区语言行为对齐的人机协作框架

Nuan Wen, Xuezhe Ma

机构 * Information Sciences Institute University of Southern California(南加州大学信息科学研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CARE框架,通过细粒度言语气势分析,评估LLM模拟社区对真实新闻的反应,揭示其存在“现实主义差距”,表明当前对齐策略不足以捕捉在线群体的社会语言动态。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-05-28 cs.AI cs.LG cs.MA 92%

EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 26 pages, 10 figures, to be published at IDETC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17375 2026-05-28 cs.LG cs.CL cs.CR 92%

AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens

AdvJudge-Zero:通过对抗控制令牌在LLM作为评判者中实现二元决策翻转

Tung-Ling Li, Yuhao Wu, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 评测与基准 :LLM(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出AdvJudge-Zero方法,通过从评判模型自身分布中采样低困惑度令牌,无需梯度优化即可将LLM评判者的二元判决从“否”翻转为“是”,并基于发现的令牌池提出防御策略以增强评判鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12468 2026-05-28 cs.LG cs.AI 92%

MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation

MCTS-Judge:LLM作为裁判在代码正确性评估中的测试时扩展

Yutong Wang, Pengliang Ji, Chaoqun Yang, Kaixin Li, Ming Hu, Jiaoyang Li, Guillaume Sartoretti

机构 * Independent Contributor(独立贡献者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MCTS-Judge框架,利用蒙特卡洛树搜索在测试时进行多视角分解评估,显著提升LLM作为裁判在代码正确性评估中的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26955 2026-05-27 cs.CL cs.AI 92%

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

JuICE:评估LLM裁判识别文化错误的基准

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh

机构 * KAIST(韩国科学技术院) Google(谷歌) Universitas Gadjah Mada(加查马达大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出JuICE基准,包含7470个文化语言错误标注的多语言数据集,用于评估LLM裁判在长文本中识别深层文化错误的能力,发现最强模型F1仅0.52且常遗漏本地人易识别的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 92%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22732 2026-05-22 cs.AI cs.CL cs.HC cs.SD eess.AS 92%

Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models

超越语音情感识别:利用基于LLM和语音情感模型的政治演讲多模态Pathos分析

Juergen Dietrich

机构 * Democracy Intelligence gGmbH(民主智能有限责任公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语音情感识别模型是否能作为政治演讲分析中Pathos维度的代理,通过TRUST多智能体大语言模型(LLM)管道进行操作。使用德国议会全体会议中Felix Banaszak的演讲作为案例研究,比较了三种分析模式:(1) emotion2vec_plus_large,一个通过后验Russell Circumplex投影得到连续唤醒度和估值的语音情感识别(SER)模型;(2) Gemini 2.5 Flash,一个分析完整演讲音频及其转录文本的LLM,以开放和上下文感知的方式进行;(3) TRUST-Pathos分数,来自三个倡导者LLM监督集合。斯皮尔曼等级相关性显示,Gemini估值与TRUST-Pathos高度相关(rho = +0.664,p < 0.001),而emotion2vec估值不相关(rho = +0.097,p = 0.499)。我们进一步通过系统评估柏林情感语音数据库(EMO-DB)使用Gemini在开放注释范式下,证明标准SER基准语料库存在表演性演讲、文化偏见和类别不兼容性。我们的结果表明,基于LLM的多模态分析在捕捉语义定义的政治情感方面比单独的语音模型更有效,而语音特征仍对低层次唤醒度估计有帮助。未来的工作将扩展这种方法到视频分析中,结合面部表情和眼神。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20767 2026-05-21 cs.CL cs.LG stat.ME 92%

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

干预的幻觉:你的LLM模拟实验实际上是一个观察性研究

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour

机构 * Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14896 2026-05-21 cs.CL cs.AI 92%

DrugRAG: Enhancing Pharmacy LLM Performance Through A Novel Retrieval-Augmented Generation Pipeline

DrugRAG: 通过一种新颖的检索增强生成流水线提升药学LLM性能

Houman Kazemzadeh, Kiarash Mokhtari Dizaji, Seyed Reza Tavakoli, Farbod Davoodi, MohammadReza KarimiNejad, Parham Abed Azad, Fatemeh Latifi, Ali Sabzi, Armin Khosravi, Siavash Ahmadi, Babak Khalaj, Mohammad Hossein Rohban, Glolamali Aminian, Zohreh Amoozgar, Tahereh Javaheri

机构 * Department of Medicinal Chemistry, Faculty of Pharmacy, Tehran University of Medical Sciences(药学系,泰赫兰医科大学) Department of Computer Sciences, Faculty of Mathematics and Computer Sciences, Amir Kabir University of Technology(计算机科学系,阿米尔·卡比尔技术大学) Department of Mathematical Sciences, Sharif University of Technology(数学科学系,沙菲克技术大学) Department of Computer Sciences, Missouri University of Science and Technology(计算机科学系,密苏里科学与技术大学) Department of Computer Engineering, Sharif University of Technology(计算机工程系,沙菲克技术大学) Department of Faculty of Interdisciplinary Science and Technology, Tarbiat Modares University(跨学科科学与技术学院,塔里亚特莫达res大学) Electronics Research Institute, Sharif University of Technology(电子研究所,沙菲克技术大学) Department of Electrical Engineering, Sharif University of Technology(电气工程系,沙菲克技术大学) The Alan Turing Institute, London, United Kingdom(艾伦·图灵研究所,伦敦,英国) Department of Radiation Oncology, Massachusetts General Hospital & Harvard Medical School(放射肿瘤科,麻省总医院及哈佛医学院) Health Informatics Lab, Metropolitan College, Boston University(健康信息学实验室,波士顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在药学执业资格问答任务中的性能,并开发了一种外部知识整合方法以提高准确性,通过DrugRAG流水线整合结构化药物知识,从而提升药学相关问答任务的LLM性能。

Comments 14 pages, 2 figures, 2 tables. The revised version includes McNemar's paired statistical analysis, Wilson confidence intervals, expanded methodological clarifications, a revised discussion of evidence retrieval, improved reproducibility details, and updated limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL 92%

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12894 2026-05-14 cs.AI cs.CL 92%

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

超越协作模拟器:为LLM代理的稳健评估生成真实用户人设

Harshita Chopra, Kshitish Ghate, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques

机构 * University of Washington, Seattle, WA(华盛顿大学) Georgetown University, Washington, DC(乔治城大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Persona Policies,通过LLM驱动的进化程序搜索生成多样化的人设,提升模拟器在真实用户交互中的鲁棒性,实验显示在零售和航空领域取得显著性能提升。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26680 2026-05-12 cs.CL cs.AI 92%

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

AlpsBench: 一个面向真实对话记忆与偏好对齐的LLM个性化基准

Jianfei Xiao, Xiang Yu, Chengbing Wang, Wuqiang Zheng, Xinyu Lin, Kaining Liu, Hongxun Ding, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AlpsBench通过真实人类与LLM对话数据构建,包含2500个长期交互序列及验证的记忆,评估个性化信息提取、更新、检索与利用等核心任务,揭示LLM在记忆管理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09610 2026-05-12 cs.MA cs.AI cs.CE cs.LG cs.PL cs.SE 92%

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

SmartEval:一个评估从自然语言规范生成的LLM智能合约质量的基准

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J. Watson研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartEval通过9000个生成合约与专家编写的真实实现,结合五维评估标准,验证LLM生成智能合约的质量,并发现逻辑遗漏、状态转换错误等典型故障模式,展示了生成合约在综合评分上比真实实现高出8.29分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 92%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 92%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28031 2026-05-04 cs.CL cs.AI 92%

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

模型记住它们违反的内容:多轮LLM构思中的约束遵守

Garvin Kruthof

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨多轮LLM构思中约束遵守问题,通过DriftBench基准发现迭代压力增加结构复杂性但降低约束遵守,模型在记忆与行为上存在脱节,约束违反率高达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22063 2026-04-30 cs.LG cs.AI 92%

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

精神科下游LLM任务中的可靠性审计:LLM生成的住院风险评分

Shevya Panda, Shinjini Bose, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM在精神科住院风险评分中的可靠性问题,通过合成患者数据评估提示设计和非临床信息对预测稳定性的影响,揭示了非临床信息对模型输出的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25933 2026-04-30 cs.CY cs.AI cs.CL 92%

A Scoping Review of LLM-as-a-Judge in Healthcare and the MedJUDGE Framework

对LLM-as-a-Judge在医疗领域的综述及MedJUDGE框架

Chenyu Li, Zohaib Akhtar, Mingu Kwak, Yuelyu Ji, Hang Zhang, Tracey Obi, Yufan Ren, Xizhi Wu, Sonish Sivarajkumar, Harold P. Lehmann, Shyam Visweswaran, Michael J. Becich, Danielle L. Mowery, Renxuan Liu, Haoyang Sun, Yanshan Wang

机构 * Department of Biomedical Informatics, School of Medicine, University of Pittsburgh(匹兹堡大学医学院生物医学信息学系) Department of Health Information Management, School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院健康信息管理系) OpenCura, Health Innovation Consortium(OpenCura健康创新联盟) Northwestern University, Kellogg School of Management(西北大学凯洛格管理学院) Intelligent Systems Program, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院智能系统项目) Johns Hopkins University School of Medicine Biomedical Informatics and Data Science(约翰霍普金斯大学医学院生物医学信息学与数据科学) Clinical and Translational Science Institute, University of Pittsburgh(匹兹堡大学临床与转化科学研究所) Institute for Biomedical Informatics, University of Pennsylvania(宾夕法尼亚大学生物医学信息学研究所) Data Science, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院数据科学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM-as-a-Judge在医疗领域的应用现状,指出其在验证严谨性、偏见评估和治理方面存在不足,并提出MedJUDGE框架以提升医疗领域LLM-as-a-Judge系统的有效性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00557 2026-04-30 cs.CL cs.AI cs.SE 92%

Learning to Ask: When LLM Agents Meet Unclear Instruction

学习提问:当LLM代理遇见模糊指令

Wenxuan Wang, Juluan Shi, Zixuan Ling, Yuk-Kit Chan, Chaozheng Wang, Cheryl Lee, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AwN框架,通过让LLM在遇到模糊指令时主动提问以提升工具使用性能,并设计自动化评估工具ToolEvaluator,验证了在NoisyToolBench基准下的优越性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏