arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2608.17994 2026-08-19 cs.CL 新提交 90%

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL;language model(comments)

AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。

Comments Accepted at Conference on Language Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03156 2026-08-04 cs.SE cs.AI cs.HC 版本更新 90%

The Impact of LLM-Assistants on Software Developer Productivity: A Systematic Review and Mapping Study

大型语言模型助手对软件开发者生产力的影响:一项系统综述和映射研究

Amr Mohamed, Maram Assi, Mariam Guizani

机构 * Queen's University(女王大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过综述39项研究,探讨LLM助手对软件开发者生产力的影响,发现多数研究显示积极效益,但存在认知卸载和团队协作风险,研究指出需更全面的评估方法。

Comments 42 pages

Journal ref Mohamed, Amr, Maram Assi, and Mariam Guizani. "The impact of llm-assistants on software developer productivity: A systematic review and mapping study." ACM Transactions on Software Engineering and Methodology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 90%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21404 2026-05-21 cs.LG 90%

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。

Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01446 2024-08-06 cs.CL cs.CV cs.NE 90%

Open Sesame! Universal Black Box Jailbreaking of Large Language Models

Raz Lapid, Ron Langberg, Moshe Sipper

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments Accepted at SeT-LLM @ ICLR 2024

Journal ref ICLR 2024 Workshop on Secure and Trustworthy Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09832 2024-03-18 cs.CL 90%

Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks

Zhifan Sun, Antonio Valerio Miceli-Barone

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments 15 pages, 18 figures, First Workshop on the Scaling Behavior of Large Language Models (SCALE-LLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21531 2026-08-25 cs.SE 新提交 90%

Large Language Models for Requirements Engineering: A Cross-Task Empirical Evaluation

用于需求工程的大语言模型:跨任务实证评估

Jacek Dąbrowski, Manjeshwar Aniruddh Mallya, Alessio Ferrari, Mohammad Amin Zadenoori, Yijun Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过两项互补实证研究,开展首个涵盖五项需求工程相关活动的大语言模型跨任务实证评估,明确其性能高度依赖任务,为LLMs在RE中的实际应用提供复现材料与能力认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-08-25 cs.LG cs.AI cs.CL stat.ML 版本更新 90%

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 26 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-08-24 cs.SI 版本更新 90%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18940 2026-08-20 cs.LG cs.AI cs.CE cs.CL 新提交 90%

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

面向单步逆合成的化学合理性感知大语言模型训练

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) Insilico Medicine Canada Inc.(英矽智能加拿大公司) Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)

AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 90%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11735 2026-08-13 cs.CL cs.AI cs.LG 新提交 90%

Locating and Controlling Implicit Personalization in Large Language Models

定位并控制大语言模型中的隐式个性化

Yueru Yan, Siqi Wu, Thai Le

机构 * Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对5种大语言模型,发现追踪推荐变化的局部内部激活信号与隐式个性化行为相关,移除对应信号可抑制线索影响且保留基准性能,为控制大语言模型隐式个性化提供了因果控制思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 90%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27100 2026-07-30 cs.CY 新提交 90%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00918 2026-07-28 cs.CL cs.AI cs.LG 版本更新 90%

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

LIBMoE:一种用于大规模语言模型混合专家全面基准测试的库

Nam V. Nguyen, Thong T. Doan, Luong Tran, Van Nguyen, Quang Pham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LibMoE为大规模语言模型混合专家提供统一框架,通过全面分析路由动态、初始化影响及训练模式差异,推动MoE研究标准化与创新。

Comments 40 pages

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15936 2026-07-21 cs.CY cs.HC 版本更新 90%

Large Language Models in Architecture Studio: A Framework for Learning Outcomes

大型语言模型在建筑工作室中的应用:一种学习成果的学习框架

Juan David Salazar Rodriguez, Sam Conrad Joyce, Nachamma Sockalingam, Khoo Eng Tat, Julfendi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了大型语言模型在建筑工作室中的应用,旨在通过AI干预解决教学挑战并提升学习成果。

Comments This work has been accepted for publication in International Conference on Human-Computer Interaction HCII 2026 (pp. 93-110)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21001 2026-07-14 cs.GT 版本更新 90%

Do Large Language Model Voters Strategize? An Oracle-Based Benchmark for Manipulation under Voting Rules

大语言模型选民会策略投票吗?一个基于预言机的投票规则操纵基准测试

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出一个基于预言机的基准测试,通过枚举所有可行报告并计算真实结果,评估大语言模型选民能否发现并执行策略投票,覆盖多种投票规则和提示条件。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00604 2026-07-02 math.OC 新提交 90%

Vehicle Routing Problem Meets Large Language Models: An Overview and Perspectives

车辆路径问题遇上大语言模型:综述与展望

Xianchao Xiu, Chong Shen, Yanjiao Zhu, Wanquan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 综述大语言模型在车辆路径问题中的应用,涵盖模型构建、算法设计、协调工具等角色,并讨论基准测试与实验。

Comments working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29602 2026-06-30 cs.CR 90%

An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios

多语言与混淆攻击场景下大语言模型提示注入漏洞的实证评估

Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文实证评估六种大语言模型在多语言和混淆攻击下的提示注入漏洞,发现所有模型均易受攻击,非英语语言恶意合规率更高,需加强安全防御。

Comments Accepted to the AI-SS 2026 Workshop at the 21st European Dependable Computing Conference (EDCC 2026). To be published in the EDCC Companion Proceedings (EDCC-C)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23571 2026-06-24 cond-mat.mtrl-sci 新提交 90%

INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models

INCARBench: 大型语言模型在VASP INCAR科学配置中的基准测试

Bin Shao, Jixiang Li, Xinyue Zhang, Baishun Yang, Zhiyang Liu, Weichao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn)

AI总结 提出INCARBench基准,通过配置生成与修复任务评估LLM在VASP输入配置上的能力,发现参数级正确性不保证科学有效性,错误集中在DFT+U、磁性和关联材料等物理耦合设置中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20603 2026-06-23 cs.CY 新提交 90%

A Survey of Large Language Models for Perception and Measurement of Human Psychology

大型语言模型在人类心理感知与测量中的综述

Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文系统综述了大型语言模型(LLMs)作为人类心理测量工具的应用,从理论可行性、测量方法和应用效果三个维度构建分析框架,探讨其在人格评估和心理健康评价中的有效性及局限。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15334 2026-06-17 cs.NE 新提交 90%

Large Language Model-Driven Cooperative Operator Ensemble Evolution for Permutation Flow Shop Scheduling

大语言模型驱动的合作算子集成进化用于置换流水车间调度

Rui Xu, Yufan Liao, Haoze Lv, Shengcai Liu, Yi Mei, Ke Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对置换流水车间调度问题中经典迭代贪婪算法因单一破坏算子导致搜索停滞的问题,提出多算子IG算法IG-DOE,通过停滞触发的顺序切换机制增强探索,并引入大语言模型辅助框架SCOE自动构建高质量破坏算子集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15152 2026-06-09 cs.CL cs.AI cs.LG 90%

What Level of Automation is "Good Enough"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction

什么是‘足够’的自动化水平?大型语言模型在元分析数据提取中的基准测试

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院) Massey University(梅西大学) Auckland, New Zealand(新西兰奥克兰)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文评估了三种大型语言模型在医疗领域数据提取中的性能,发现定制提示能显著提升召回率,提出三层次指南以平衡自动化与专家监督。

Journal ref Research Synthesis Methods (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 90%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-05-27 cs.CL cs.AI cs.LG 90%

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 90%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01253 2026-05-25 cs.SE 90%

TraceLLM: Leveraging Large Language Models with Prompt Engineering for Enhanced Requirements Traceability

TraceLLM:利用大型语言模型与提示工程增强需求可追溯性

Nouf Alturayeif, Irfan Ahmad, Jameleddine Hassine

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出TraceLLM框架,通过提示工程和示例选择,利用大型语言模型在零样本和少样本设置下提升需求可追溯性,在多个基准数据集上取得最优F2分数。

Journal ref Requirements Eng 31, 6 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12657 2026-05-14 cs.SE 90%

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

用户评论作为可用性需求的来源:利用大语言模型的前期研究

Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 本文探讨利用大语言模型处理用户评论以提取可用性需求的可能性,提出了一套编码数据集和提示工程方法,并验证了LLM在识别可用性需求方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21682 2026-05-08 cs.CL cs.AI cs.CR cs.LG 90%

FIT to Forget: Robust Continual Unlearning for Large Language Models

FIT to Forget: 为大语言模型设计的鲁棒持续遗忘机制

Xiaoyu Xu, Minxin Du, Kun Fang, Yaxin Xiao, Zhicong Huang, Cheng Hong, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FIT框架,解决大语言模型持续删除请求中的遗忘与恢复问题,通过冗余过滤、重要性自适应算法选择和目标层归因机制,实现高效持续遗忘与性能保持。

Comments 26 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07794 2026-05-08 cs.IR 90%

Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey

预训练和大语言模型时代的问题扩展:综述

Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, Guodong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文综述了预训练和大语言模型时代的问题扩展方法,探讨了不同模型家族如何实现新的扩展行为,并分析了四种设计维度下的最新技术,总结了应用模式和部署考虑,指出了未来挑战和方向。

Comments 42 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏