arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2304.09386 2023-04-20 cs.SE 88%

Towards Objective-Tailored Genetic Improvement Through Large Language Models

Sungmin Kang, Shin Yoo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted to the 12th International Workshop on Genetic Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04715 2022-11-10 cs.HC 88%

Robosourcing Educational Resources -- Leveraging Large Language Models for Learnersourcing

Paul Denny, Sami Sarsa, Arto Hellas, Juho Leinonen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20202 2026-05-21 cs.CL cs.AI 87%

Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models

在压力下:情感框架引发小型语言模型可测量的行为转变和结构化内部几何

Rana Muhammad Usman

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

AI总结 该研究探讨情感框架如何影响小型本地部署语言模型的行为和内部表示,通过四个不可能约束编码任务和八个后续框架评估,发现压力框架在行为和内部几何上产生显著变化,同时揭示了模型在不同框架下的响应模式。

Comments 18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23361 2026-04-28 cs.SE cs.AI cs.LG 87%

An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code

对本地部署LLM在Python代码中检测bug的实证评估

Jelena Ilić Vulićević

机构 * Independent Researcher Master of Electrical(独立研究者 电气工程硕士)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了本地部署的LLaMA 3.2和Mistral在Python bug检测中的性能,发现其准确率在43%-45%之间,但难以精确定位修复。

Comments 8 pages, 5 figures. Code available at https://github.com/insajder/llm-bug-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18279 2025-05-07 cs.AI cs.CL cs.HC 87%

Large Language Model-Brained GUI Agents: A Survey

Chaoyun Zhang, Shilin He, Jiaxu Qian, Bowen Li, Liqun Li, Si Qin, Yu Kang, Minghua Ma, Guyue Liu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

机构 * Microsoft(微软公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24509 2026-08-26 cs.AI cs.SE 新提交 87%

PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents

PeakBench:面向大语言模型智能体的资源感知工具调用基准测试

Zhi-Kai Chen, Xu-Xiang Zhong, Song-Yan Li, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24252 2026-08-26 cs.AI cs.SE 新提交 87%

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

SA-Bench:评估基于大语言模型的论文复现中的语义对齐

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Minzu University of China(中央民族大学) Peking University(北京大学) Zhongguancun Academy(中关村科学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24017 2026-08-26 cs.CR cs.AI 新提交 87%

WebMCP-Phalanx: Enforcing and Characterizing Trust Boundaries for Browser-Integrated LLM Agents

WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界

Lin-Fa Lee, YI-YU Chang, Kuo-Hui Yeh

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。

Comments 8 pages, 1 figure, AAAI2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23601 2026-08-26 cs.AR cs.LG cs.MA 新提交 87%

StateTune: Transforming LLM-Assisted EDA Flow Tuning into a Stateful, Closed-Loop Process

StateTune:将大语言模型辅助的EDA流程调优转化为有状态的闭环过程

Kunlong Li, Shangshang Yao, Su Zheng, Lingli Wang

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 StateTune将LLM辅助的EDA调优改为有状态闭环过程,以持久优化记忆为核心,结合EHVI引导的提升策略,在六个基准模块上性能优于多个基线,验证了设计有效性。

Comments Accepted to the 2026 IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23568 2026-08-26 cs.AI 新提交 87%

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

RENDER:控制LLM记忆评估中面向读者的证据

Yuan Si, Simeng Han, Daming Li, Jialu Zhang

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 RENDER是控制LLM记忆评估中面向读者证据的基准,实验显示其相关数据包比原始对话表现更优,效果可迁移,提示需关注评估中的读者面向人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23308 2026-08-25 cs.CR cs.AI 新提交 87%

FIDES: A Concordance Protocol for LLM-Generated Trading Strategies

FIDES:一种针对大语言模型生成交易策略的一致性协议

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 FIDES是针对LLM生成交易策略的一致性测量协议,通过三类产物的一致性打分发现一致性不预测收益、自我评估校准不足等关键结果,为测量保真度提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-25 cs.MA cs.AI 版本更新 87%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10503 2026-08-25 cs.CL 版本更新 87%

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

每个词元都重要:用于测量大语言模型态度与偏差的精确李克特量表分布

Davood Wadi, Mohsen Ghodrat, Matthew Philp

机构 * McGill University(麦吉尔大学) University Canada West(加拿大西部大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出结合人类心理测量学与LLMs机制的精确框架,通过因子实验、词元级PMFs及对应分析方法,分离LLMs的系统性原产国偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20563 2026-08-24 cs.CR cs.AI 新提交 87%

Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents

超越端到端成功:诊断长视野安全大语言模型智能体的失败

Wei Shao, Chongzhou Fang, Zuxiong Tan, Zequan Liang, Setareh Rafatirad, Avesta Sasan, Houman Homayoun

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对长视野安全LLM智能体,提出带检查点的诊断方法,发现Gemini 2.5 Flash失败多因未观测到需复用状态,92种子研究显示针对性指导可提升其状态观测率至95.4%,且失败主因随模型代际变化,需诊断失败根源而非仅看总体成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20344 2026-08-24 cs.CL cs.CY 新提交 87%

Beyond Raw Transcripts: Structured Persona Extraction for LLM-Based Digital Twins

超越原始文本记录:面向基于大语言模型的数字孪生的结构化角色提取

Iris Ye, Tianze Deng, Ozan Candogan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究针对基于LLM的数字孪生,提出结构化角色提取方法,发现信息结构是性能关键,固定结构难通用,自动结构发现流水线可恢复性能并提升准确率。

Comments Preprint. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 87%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19746 2026-08-21 cs.CL 新提交 87%

PersonalBench: Measuring the Authorship Gap in LLM Personalization

PersonalBench:测量大语言模型个性化中的作者差距

Yash Ganpat Sawant

机构 * Independent AI Researcher(独立人工智能研究员)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。

Comments 17 pages. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18554 2026-08-20 cs.CY cs.AI cs.MA econ.GN q-fin.EC 新提交 87%

CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks

CentaurBench:评估大型语言模型在增强与自动化现实工作任务方面的能力

Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 CentaurBench基准测试显示LLM的自动化能力与辅助能力仅适度相关,多数自动化优胜者在增强任务中表现不佳,辅助效果并非始终为正,表明需按模型在多智能体系统中的角色评估模型。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17933 2026-08-19 cs.AI cs.CE 新提交 87%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 87%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 87%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14956 2026-08-18 cs.LG cs.LO 新提交 87%

LLM-based Framework for Generating and Verifying Parallel DEVS Statecharts

基于大语言模型的并行DEVS状态图生成与验证框架

Vamsi Krishna Vasa, Hessam S. Sarjoughian, Edward J. Yellig

机构 * Arizona State University(亚利桑那州立大学) Intel Corporation(英特尔公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。

Comments 22 pages, 5 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 87%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 87%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10528 2026-08-18 cs.IR cs.LG 版本更新 87%

When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design

基于锚点的点式大语言模型重排序器何时有用?检索器质量、统计范围与锚点设计

Utshab Kumar Ghosh, Shubham Chatterjee

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 该研究以GCCP/PAGC为对象,复现并分析锚点式点式LLM重排序器,发现其增益源于对比打分,适用条件较窄,锚点构建可简化,检索器强度影响其效果。

Comments To be published in the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09041 2026-08-18 cs.CL cs.CR 版本更新 87%

BiAxisBias: Evaluating LLM Bias Beyond a Single Prompt and a Single Explanation

BiAxisAudit:一种评估大语言模型偏见的新框架,跨提示敏感性和响应层分歧

Jialing Gan, Junhao Dong, Songze Li

机构 * Southeast University, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出BiAxisAudit框架,通过双轴评估方法揭示LLM偏见的跨提示敏感性和响应层分歧,解决单一指标无法捕捉的偏见问题。

Comments 19 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13835 2026-08-17 cs.CL 新提交 87%

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估

Charu Karakkaparambil James

机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 87%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 87%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 87%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏