arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2605.23497 2026-05-25 cs.CL 92%

Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering

询问老朋友:诊断和缓解基于LLM的法定问答中的时间故障模式

Max Prior, Andreas Schultz, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过构建包含312个专家验证的德国法定问答对基准,诊断并缓解了大型语言模型在法定问答中的两种时间故障模式(截止后过时和近因偏差),发现检索增强生成通过事实日期提取和版本过滤显著提升性能,而网络搜索存在不稳定性与近因偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23102 2026-05-25 stat.ML cs.LG stat.ME 92%

LLM Sparsity Prior for Robust Feature Selection

LLM 稀疏先验用于鲁棒特征选择

Caleb Skinner, Yihan Guo, Meng Li

机构 * Department of Statistics, Rice University(统计学系,里士满大学) Department of Computer Science, Rice University(计算机科学系,里士满大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出 LLM 稀疏先验 (LSP) 方法,通过将 LLM 生成的权重整合到 Spike-and-Slab 模型的先验包含概率中,并利用层次超先验动态调整权重影响,实现鲁棒的高维特征选择,在急性肾损伤数据集上提升了预测准确性和临床相关特征识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 92%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22316 2026-05-22 cs.CL 92%

Evaluating Scoring Bias in LLM-as-a-Judge

评估LLM作为裁判的评分偏见

Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM作为裁判在评分任务中的偏见问题,提出了三种新的评分偏见类型,并开发了一个框架来量化这些偏见,以改进评分提示设计。

Comments Accepted by DASFAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05406 2026-05-22 cs.CL 92%

Frame In, Frame Out: Measuring Framing Bias in LLM-Generated News Summaries

框入框出:衡量LLM生成新闻摘要中的框架偏差

Valeria Pastorino, Nafise Sadat Moosavi

机构 * Department of Computer Science University of Sheffield (UK)(计算机科学系谢菲尔德大学(英国))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FIFO基准测试,用于衡量LLM生成的新闻摘要中的框架存在性,发现LLM生成的摘要在科学和公共卫生领域显示出较高的框架率,表明框架是摘要质量的一个被忽视但重要的维度。

Comments Accepted to The 15th Joint Conference on Lexical and Computational Semantics (*SEM 2026) co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 92%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-05-20 cs.SE cs.CL 92%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Jie M. Zhang, Mark Harman, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 27 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18199 2026-05-19 cs.IR cs.AI 92%

PIPER: Content-Based Table Search via profiling and LLM-Generated Pseudoqueries

PIPER: 通过 profiling 和 LLM 生成的伪查询实现基于内容的表格搜索

Riccardo Terrenzi, Matteo Falconi, Serkan Ayvaz, Pierluigi Plebani

机构 * Centre for Industrial Software, University of Southern Denmark(丹麦南部大学工业软件中心) Department of Electronics, Information and Bioengineering, Politecnico di Milano(米兰理工学院电子、信息与生物工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数据湖、数据空间和开放数据门户中表格数据集快速增长的问题,PIPER 提出了一种基于内容的表格搜索方法,利用表格 profile 和 LLM 生成的伪查询进行密集检索,优于传统元数据方法和 TableQA 检索方法,展示了 LLM 基于内容建模在表格数据集搜索中的价值。

Comments 15 pages, 3 figures, accepted at DEXA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18015 2026-05-19 cs.LG cs.DB cs.SE 92%

LogRouter: Adaptive Two-Level LLM Routing for Log Question Answering in Big Data Systems

LogRouter: 一种自适应的两级LLM路由用于大数据系统中的日志问题解答

Mert Coskuner, Merve Zeybel, Melik Mert Dolan

机构 * TUBITAK BILGEM(土耳其国家研究 institute)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LogRouter,一种自适应两级LLM路由系统,用于在大数据系统中实现日志问题解答,通过结合PySpark-based Drain3数据摄入管道、GPU加速的嵌入和Apache Druid和PostgreSQL with pgvector的双索引存储,实现高效的日志查询处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 92%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 92%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16238 2026-05-18 cs.AI 92%

Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search

前瞻性多病原体疾病预测使用自主LLM引导的树搜索

Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi

机构 * Google Research(谷歌研究) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Google Deepmind(谷歌DeepMind) University of Massachusetts(马萨诸塞大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自主系统,利用LLM引导树搜索生成、评估和优化可执行预测软件,在2025-2026年美国呼吸道季节中实现了流感、新冠和呼吸道合胞病毒的多方法模型,其集成模型在样本外表现优于CDC标准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 92%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15213 2026-05-18 cs.IR cs.AI 92%

An LLM-RAG Approach for Healthy Eating Index-Informed Personalized Food Recommendations

一种基于LLM-RAG的健康饮食指数指导的个性化食品推荐方法

Yibin Wang, Yanjie Yang, Grace Melo Guerrero, Rodolfo M. Nayga, Azlan Zahid

机构 * Department of Biological and Agricultural Engineering, Texas A&M AgriLife Research(生物与农业工程系,德克萨斯A&M农业生命研究)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合标准化营养数据库与大语言模型的LLM-RAG框架,通过健康饮食指数(HEI)指导实现个性化食品推荐,实验结果显示HEI平均提升6.45,用户HEI超过50的比例提升至61.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12601 2026-05-18 cs.LG 92%

Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers

重新思考LLM路由的预测建模:当简单kNN胜过复杂学习路由

Yang Li

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过简单性视角重新审视LLM路由,发现经过调优的kNN方法在多种任务中优于现有学习路由方法,引入标准化基准测试和多模态数据集,揭示嵌入空间局部性属性使非参数方法在样本复杂度更低的情况下实现强路由决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 92%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12869 2026-05-14 cs.CR cs.AI 92%

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis

利用生存分析量化LLM在反复攻击下的安全退化

Zvi Topol

机构 * MuyVentive, LLC(MuyVentive公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用生存分析评估LLM在持续对抗压力下的安全退化,揭示不同模型在多次攻击下的脆弱性差异,为模型开发者提供评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00238 2026-05-14 cs.CL 92%

Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

基于项目反应理论的LLM自动简答评分能力与响应难度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(德意志教育研究所 | 列支敦士登教育研究所) Faculty of Computer Science, Goethe University Frankfurt(法兰克福歌德大学计算机学院) Chemnitz University of Technology(化学工业大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于项目反应理论的LLM自动简答评分评估框架,分析评分准确率与响应难度的关系,揭示不同模型在评分表现上的差异及中间标签崩溃问题。

Comments accepted at BEA 2026, the 21st Workshop on Innovative Use of NLP for Building Educational Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12422 2026-05-13 cs.CL cs.CY 92%

Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals

预测在LLM-as-a-Judge难度评估中与人类评分者的分歧

Yo Ehara

机构 * Yo Ehara

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种无需生成时间概率信号的方法,通过构建嵌入空间预测LLM生成的难度评分与人类评分者的分歧,实验表明其在预测分歧上的AUC优于基于概率的基线方法。

Comments Accepted to Educational Data Mining (EDM) 2026 (Poster/Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12147 2026-05-13 cs.CR cs.LG 92%

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

PrivacySIM: 评估LLM对用户隐私行为的模拟

James Flemings, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 92%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 92%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09350 2026-05-12 cs.AI 92%

CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

CHAINTRIX:一个多管道LLM增强框架用于自动化智能合约安全审计

Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CHAINTRIX通过结合LLM与确定性结构表示,提升智能合约审计效率,检测86/120高危漏洞,召回率71.7%,优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09227 2026-05-12 cs.CL 92%

Two Ways to De-Bias an LLM-as-a-Judge: A Continuous-Score Comparison of Hierarchical Bayesian Calibration and Neural-ODE Score Transport

用LLM作为裁判的两种去偏方法:对分层贝叶斯校准和神经ODE分数传输的连续分数比较

Andrea Morandi

机构 * Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了两种校正方法以减少LLM作为裁判的偏见,发现数据预算决定了方法选择,两种方法在不同锚点数量下表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06635 2026-05-08 cs.CL 92%

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

被引用但未验证:解析和评估LLM深度研究代理中的源归属

Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 92%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06445 2026-05-08 cs.SE cs.AI 92%

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

约束衰减:后端代码生成中LLM代理的脆弱性

Francesco Dente, Dario Satriani, Paolo Papotti

机构 * EURECOM University of Basilicata(巴利卡塔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06279 2026-05-08 cs.SE cs.AI 92%

Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

正确的代码,易受攻击的依赖项:一项大规模的LLM指定库版本测量研究

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

机构 * Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences, Beijing, China(智能软件研究中心,软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Key Laboratory of System Software (Chinese Academy of Sciences), Beijing, China(中国科学院系统软件重点实验室,北京,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM生成代码中库版本的安全性和兼容性风险,发现版本选择存在系统性偏差,且版本选择影响漏洞暴露和兼容性故障。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06054 2026-05-08 cs.AI cs.HC 92%

Visual Fingerprints for LLM Generation Comparison

用于LLM生成比较的视觉指纹

Amal Alnouri, Andreas Hinterreiter, Christina Humer, Furui Cheng, Marc Streit

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) ETH Zürich(苏黎世联邦理工学院) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过可视化方法比较不同生成条件下的LLM输出,揭示模型行为的一致性模式,提升提示设计和模型评估效率。

Comments Submitted to the Short Paper track at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18823 2026-05-08 cs.CL 92%

EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation

EvalSense:一种用于领域特定LLM(元)评估的框架

Adam Dejl, Jonathan Pearson

机构 * Imperial College London(伦敦帝国学院) NHS England Transformation Directorate(英格兰国家健康服务转型 Directorate)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvalSense框架,用于构建领域特定的LLM评估套件,通过交互式指南和元评估工具提高评估方法的可靠性与灵活性。

Comments Accepted to EACL 2026 System Demonstrations

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 3: System Demonstrations), 480-491. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏