arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2608.05850 2026-08-07 cs.CL cs.AI 新提交 84%

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

MameLoshnLM:意第绪语语言模型与评估基准

Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith

机构 * Bar-Ilan University(巴伊兰大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出首个专为意第绪语构建的开源8B参数语言模型MameLoshnLM,通过自研语料库与基准优化Llama 3.1 8B,其表现优于同规模开源基线,为意第绪语NLP及低资源语言模型开发提供了基础与模板。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20853 2026-08-24 cs.AI 新提交 84%

MGAL: A Multilingual Granularity-Aware Long-Context Benchmark

MGAL:一个多语言粒度感知的长基准测试集

Chunhan Li, Chenglin Xu, Zongyang Zhang, Jiale Liu, Zhuoxi Rao, Xudong Jia, Junxiu He, Menglin Yang, Wenjuan Gong, Zhengzhe Liu, Chengwei Qin

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Northeastern University at Qinhuangdao(东北大学秦皇岛分校) Lingnan University, Hong Kong(香港岭南大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MGAL是首个多语言粒度位置感知长基准,以联合国6种官方语言报告构建,含4种粒度及位置分层,实验发现LLM粗粒度任务表现差、闭源模型低资源语言占优,还识别出语义拥挤等新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 84%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20388 2026-08-24 cs.CL cs.DC 新提交 84%

Intent Engine: Natural-Language Intent Translation for Intent-Driven Orchestration in the Compute Continuum

意图引擎:面向计算连续体中意图驱动编排的自然语言意图翻译

Koushikur Islam, Rodrigo N. Calheiros

机构 * Western Sydney University(西悉尼大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Intent Engine架构,可将自然语言意图转换为计算连续体服务部署的经验证SLO制品,在多款大语言模型上均优于基线,能显著减少幻觉与部署失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14303 2026-08-17 cs.LG 新提交 84%

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

利用影响函数检测受污染的代码生成提示批次

Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

机构 * The University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-14 cs.AI 新提交 84%

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 84%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08830 2026-08-11 cs.AI 新提交 84%

PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary

PROSLEX:印度司法领域专家标注的法律条文预测新型数据集

Subinay Adhikary, Upal Bhattacharya, Vivek Kumar Singh, Anurag Sharma, Shubham Kumar Nigam, Suvasis Das, Shouvik Kumar Guha, Koustav Rudra, Kripabandhu Ghosh

机构 * IISER Kolkata(印度科学教育与研究学院加尔各答分校) Utrecht University(乌得勒支大学) IIT Kharagpur(印度理工学院克勒格布尔分校) University of Birmingham Dubai(伯明翰大学迪拜分校) WBNUJS(西孟加拉邦国家法律大学)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文针对法律条文预测研究中缺乏可解释性的问题,构建印度司法领域专家标注的PROSLEX数据集,评估多种提示策略,为可解释法律AI提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 84%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07038 2026-08-10 cs.SE cs.AI cs.CR 新提交 84%

Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering

超越文本匹配:面向面向人类的二进制逆向工程的无参考评估

Xiuwei Shang, Li Hu, Xiao Jiang, Jieke Shi, Junda He, Zhou Yang, Shaoyin Cheng, Guoqiang Chen, Weiming Zhang, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对HOBRE的三项任务,首次系统研究LLM-as-a-Judge评估范式,推出无参考基准BinJudgeBench,提出自适应选择最优配置的BinJudge,提升评估相关性并降低API成本。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 84%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28788 2026-08-03 cs.AI 新提交 84%

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

EarlyDx:一个锚定入院时间的开放生成式循证急诊科就诊诊断基准

Jiahui Li, Ruili Fang, Zishuai Liu, Yutong Guo, Nan Yang, Wenzhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学) Beijing Luhe Hospital(北京潞河医院)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出EarlyDx基准,针对现有诊断基准不适用入院诊断场景的问题,基于MIMIC-IV数据构建,发现各类LLM均无法可靠综合入院证据,仅能提取部分诊断,微调后仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28094 2026-07-31 cs.AI 新提交 84%

An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

一种用于评估治理提案的工具:规模化AI政策分析

Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler, Jeffrey Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种AI政策分析框架,结合专家见解与计算分析,以领域校准模型为基准评估商业LLM,助力用户评估AI治理提案的属性一致性,支持政策制定等人员应对复杂环境。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 84%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25886 2026-07-29 cs.SE cs.CL 新提交 84%

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

RSIBench-Data:用于递归自我改进的以数据为中心的研究基准测试

Fanqing Meng, Lingxiao Du, Qiguang Chen, Ziqi Zhao, Haocheng Lu, Mengkang Hu, Michael Qizhe Shieh

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL

AI总结 研究递归自我改进中以数据为中心的研究,引入RSIBench-Data基准测试,让LLM智能体迭代修订训练数据策略,评估四个前沿智能体在六个基准测试中的表现,发现其虽有能力但改进不一致,该基准测试提供了可测量的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21632 2026-07-27 cs.CL 新提交 84%

A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

一种基于共识的大语言模型相对偏好评估框架

Mohtashim Khan

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18147 2026-07-21 eess.SY cs.AI cs.SY 新提交 84%

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications

用于智能电网的大语言模型和智能AI系统:架构与应用教程

Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣迭戈分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究智能电网中LLMs和智能AI系统,提出基于求解器的设计原则,通过提示策略等构建模块及四个案例研究实例化该原则,比较不同方案,还提出四组评估框架,明确了各部分分工。

Comments 28 pages, 11 figures, 6 tables; plus supplementary material. Review/tutorial article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交 84%

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01152 2026-07-03 cs.CL 新提交 84%

AGC-Bench: Measuring Artificial General Creativity

AGC-Bench:衡量人工通用创造力

Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 提出AGC-Bench基准,通过系统文献综述和标准化框架评估LLM创造力,发现单一创造力因子'c',并验证提示'要有创造力'比推理更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22676 2026-06-23 cs.AI 新提交 84%

Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法

Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee, Seongtae Hong, Suhyune Son, Sugyeong Eo, Jaehyung Seo, Heuiseok Lim

机构 * Zoom Communications Korea University(高丽大学) Yonsei University(延世大学) Konkuk University(建国大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。

Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20588 2026-06-23 cs.HC cs.AI 新提交 84%

AInterviewer: A Platform for Designing and Conducting AI-led Qualitative Interviews

AInterviewer:一个用于设计和进行AI主导的定性访谈的平台

Tobias Priesholm Gardhus, Nikolas Vitsakis, Fie Lejre Frederiksen, Anna Rogers, Hjalmar Bang Carlsen

机构 * University of Copenhagen(哥本哈根大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AInterviewer平台,通过多智能体管道结合调查软件的标准化与LLM的灵活性,实现可复现、安全、透明的AI主导定性访谈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18103 2026-06-17 cs.CL cs.IR 新提交 84%

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

Noah J. Kim-Baumann, Torsten Hiltmann

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 针对历史学等解释性学科,提出HistoRAG框架,通过分离检索与生成、时间窗口化、LLM作为评判者等架构干预,将历史编纂原则转化为RAG设计,解决标准RAG中的时间偏差、相关性评估等问题。

Comments 25 pages, 6 figures. Companion preprint to a Journal of Digital History notebook article (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17398 2026-06-17 cs.CR cs.AI cs.SE 新提交 84%

SoK: AI-Augmented Binary Reversing

SoK: AI增强的二进制逆向工程

Yujeong Kwon, Yiyue Zhang, Shakhzod Yuldoshkhujaev, Kexin Pei, Dokyung Song, Hyungjoon Koo

机构 * Sungkyunkwan University(成均馆大学) The University of Chicago(芝加哥大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 系统化梳理AI增强二进制逆向工程领域,提出统一分类法涵盖传统与AI方法,揭示LLM和智能体AI的新角色,识别技术挑战与评估缺口。

Comments 20 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16684 2026-06-16 cs.CL 新提交 84%

Progressive Knowledge-Guided Large Language Model Framework for Bearing Fault Diagnosis

渐进式知识引导的大型语言模型框架用于轴承故障诊断

Jinghan Wang, Gaoliang Peng, Yanjun Chen, Wei Zhang, Wentao Wu, Tianchen Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Eastern Institute of Technology, China(东方技术研究所,中国)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16659 2026-06-16 cs.CL 新提交 84%

FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection

FraudSMSWalker: 用于短信到网页欺诈检测的智能体大语言模型基准测试

Y. H. Zhou, Z. M. Ma, Y. J. Zhou, Y. T. Li, H. X. Xiang, Y. M. Cheng, T. L. Chen, K. J. Zhang, Z. H. Nan, J. H. Ni, Z. Wu, Q. Y. Pan, S. Zhang, S. Cheng, M. Y. Luo

机构 * Baimaohui(白猫汇) PPSUC(中国人民公安大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出FraudSMSWalker基准,通过屏蔽URL的短信-网页对评估智能体大语言模型在跨渠道欺诈检测中的证据推理能力,发现模型能检测可疑线索但难以保持良性召回。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16011 2026-06-16 cs.CL 新提交 84%

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

谁在翻盘?自我与跨模型反论证揭示LLM中的答案不稳定性

Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种评估大语言模型答案稳定性的协议,通过生成反论证挑战正确回答,发现翻转率在17.5%到97.3%之间,且自我归因和跨模型论证显著影响稳定性。

Comments Accepted to the non-archival workshops AI4Good and AIWILD at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14817 2026-06-16 cs.IR cs.AI 新提交 84%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06563 2026-06-16 cs.SE cs.AI 新提交 84%

AI-Driven Test Case Generation from Natural Language Requirements: A Survey of Techniques and Research Gaps

AI驱动的自然语言需求测试用例生成:技术与研究空白综述

Orimoloye Folorunsho, Hassan Reza

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 综述AI、NLP和LLM从自然语言需求生成测试用例的技术,指出当前方法无法同时满足自动化、歧义处理等六个质量维度,提出四个研究方向。

Comments 22 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14600 2026-06-15 cs.CL 新提交 84%

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

LoSoNA:群组对话中局部社交规范适应的基准

Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki

机构 * Humalike Research

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 提出LoSoNA基准,通过群聊场景测试LLM从对话历史推断并适应未明示的局部社交规范的能力,评估多种模型在不同提示条件下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12864 2026-06-12 cs.SE cs.AI 新提交 84%

Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准

Tingqiang Xu, Hangrui Zhou, Tianle Cai, Alex Gu, Kaifeng Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏