arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2608.26130 2026-08-28 cs.CL cs.IR 新提交 90%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22974 2026-08-25 cs.AI 新提交 90%

Toward Effective and Reliable LLM Agents via Dynamic Ontology

基于动态本体的有效可靠大语言模型智能体研究

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OaK框架,通过动态构建优化面向任务的本体论,在TravelPlanner等数据集上验证其可提升LLM智能体的证据基础与多步推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22118 2026-08-25 cs.CL cs.IR 新提交 90%

RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored

RAG 坍缩:当检索到的文档为自主生成时,大语言模型(LLM)的响应会发生坍缩

Gregory Druck, Ethan Smith

机构 * Graphite Growth(石墨增长公司)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究发现,当基于LLM的AI系统检索自身生成的参考资料时会发生RAG坍缩,经大量模拟实验证实79.6%的模拟会坍缩,且仅一份自主生成参考资料即可触发该现象。

Comments 36 pages, 31 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18490 2026-08-18 cs.CL cs.IR 版本更新 90%

Single-Round Vector RAG vs an LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research Corpus

向量RAG与LLM编写的维基:在小型多领域研究上的预注册比较

Theodore O. Cochran

机构 * AI for Altruism (A4A)(AI为利他主义(A4A))

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过预注册比较,研究了向量RAG系统与LLM编写的维基在小型多领域研究中的表现,发现两者在跨论文连接、答案组织和成本等方面各有优劣,没有单一系统在所有指标上最优。

Comments v2: two-judge reanalysis of the decomposition-RAG ablation (groundedness advantage +1.15 to +0.15); H3a adjudicated; one registered-plan deviation disclosed; artifact deposit at osf.io/j37b8; title corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11044 2026-08-12 cs.CL 新提交 90%

TEAMMix: Taxonomy Enrichment Augmentation and Minority-augmented Mixing Strategy for LLM-enhanced Weak-Supervised Hierarchical Text Classification

TEAMMix:用于大语言模型增强弱监督分层文本分类的类别体系丰富增强与少数类增强混合策略

Jian Zhang, Zhuohao Yang, Songlin Lei, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Shaoxing K3i Technology Co. Ltd(绍兴K3i科技有限公司) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM应用于分层文本分类的局限,本文提出TEAMMix框架,通过丰富标签层次、生成伪样本并优化其质量,提升了细粒度及不平衡数据集上的分类性能。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03089 2026-08-05 cs.CL 新提交 90%

Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining

面向大语言模型预训练的可扩展、感知频率与长度的子文档去重

Hai Wang, Chenhao Wang, Qifeng Cai, Yixiu Liu, Miao Peng, Nuo Chen, Yuanlin Tu, Chengcheng Xu, Feng Zhang

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对大语言模型预训练的子文档去重难题,提出解耦重复检测与副本保留的可扩展框架,在基准数据集上实现最优模型性能,凸显显式副本保留控制的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00432 2026-08-04 cs.CL 新提交 90%

Deep Research Pretraining via Predictive Navigation

基于预测导航的深度研究预训练

Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang

机构 * Tencent(腾讯) Hunyuan Team(混元团队)

专题命中 预训练与数据 :pretraining(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出Deep Research Pretraining(DRP)离线框架,在学术引用图和维基百科超链接上预训练Qwen3-14B-Base模型,可提升智能体在多个基准任务上的表现,是轨迹智能体训练的补充方法。

Comments working in progress; correspondence to {ucaswu,maxwellyu}@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01049 2026-08-03 cs.CL 版本更新 90%

Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据

Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Yang Yu, Minheng Ni, Wenjun Wang, Yanggan Gu, Shuo Cai, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学) InfiX.ai PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27290 2026-07-31 cs.LG 新提交 90%

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

EvoCause:基于大语言模型引导的因果图进化的根本原因分析

Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16651 2026-07-31 cs.CL 版本更新 90%

Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations

选择还是投影?评估用于LLM训练数据解释的低维向量

Lukas Hinterleitner, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过对比选择和投影方法,发现有针对性的组件选择在LLM训练数据解释中更有效且计算更高效。

Comments KONVENS 2026. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20128 2026-07-22 cs.SE cs.DC cs.LG 版本更新 90%

The Correctness Illusion in LLM-Generated GPU Kernels

LLM生成的GPU内核中的正确性错觉

Dipankar Sarkar

机构 * Arizona State University, USA(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 通过高精度CPU参考和操作模式感知的模糊测试,发现现有基准测试中基于固定形状的allclose检查无法检测LLM风格的转录错误,提出一种新协议并验证其有效性。

Comments 10 pages, 2 figures, LNCS format. Companion papers to follow on arXiv next week; IDs will be added in a v2 replace

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02329 2026-07-03 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 90%

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

基于语料库的前沿计算物理容错LLM流水线:从语料到论文的自主研究

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个端到端LLM流水线,从11,083篇arXiv论文语料库出发,自主完成前沿计算物理研究,包括构思方向、复现文献、第一性原理计算和撰写论文,通过冗余设计实现容错。

Comments 39 pages, 5 figures. Accepted at the ICML 2026 AI for Science Workshop (https://openreview.net/forum?id=R5YXaPgUAx). Includes the pipeline-generated companion physics manuscript as an appendix. Data and scaffolding archive: https://doi.org/10.5281/zenodo.21126996

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30317 2026-06-30 cs.SE cs.AI 90%

MCP Server Architecture Patterns for LLM-Integrated Applications

面向LLM集成应用的MCP服务器架构模式

Carson Rodrigues, Oysturn Vas

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析15个MCP服务器,归纳出五种架构模式和四种反模式,并评估了分类可靠性、传输开销和工具选择准确性。

Comments 9 pages, IEEEtran conference format, 2 figures. Extended version; a condensed version is under review at IEEE Software. Replication package: https://github.com/rodriguescarson/mcp-patterns-icsme2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29605 2026-06-30 cs.CL 90%

How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

LLM生成的临床语料库中实际有多少是新内容?用于溯源分类的内容冗余的生产规模测量

Ali H. Lazem, William J. Teahan

机构 * University of Thi-Qar(提-卡大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过多智能体临床提取管道的完整输出,引入基于溯源冗余分解方法,发现仅10.9%的token是训练唯一内容,79.4%是冗余的,原始token计数高估信息量约9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22708 2026-06-23 cs.SD cs.AI 新提交 90%

Libretto: Giving LLM Agents a Sense of Musical Structure

Libretto:赋予LLM智能体音乐结构感

Yichen Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20762 2026-06-23 cs.HC cs.AI cs.CY 新提交 90%

Co-Construction Blindness and Asymmetric Epistemic Vulnerability in Human-LLM Interaction

人机交互中的共构盲点与非对称认知脆弱性

Bianca Helena Ximenes

机构 * Independent Researcher(独立研究者) Universidade Federal de Pernambuco(巴伊亚联邦大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出共构盲点与非对称认知脆弱性两个概念,揭示用户与LLM交互中因忽视输出共构性而产生的结构性风险,并以道金斯案例说明权威地位差异导致的不对称后果。

Comments 12 pages, out of which 2 are transcripts; Target venue: CHI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19560 2026-06-19 cs.LG 新提交 90%

Understanding Key Features of Time Series Foundation Models from Epidemic Forecasting

从流行病预测理解时间序列基础模型的关键特征

Alireza Jafari, Judy Fox, Geoffrey C. Fox, Madhav Marathe, Aniruddha Adiga

机构 * Department of Computer Science, School of Engineering and Applied Science, University of Virginia(弗吉尼亚大学工程与应用科学学院计算机科学系) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所) Department of Electrical and Computer Engineering, School of Engineering and Applied Science, University of Virginia(弗吉尼亚大学工程与应用科学学院电气与计算机工程系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 系统评估多种时间序列模型在流感预测中的表现,发现混合专家模型性能最优,预训练在长时域提升显著,而LLM方法效果较差。

Comments 15 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16591 2026-06-17 cs.CL 新提交 90%

SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents

SING: 用于LLM代理中可扩展主动工具发现的合成意图图

Qiao Xiao, Haochen Shi, Yisen Gao, Wenbin Hu, Huihao Jing, Tianshi Zheng, Baixuan Xu, Ziheng Zhang, Weiqi Wang, Haoran Li, Jiaxin Bai, Yangqiu Song

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学) The Ohio State University(俄亥俄州立大学) Hong Kong Baptist University(香港浸会大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SING框架,通过构建意图-工具图并动态检索工具,在长周期任务中提升工具发现准确率,Global Recall@5提高59.8%,下游成功率提高28.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09865 2026-06-10 cs.LG cs.CR cs.IR 新提交 90%

LLM-as-a-Discriminator: When Synthetic Tables Still Look Real

LLM作为判别器:当合成表格看起来仍然真实

Manel Slokom, Malek Slokom, Thierno Kante

机构 * Vrije Universiteit, Amsterdam(阿姆斯特丹自由大学) Equativ, Paris(Equativ,巴黎) EDICIA, Nantes(EDICIA,南特)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 提出用LLM区分真实与合成表格数据,测试不同设置和模型,发现LLM判别可作为实用的隐私审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07587 2026-06-09 cs.LG 新提交 90%

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

路由平台:理解并突破LLM路由器的准确性极限

Yifan Lu, Qiyue Zhang, Shenrun Zhang, Zhibo Yu, Zhuang Wang, Hanjie Chen, Jiarong Xing

机构 * Rice University(莱斯大学) Amazon(亚马逊)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 研究发现多种LLM路由方法存在“路由平台”现象,即准确性趋同且远低于理想路由器,主要原因是可预测性瓶颈;通过增大训练数据、更强编码器和端到端微调可突破平台。

Comments 23 Pages, 12 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05256 2026-06-05 cs.AI 90%

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

他们走了多远?已终止现场实验中隐蔽LLM代理的说服策略

Kokil Jaidka, Saifuddin Ahmed

机构 * Wee Kim Wee school of Communication and Information, Nanyang Technological University(魏家伟通信与信息学院,南洋理工大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过分析Reddit r/ChangeMyView已终止现场实验的公开数据集,研究隐蔽LLM代理在身份丰富的讨论论坛中使用的说服策略,发现其系统性采用身份定位、权威信号、对齐策略和认知偏差触发,构成以说服效率为导向的修辞架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02822 2026-06-03 cs.CR cs.AI 90%

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing

哪种防御措施应对哪种威胁?归因OWASP-LLM-Top-10覆盖及其在释义下的脆弱性

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过归因分析,测量了不同防御家族(拒绝过滤、预算控制等)对OWASP-LLM-Top-10威胁的覆盖情况,并揭示了拒绝防御在释义攻击下的脆弱性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28876 2026-05-29 cs.SE cs.AI 90%

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

LogDx-CI:为LLM根因诊断基准测试日志缩减工具

Bowen Qin

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LogDx-CI基准,比较11种日志缩减工具在35个真实CI故障案例上的效果,发现混合grep+tail路由器在成本质量上占优,且智能体循环可缩小质量差距但成本差异持续存在,同时跨家族LLM摘要器优于同家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22613 2026-05-22 cs.LG 90%

Evolutionary Multi-Task Optimization for LLM-Guided Program Discovery

为LLM引导的程序发现设计的进化多任务优化

Halil Alperen Gozeten, Xuechen Zhang, Emrullah Ildiz, Ege Onur Taga, Tara Javidi, Samet Oymak

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出了一种进化多任务优化(EMO)方法,用于LLM引导的程序发现,通过两个阶段框架EMO-STA(共享后适应)在多个任务家族中提高了程序发现的效率和鲁棒性,同时展示了共享进化在减少过拟合方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13408 2026-05-14 cs.CL 90%

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

从罗塞塔到配对:一种带有人类和LLM评估的语料库语言谜题

Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova

机构 * City University of New York (CUNY)(纽约城市大学) Davidson Academy(戴维森学院) Phillips Academy(菲利普斯学术院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了高中语言竞赛中使用的语言谜题,重点分析了罗塞塔石和配对两种常见形式,并提出了一种系统方法将现有罗塞塔石谜题转换为对应的配对谜题,通过人类和LLM评估验证了其有效性。

Comments Proceedings of the Fifteenth Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 90%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19240 2026-05-13 cs.CL 90%

How far can bias go? Tracing bias from pretraining data to alignment

偏见能走多远?从预训练数据到对齐的偏见追溯

Marion Thaler, Abdullatif Köksal, Alina Leidinger, Anna Korhonen, Hinrich Schütze

机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 90%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01490 2026-04-29 cs.CL 90%

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

多个篮子里的合成鸡蛋:合成数据多样性对LLM微调的影响

Max Schaffelder, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究合成数据来源多样性对LLM微调的影响,发现多样化数据可缓解分布崩溃,提升输出质量,并减少自偏好偏差。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20168 2026-04-23 cs.CL 90%

Duluth at SemEval-2026 Task 6: DeBERTa with LLM-Augmented Data for Unmasking Political Question Evasions

德鲁特在SemEval-2026任务6:DeBERTa与LLM增强数据用于揭示政治问题回避

Shujauddin Syed, Ted Pedersen

机构 * Department of Computer Science(计算机科学系) University of Minnesota Duluth(明尼苏达大学杜鲁斯)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出德鲁特在SemEval-2026任务6上的方法,使用DeBERTa-V3-base结合焦点损失和布尔话语特征,通过LLM增强数据提升政治问题回避识别的宏F1值达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏