arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2608.10715 2026-08-12 cs.CL cs.AI cs.CY cs.DL cs.SI 新提交 90%

Most biomedical publications show signs of LLM-assisted writing

大多数生物医学出版物显示出大语言模型(LLM)辅助写作的迹象

Lena Holzwarth, Rita González-Márquez, Dmitry Kobak

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) Ghent University(根特大学) VIB(弗拉芒生物技术研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出基于词频变化的无偏方法估计文本语料库中LLM使用情况,发现到2025年底89%的生物医学论文存在LLM相关词汇过量,讨论部分LLM使用率是方法部分的两倍,相关估计对制定指南政策至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06589 2026-08-10 cs.CL cs.AI 新提交 90%

Beyond "AI Language": The case for the idiolectal nature of LLM output

超越“AI语言”:论大语言模型输出的个体方言本质

Karolina Rudnicka, Thomas Stephan Juzek

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出LLM输出具有个体方言本质,通过分析两个LLM生成文本数据集,发现模型间存在独特语言特征,该视角对多领域研究有潜在价值。

Comments 33 pages, 6 figures, 6 tables. Submitted as a chapter to the post-workshop volume "Corpus Linguistics 2040" (Digital Linguistics series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05149 2026-08-05 eess.AS cs.AI cs.CL 版本更新 90%

Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages

低资源场景下的语音大语言模型:数据量需求及高资源语言预训练的影响

Seraphina Fong, Marco Matassoni, Alessio Brutti

机构 * Department of Information Engineering(信息工程系) Center for Augmented Intelligence(增强智能中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源ASR任务,基于SLAM-ASR框架探究语音LLM的数据量需求,发现高资源语言预训练的投影器可缓解数据稀缺问题,并结合多语LLM在公开基准上验证性能,为相关研究提供方向。

Comments Accepted at Interspeech 2025. 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 90%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

机构 * Ryonix Labs Inc.(Ryonix实验室公司)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02240 2026-07-20 cs.CR cs.AI cs.CL cs.ET 版本更新 90%

AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations

AgentRedBench: 针对SaaS集成的LLM代理的动态红队测试与集成感知防御

Hiskias Dingeto, William Leeney

机构 * StackOne Technologies(StackOne技术公司)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具使用中面临的间接提示注入威胁,提出动态红队基准AGENTREDBENCH(覆盖24个企业集成、5种攻击类型)和基于集成多样语料训练的防御模型AGENTREDGUARD,将攻击成功率从69.9%降至2.4%,误报率仅0.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14112 2026-07-17 cs.CL cs.AI cs.IT math.IT 新提交 90%

Information-Theoretic Limits of Reliability and Scaling in Language Models

语言模型中可靠性和扩展性的信息论极限

Subhabrata Majumdar

机构 * Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型可靠性和扩展性的信息论极限,通过分析任务输出不确定性等因素得出缩放定律,指出LLM性能受训练数据或模型容量限制,还统一多种实际现象,提供生成语言模型性能极限的统一理论。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新 90%

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09191 2026-06-18 cs.LG cs.AI 版本更新 90%

From Values to Tokens: An LLM-Driven Framework for Context-aware Time Series Forecasting via Symbolic Discretization

从数值到标记:一种基于符号离散化的LLM驱动上下文感知时间序列预测框架

Xiaoyu Tao, Shilong Zhang, Mingyue Cheng, Daoyu Wang, Tingyue Pan, Bokai Pan, Changqing Zhang, Shijin Wang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) College of Intelligence and Computing(智能科学与计算学院) iFLYTEK Research(iFLYTEK研究院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TokenCast框架,利用大语言模型通过符号离散化将连续时间序列转化为标记,与上下文文本对齐,实现上下文感知的预测,实验证明有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10113 2026-06-10 cs.CL cs.AI 新提交 90%

Emotion Profiling in LLM-Based Literary Translation: Systematic Shifts Across MT and Post-Editing

基于LLM的文学翻译中的情感特征:机器翻译与译后编辑的系统性转变

Antonio Castaldo, Johanna Monti, Sheila Castilho

机构 * University of Pisa(比萨大学) Dublin City University(都柏林城市大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM翻译的情感特征及译后编辑如何使其接近人类翻译,通过对比《Oryx and Crake》的LLM翻译、译后编辑版本和人类翻译,发现MT系统引入特定情感指纹,削弱作者声音。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21347 2026-06-08 cs.AI cs.LG cs.SE 版本更新 90%

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator: LLM代理的系统级语料库追踪诊断

Akshay Manglik, Apaar Shanker, Kaustubh Deshpande, Jason Qin, Yash Maurya, Veronica Chatrath, Vijay S. Kalmath, Levi Lentz, Yuan Xue

机构 * Scale AI, Inc.

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28598 2026-05-28 cs.CL cs.AI 90%

Evaluating the Realism of LLM-powered Social Agents: A Case Study of Reactions to Spanish Online News

评估基于LLM的社会智能体的真实性:对西班牙在线新闻反应的案例研究

Alejandro Buitrago López, Alberto Ortega Pastor, Javier Pastor-Galindo, José A. Ruipérez-Valiente

机构 * Faculty of Computer Science, University of Murcia(计算机科学系,穆尔西亚大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过比较真实与LLM生成的西班牙新闻评论,研究LLM在仇恨言论、情感和语义对齐三个维度上的真实性,发现现成模型表现不佳,微调可部分改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27380 2026-05-28 cs.CL cs.AI 90%

BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking

BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接

Yi Wang, Corina Dima, Liangyu Zhong, Steffen Staab

机构 * University of Stuttgart, Germany(斯图加特大学) Technical University of Berlin, Germany(柏林技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24764 2026-05-26 cs.IR cs.AI cs.CL 90%

Spectral Retrieval: Multi-Scale Sinc Convolution over Token Embeddings for Localized Retrieval in LLM Multi-Agent Systems

光谱检索:基于多尺度sinc卷积的令牌嵌入局部化检索在LLM多智能体系统中的应用

Andrea Morandi

机构 * Cisco(思科)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出光谱检索方法,通过多尺度sinc卷积对令牌嵌入进行重排序,在无需重新训练的情况下显著提升局部化检索性能,并自然适配于LLM多智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 90%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12487 2026-05-13 cs.CL cs.IR cs.LG 90%

Task-Adaptive Embedding Refinement via Test-time LLM Guidance

基于测试时LLM引导的任务自适应嵌入细化

Ariel Gera, Shir Ashury-Tahan, Gal Bloch, Ohad Eytan, Assaf Toledo

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出利用LLM反馈优化查询嵌入表示,提升零样本搜索和分类任务的性能,实验表明在多个基准上提升达25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15461 2026-04-20 cs.LG cs.CL cs.CR 90%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12540 2026-04-15 cs.CL cs.AI 90%

When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP

当数据增强有助于什么?评估LLM和回译方法在豪萨语和丰贝语NLP中的应用

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Centre for Text Technology(文本技术中心) North-West University(北开普大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成和回译方法在豪萨语和丰贝语中的有效性,发现任务类型而非语言或LLM质量决定增强效果,不同任务对增强结果有不同影响。

Comments 13 pages, 6 tables; previously submitted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 90%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01505 2024-07-02 cs.CL cs.AI 90%

Self-Cognition in Large Language Models: An Exploratory Study

Dongping Chen, Jiawen Shi, Yao Wan, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 2024 Large Language Models and Cognition Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04589 2024-01-05 cs.CL cs.AI 90%

TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models

Zhen Yang, Yingxue Zhang, Fandong Meng, Jie Zhou

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Multi-modal, Large Language Models, Tokenizer, Understanding and Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19266 2026-08-21 cs.CR cs.AI 新提交 90%

Incident-Data Robustness Analysis of the OWASP Top 10 for LLM Applications (2026): How a Community-Expert Ranking Holds Up Against a Large-Scale LLM Incident Corpus

2026年面向LLM应用的OWASP Top 10的事件数据鲁棒性分析:社区专家排名如何在大规模LLM事件语料库面前保持有效性

Kyriakos "Rock" Lambros, Steve Wilson

机构 * OWASP GenAI Security Project — Top 10 for LLM Applications(OWASP GenAI安全项目——LLM应用十大项目)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究以OWASP 2026年LLM应用Top 10专家排名为对象,结合7714条LLM安全事件语料库,用贝叶斯模型分析其鲁棒性,发现两者一致性弱但专家排名仍具鲁棒性,且未推翻官方共识。

Comments 26 pages, 19 figures. Exploratory incident-data analysis by two members of the OWASP GenAI Security Project Top 10 for LLM Applications working group. Analysis predates the official OWASP GenAI LLM Top 10 2026 (published August 2026). Not an official OWASP release and does not supersede the official list or process. Code and data: https://github.com/rocklambros/incident-rank-validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28325 2026-06-30 cs.CY cs.CL 90%

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

帝国的数字来世:四种语言模型趋同于同一帝国文字制图

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪 psychiatry 研究院 / 性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过构建数字文字表示指数(DSRI)评估300种文字系统的数字支持,发现仅9.7%得到完全支持;四种LLM在172个特征项上出现一致错误模式,表明历史帝国造成的结构性不平等通过共享训练语料库持续影响当代模型。

Comments Part II of the Kotonoha Series. Companion paper: arXiv:2604.10957 (q-bio.PE). 35 pages, 8 figures, 3 tables. 12,000 API calls across 4 LLM families (Anthropic, OpenAI, xAI, DeepSeek); cross-architecture convergence of typological knowledge biases (Spearman rho = 0.85-0.98, all p < 0.002)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16246 2026-08-20 cs.LG cs.AI cs.CL 版本更新 90%

Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

数据受限语言模型预训练的数据增强

Michael K. Chen, Xikun Zhang, Fan Bai, Zhengding Hu, Zhen Wang

机构 * UC San Diego(加州大学圣地亚哥分校) RMIT University(皇家墨尔本理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对数据受限下标准自回归预训练严重过拟合的问题,提出三类数据增强方法(token级噪声、序列排列、目标偏移预测),有效降低验证损失并支持数百epoch训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 90%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15503 2026-06-15 cs.SE 90%

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

涉及大语言模型的软件工程实证研究指南

Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在软件工程研究中的非确定性、不透明训练数据和快速演化问题,通过22位研究者的协作,提出七种研究类型分类和八条设计报告指南,以提升实证研究的可重复性和可复现性。

Comments 86 pages, 4 tables, accepted in Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05961 2026-06-05 cs.CY physics.soc-ph 90%

Political Persuasion and Endorsement in Large Language Models

大型语言模型中的政治说服与支持

Alessia Antelmi, Alessia Galdeman, Lucio La Cava, Arianna Pera, Giovanni Da San Martino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究大型语言模型是否支持包含说服技巧的信息,以及党派角色提示如何调节这种支持,发现无政治条件时模型通常不支持,但党派提示加剧极化。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01800 2026-06-02 cs.CL cs.AI cs.LG 90%

Multilinguality of Large Language Models From a Structural Perspective

从结构视角看大语言模型的多语言性

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过表示结构分析探索大语言模型的多语言性,发现低资源语言与英语的结构差异大于高、中资源语言,且语言特定后训练改变结构但保留语言间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22467 2026-04-27 eess.AS 90%

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

DM-ASR:基于说话人识别的多说话人ASR框架

Li Li, Ming Cheng, Weixin Zhu, Yannan Wang, Juan Liu, Ming Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 DM-ASR利用说话人识别作为结构先验,将多说话人ASR任务转化为多轮对话生成过程,通过分解转录为说话人和时间条件查询,提升转录质量与结构化输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17585 2026-04-07 cs.AI cs.CL cs.LG 90%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(title);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02031 2026-04-03 cs.LG cs.AI cs.CL 90%

Output Embedding Centering for Stable LLM Pretraining

输出嵌入中心化用于稳定大语言模型预训练

Felix Stollenwerk, Anna Lokrantz, Niclas Hertzberg

机构 * AI Sweden

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出输出嵌入中心化(OEC)方法,通过分析输出嵌入几何特性,解决预训练中的输出logit发散问题,提升训练稳定性。

Comments Additional experiments using logit soft-capping & weight tying

详情

展开后加载摘要…

URL PDF HTML 收藏