arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2501.04455 2025-01-09 cs.CL cs.DL 90%

Hidden Entity Detection from GitHub Leveraging Large Language Models

Lu Gan, Martin Blum, Danilo Dessi, Brigitte Mathiak, Ralf Schenkel, Stefan Dietze

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments accepted by KDD2024 workshop DL4KG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05706 2024-12-02 cs.CL cs.SD eess.AS 90%

Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation

Heeseung Kim, Soonshin Seo, Kyeongseok Jeong, Ohsung Kwon, Soyoon Kim, Jungwhan Kim, Jaehong Lee, Eunwoo Song, Myungwoo Oh, Jung-Woo Ha, Sungroh Yoon, Kang Min Yoo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments NeurIPS 2024, Project Page: https://unifiedsdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10813 2024-11-19 cs.CL 90%

Information Anxiety in Large Language Models

Prasoon Bajpai, Sarah Masud, Tanmoy Chakraborty

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10839 2024-11-13 cs.CV cs.CL 90%

Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags

Daiqing Qi, Handong Zhao, Zijun Wei, Sheng Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);instruction tuning(abstract)

Comments Main Conference at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11142 2024-10-28 cs.CL 90%

Grasping the Essentials: Tailoring Large Language Models for Zero-Shot Relation Extraction

Sizhe Zhou, Yu Meng, Bowen Jin, Jiawei Han

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);small language model(abstract);SLM(abstract)

Comments 25 pages, 20 Tables, 9 Figures; Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00921 2024-10-14 cs.PL cs.AI cs.SE 90%

Statically Contextualizing Large Language Models with Typed Holes

Andrew Blinn, Xiang Li, June Hyung Kim, Cyrus Omar

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To appear at OOPSLA2024

Journal ref Proceedings of the ACM on Programming Languages, Volume 8, 2024; Issue OOPSLA2 Article No.: 288, Pages 468 - 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00341 2024-10-01 cs.CL 90%

Iterative Data Generation with Large Language Models for Aspect-based Sentiment Analysis

Qihuang Zhong, Haiyun Li, Luyao Zhuang, Juhua Liu, Bo Du

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11294 2024-08-22 cs.CL 90%

RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining

Anh-Dung Vo, Minseong Jung, Wonbeen Lee, Daewoo Choi

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01380 2024-08-05 cs.CL 90%

Coalitions of Large Language Models Increase the Robustness of AI Agents

Prattyush Mangal, Carol Mak, Theo Kanakis, Timothy Donovan, Dave Braines, Edward Pyzer-Knapp

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13231 2024-07-09 cs.CL cs.CY 90%

Investigating Cultural Alignment of Large Language Models

Badr AlKhamissi, Muhammad ElNokrashy, Mai AlKhamissi, Mona Diab

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)

Comments ACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02770 2024-07-04 cs.LG cs.CE 90%

Large language models, physics-based modeling, experimental measurements: the trinity of data-scarce learning of polymer properties

Ning Liu, Siavash Jafarzadeh, Brian Y. Lattimer, Shuna Ni, Jim Lua, Yue Yu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10058 2024-06-06 cs.CL 90%

Towards Safer Large Language Models through Machine Unlearning

Zheyuan Liu, Guangyao Dou, Zhaoxuan Tan, Yijun Tian, Meng Jiang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14125 2024-06-05 cs.CV cs.AI 90%

VideoPoet: A Large Language Model for Zero-Shot Video Generation

Dan Kondratyuk, Lijun Yu, Xiuye Gu, José Lezama, Jonathan Huang, Grant Schindler, Rachel Hornung, Vighnesh Birodkar, Jimmy Yan, Ming-Chang Chiu, Krishna Somandepalli, Hassan Akbari, Yair Alon, Yong Cheng, Josh Dillon, Agrim Gupta, Meera Hahn, Anja Hauth, David Hendon, Alonso Martinez, David Minnen, Mikhail Sirotenko, Kihyuk Sohn, Xuan Yang, Hartwig Adam, Ming-Hsuan Yang, Irfan Essa, Huisheng Wang, David A. Ross, Bryan Seybold, Lu Jiang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments To appear at ICML 2024; Project page: http://sites.research.google/videopoet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14490 2024-05-24 cs.CL 90%

Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models

Johan S Daniel, Anand Pal

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04659 2024-04-09 cs.CL 90%

Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly

Changjiang Gao, Hongda Hu, Peng Hu, Jiajun Chen, Jixing Li, Shujian Huang

专题命中 预训练与数据 :instruction tuning(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07648 2024-04-05 cs.DC cs.LG 90%

Characterization of Large Language Model Development in the Datacenter

Qinghao Hu, Zhisheng Ye, Zerui Wang, Guoteng Wang, Meng Zhang, Qiaoling Chen, Peng Sun, Dahua Lin, Xiaolin Wang, Yingwei Luo, Yonggang Wen, Tianwei Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03550 2024-03-07 cs.AI cs.CY cs.HC 90%

Emotional Manipulation Through Prompt Engineering Amplifies Disinformation Generation in AI Large Language Models

Rasita Vinay, Giovanni Spitale, Nikola Biller-Andorno, Federico Germani

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07312 2023-08-23 cs.CL 90%

Using Large Language Models for Zero-Shot Natural Language Generation from Knowledge Graphs

Agnes Axelsson, Gabriel Skantze

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments 9 pages, 3 pages appendices, 1 figure, 4 tables (incl. appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02250 2023-07-24 cs.IR cs.CL 90%

Large Language Model Augmented Narrative Driven Recommendations

Sheshera Mysore, Andrew McCallum, Hamed Zamani

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments RecSys 2023 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10998 2023-05-25 cs.CL 90%

The Web Can Be Your Oyster for Improving Large Language Models

Junyi Li, Tianyi Tang, Wayne Xin Zhao, Jingyuan Wang, Jian-Yun Nie, Ji-Rong Wen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments This work has been accepted by ACL 2023 (findings), while we slightly revise the title and the content based on the conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09067 2023-05-17 cs.CL 90%

SGP-TOD: Building Task Bots Effortlessly via Schema-Guided LLM Prompting

Xiaoying Zhang, Baolin Peng, Kun Li, Jingyan Zhou, Helen Meng

专题命中 预训练与数据 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20281 2026-08-21 cs.CL cs.AI 新提交 90%

Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

注入、对齐、恢复:用于无需检索的文档知识内化的分阶段后训练

Qian Kou, Xiaofeng Shi, Xiaosong Qiu, Hua Zhou

专题命中 预训练与数据 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大型语言模型无需检索文档时无法回答相关问题的痛点,提出IAR三阶段后训练框架,在多数据集、多模型上显著提升了文档知识内化的领域与通用性能。

Comments 21 pages, 4 figures. Includes Supplementary Material Sections A--G. Qian Kou and Xiaofeng Shi contributed equally and are co-corresponding authors. Hua Zhou is the project leader

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13866 2026-08-17 cs.LG cs.CL 新提交 90%

Geometric Filtering of LLM-Generated Samples for Few-Shot Text Classification

用于小样本文本分类的大语言模型生成样本的几何过滤

Benjamín Schindler, Gonzalo A. Ruz

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对LLM生成样本质量异质性问题,提出基于句子嵌入空间欧氏距离的几何过滤框架,结合软加权机制提升小样本文本分类性能,在多任务、多模型及多配置下均表现优异。

Comments 6 pages, 2 figures, to be published in IEEE LACCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10715 2026-08-12 cs.CL cs.AI cs.CY cs.DL cs.SI 新提交 90%

Most biomedical publications show signs of LLM-assisted writing

大多数生物医学出版物显示出大语言模型(LLM)辅助写作的迹象

Lena Holzwarth, Rita González-Márquez, Dmitry Kobak

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) Ghent University(根特大学) VIB(弗拉芒生物技术研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出基于词频变化的无偏方法估计文本语料库中LLM使用情况,发现到2025年底89%的生物医学论文存在LLM相关词汇过量,讨论部分LLM使用率是方法部分的两倍,相关估计对制定指南政策至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06589 2026-08-10 cs.CL cs.AI 新提交 90%

Beyond "AI Language": The case for the idiolectal nature of LLM output

超越“AI语言”:论大语言模型输出的个体方言本质

Karolina Rudnicka, Thomas Stephan Juzek

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出LLM输出具有个体方言本质,通过分析两个LLM生成文本数据集,发现模型间存在独特语言特征,该视角对多领域研究有潜在价值。

Comments 33 pages, 6 figures, 6 tables. Submitted as a chapter to the post-workshop volume "Corpus Linguistics 2040" (Digital Linguistics series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05149 2026-08-05 eess.AS cs.AI cs.CL 版本更新 90%

Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages

低资源场景下的语音大语言模型:数据量需求及高资源语言预训练的影响

Seraphina Fong, Marco Matassoni, Alessio Brutti

机构 * Department of Information Engineering(信息工程系) Center for Augmented Intelligence(增强智能中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源ASR任务,基于SLAM-ASR框架探究语音LLM的数据量需求,发现高资源语言预训练的投影器可缓解数据稀缺问题,并结合多语LLM在公开基准上验证性能,为相关研究提供方向。

Comments Accepted at Interspeech 2025. 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 90%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02240 2026-07-20 cs.CR cs.AI cs.CL cs.ET 版本更新 90%

AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations

AgentRedBench: 针对SaaS集成的LLM代理的动态红队测试与集成感知防御

Hiskias Dingeto, William Leeney

机构 * StackOne Technologies(StackOne技术公司)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具使用中面临的间接提示注入威胁,提出动态红队基准AGENTREDBENCH(覆盖24个企业集成、5种攻击类型)和基于集成多样语料训练的防御模型AGENTREDGUARD,将攻击成功率从69.9%降至2.4%,误报率仅0.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14112 2026-07-17 cs.CL cs.AI cs.IT math.IT 新提交 90%

Information-Theoretic Limits of Reliability and Scaling in Language Models

语言模型中可靠性和扩展性的信息论极限

Subhabrata Majumdar

机构 * Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型可靠性和扩展性的信息论极限,通过分析任务输出不确定性等因素得出缩放定律,指出LLM性能受训练数据或模型容量限制,还统一多种实际现象,提供生成语言模型性能极限的统一理论。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新 90%

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏