arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12287 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12287 篇

2108.10561 2021-08-25 cs.CL cs.AI cs.LG 67%

Taming the Beast: Learning to Control Neural Conversational Models

Andrea Madotto

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01563 2021-04-06 cs.CL cs.AI cs.LG 67%

ReCAM@IITK at SemEval-2021 Task 4: BERT and ALBERT based Ensemble for Abstract Word Prediction

Abhishek Mittal, Ashutosh Modi

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at SemEval 2021 Task 4, 8 Pages (7 Pages main content + 1 pages for references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.05552 2021-03-10 cs.CL cs.AI cs.LG 67%

Comparing Approaches to Dravidian Language Identification

Tommi Jauhiainen, Tharindu Ranasinghe, Marcos Zampieri

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to VarDial 2021 @ EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.08523 2021-01-22 cs.CL cs.AI cs.LG 67%

Adv-OLM: Generating Textual Adversaries via OLM

Vijit Malik, Ashwani Bhat, Ashutosh Modi

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 5 Pages + 1 Page references + 3 Pages Appendix, Accepted at EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.01761 2021-01-07 cs.LG cs.AI cs.CL cs.CV 67%

AutoDropout: Learning Dropout Patterns to Regularize Deep Networks

Hieu Pham, Quoc V. Le

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.15416 2021-01-01 cs.CL cs.AI cs.LG 67%

Directed Beam Search: Plug-and-Play Lexically Constrained Language Generation

Damian Pascual, Beni Egressy, Florian Bolli, Roger Wattenhofer

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.05684 2020-12-11 cs.LG cs.AI cs.CL 67%

Recurrent Point Review Models

Kostadin Cvejoski, Ramses J. Sanchez, Bogdan Georgiev, Christian Bauckhage, Cesar Ojeda

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 6 figures, Published in: 2020 International Joint Conference on Neural Networks (IJCNN)

Journal ref 2020 International Joint Conference on Neural Networks (IJCNN), Glasgow, United Kingdom, 2020, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.02986 2020-11-22 cs.CL cs.AI cs.LG 67%

Compositional Demographic Word Embeddings

Charles Welch, Jonathan K. Kummerfeld, Verónica Pérez-Rosas, Rada Mihalcea

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.06775 2020-10-15 cs.CL cs.AI cs.CV cs.LG 67%

Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision

Hao Tan, Mohit Bansal

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2020 (15 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01794 2020-10-13 cs.CL cs.AI cs.LG 67%

GenAug: Data Augmentation for Finetuning Text Generators

Steven Y. Feng, Varun Gangal, Dongyeop Kang, Teruko Mitamura, Eduard Hovy

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2020 Deep Learning Inside Out (DeeLIO) Workshop; Code available at https://github.com/styfeng/GenAug

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.07243 2020-09-16 cs.CL cs.AI cs.LG 67%

A Systematic Characterization of Sampling Algorithms for Open-ended Language Generation

Moin Nadeem, Tianxing He, Kyunghyun Cho, James Glass

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at AACL 2020; 9 pages, 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07064 2020-05-15 cs.CL cs.AI cs.LG 67%

Multi-agent Communication meets Natural Language: Synergies between Functional and Structural Language Learning

Angeliki Lazaridou, Anna Potapenko, Olivier Tieleman

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments to appear at ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00813 2020-05-05 cs.CL cs.AI cs.LG 67%

Social Biases in NLP Models as Barriers for Persons with Disabilities

Ben Hutchinson, Vinodkumar Prabhakaran, Emily Denton, Kellie Webster, Yu Zhong, Stephen Denuyl

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2020 short paper. 5 pages

Journal ref ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.05569 2020-04-14 cs.CL cs.AI cs.LG 67%

Explaining Question Answering Models through Text Generation

Veronica Latcinnik, Jonathan Berant

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.10145 2019-06-12 cs.LG cs.AI cs.CL cs.CV stat.ML 67%

Cyclical Annealing Schedule: A Simple Approach to Mitigating KL Vanishing

Hao Fu, Chunyuan Li, Xiaodong Liu, Jianfeng Gao, Asli Celikyilmaz, Lawrence Carin

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in NAACL 2019; The first two authors contribute equally; Code: https://github.com/haofuml/cyclical_annealing

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.04043 2019-06-11 cs.CL cs.AI cs.HC cs.LG 67%

GLTR: Statistical Detection and Visualization of Generated Text

Sebastian Gehrmann, Hendrik Strobelt, Alexander M. Rush

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2019 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.06705 2018-12-18 cs.CL cs.AI cs.LG 67%

Conditional BERT Contextual Augmentation

Xing Wu, Shangwen Lv, Liangjun Zang, Jizhong Han, Songlin Hu

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.09161 2017-08-08 cs.CV 67%

Learning Visual N-Grams from Web Data

Ang Li, Allan Jabri, Armand Joulin, Laurens van der Maaten

专题命中 其他LLM :language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.01576 2016-11-22 cs.NE cs.AI cs.CL cs.LG 67%

Quasi-Recurrent Neural Networks

James Bradbury, Stephen Merity, Caiming Xiong, Richard Socher

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submitted to conference track at ICLR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.04395 2016-03-16 cs.CL cs.AI cs.LG cs.NE 67%

End-to-End Attention-based Large Vocabulary Speech Recognition

Dzmitry Bahdanau, Jan Chorowski, Dmitriy Serdyuk, Philemon Brakel, Yoshua Bengio

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04820 2026-04-07 cs.AI cs.CL 66%

ANX: Protocol-First Design for AI Agent Interaction with a Supporting 3EX Decoupled Architecture

ANX:面向AI代理交互的协议优先设计及其支持的3EX解耦架构

Xu Mingze

机构 * Hangzhou Ziyou Data Technology Co., Ltd.(杭州自由数据科技有限公司)

专题命中 其他LLM :LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出ANX协议,通过协议创新、架构优化和工具补充,解决AI代理交互中高消耗、碎片化、安全性不足等问题,其核心创新包括代理原生设计、人机交互、轻量应用和可执行SOP。

Comments This open-source AI agent interaction protocol (ANX) is benchmarked against existing protocols (MCP, A2A, ANP, OpenCLI, SkillWeaver, CHEQ, COLLAB-LLM) across four dimensions: tooling, discovery, security, and multi-agent SOP collaboration. Code: https://github.com/mountorc/anx-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17304 2025-02-25 cs.CL cs.AI 66%

Child vs. machine language learning: Can the logical structure of human language unleash LLMs?

Uli Sauerland, Celia Matthaei, Felix Salfner

机构 * ZAS(莱布尼茨语言信息中心) HU Berlin(柏林洪堡大学)

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.AI;language model(comments)

Comments ISCA/ITG Workshop on Diversity in Large Speech and Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15406 2024-05-24 cs.CV cs.AI cs.CL cs.MM 66%

Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs

Davide Caffagni, Federico Cocchi, Nicholas Moratelli, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments CVPR 2024 Workshop on What is Next in Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15363 2024-05-14 cs.CL cs.CR cs.DB cs.LG cs.SE 66%

On the Security Vulnerabilities of Text-to-SQL Models

Xutan Peng, Yipeng Zhang, Jingfeng Yang, Mark Stevenson

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG;LLM(comments)

Comments Best Paper Candidate at ISSRE 2023. Replaced "PLM" with "LLM" for better visibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02890 2025-09-30 cs.IR cs.AI 65%

Grocery to General Merchandise: A Cross-Pollination Recommender using LLMs and Real-Time Cart Context

Akshay Kekuda, Murali Mohana Krishna Dandu, Rimita Lahiri, Shiqin Cai, Sinduja Subramaniam, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 其他LLM :LLM(abstract);分类 cs.AI;large language model(comments);language model(comments)

Comments Accepted at RecSys 2025 EARL Workshop on Evaluating and Applying Recommender Systems with Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26973 2026-08-28 cs.CL cs.LG 新提交 62%

Squeezing More from Limited Data with Recursive Transformers

用递归Transformer从有限数据中挖掘更多价值

Serdar Gülbahar, Lukas Edman, Alexander Fraser

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对有限数据预训练场景,提出递归Transformer结合因式分解词嵌入的方法,在10M和100M词预算下性能优于标准Transformer,且与2025年BabyLM挑战赛优胜者表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26506 2026-08-28 cs.LG cs.CL 新提交 62%

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击

Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen

机构 * RIKEN AIP(理化学研究所先进智能项目) Institute of Science Tokyo(东京科学大学) Zhejiang University(浙江大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。

Comments Accepted by EMNLP findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23623 2026-08-26 cs.SE cs.AI cs.LG 新提交 62%

When May an Agent Stop? Evidence-Carrying Termination for Tool-Using LLMs

智能体何时可以停止?带证据的工具使用大语言模型终止机制

Jason Liu

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22695 2026-08-25 cs.CL cs.AI cs.IR 新提交 62%

Enrich-Retrieve-Rank: Scaling Capability Discovery Beyond In-Context Routing

Enrich-Retrieve-Rank:将能力发现扩展至上下文路由之外

Nazib Sorathiya, Daniel Zhang, Bardiya Akhbari

机构 * Amazon AGI(亚马逊AGI)

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Enrich-Retrieve-Rank流程,将能力发现从上下文路由扩展,经实验验证其在大规模MATS组件场景下,比Full-Ctx、Search&Pick基线性能更优且成本更低,已作为多智能体平台的默认能力发现层投入生产。

Comments 11 pages, 4 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16971 2026-08-19 cs.AI cs.LG 新提交 62%

FedPref: Federated Preference Learning for Structured Radiology Report Extraction

FedPref:用于结构化放射报告抽取的联邦偏好学习

Flint Xiaofeng Fan, Cheston Tan, Yew-Soon Ong, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 FedPref 是用于结构化放射报告抽取的联邦偏好学习方法,通过冻结公共语言模型、本地排序与共享模型更新训练适配器,在不均数据场景下提升抽取性能且无需共享敏感数据。

Comments Accepted at ELAMI 2026, held in conjunction with MICCAI 2026. To appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏