arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12460 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2411.16085 2026-02-17 cs.LG cs.AI cs.CL cs.CV cs.DM 75%

Cautious Optimizers: Improving Training with One Line of Code

谨慎优化器:通过一行代码提升训练

Kaizhao Liang, Lizhang Chen, Bo Liu, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过一行代码改进优化器,提升Transformer预训练和图像分类性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10414 2026-02-12 cs.CL cs.AI cs.LG 75%

Is In-Context Learning Learning?

上下文学习是否是学习?

Adrian de Wynter

专题命中 预训练与数据 :pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了上下文学习是否真正构成学习,通过实证分析发现其在泛化能力上存在局限性,且依赖于提示中的规律性而非真正的学习过程。

Comments Accepted to ICLR 2026 -- CR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11524 2026-02-12 cs.AI cs.CL cs.CY cs.LG 75%

HypoBench: Towards Systematic and Principled Benchmarking for Hypothesis Generation

HypoBench: 向系统性和原则性假设生成基准测试迈进

Haokun Liu, Sicong Huang, Jingyu Hu, Yangqiaoyu Zhou, Chenhao Tan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HypoBench通过系统性评估不同假设生成方法的性能,揭示了现有方法在复杂任务中的不足,为提升AI在科学发现中的应用提供了新资源。

Comments 32 pages, 6 figures, website link: https://chicagohai.github.io/HypoBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04195 2026-02-05 cs.SE cs.CR 75%

Semantic Consensus Decoding: Backdoor Defense for Verilog Code Generation

语义一致性解码:用于Verilog代码生成的后门防御

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出语义一致性解码方法,通过提取功能需求和融合输出分布,有效防御Verilog代码生成中的后门攻击。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10173 2026-02-03 cs.SE 75%

ATLAS: Automated Toolkit for Large-Scale Verified Code Synthesis

ATLAS:大规模验证代码合成的自动化工具包

Mantas Baksys, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Soonho Kong, Sean B. Holden

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ATLAS通过生成验证代码提升LLM在形式验证领域的性能,其在DafnyBench和DafnySynthesis上的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21571 2026-02-03 cs.LG cs.AI cs.CL 75%

Shaping capabilities with token-level data filtering

通过令牌级数据过滤塑造能力

Neil Rathi, Alec Radford

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过令牌级数据过滤在预训练过程中有效减少语言模型的不期望能力,提升模型在特定领域的性能与对齐性。

Comments update figure 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00219 2026-02-02 cs.LG cs.AI cs.CL cs.NE 75%

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

Thoughtbubbles: 一种用于潜在空间中并行思维的无监督方法

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás

机构 * Department of Computer Science, Stanford University, Stanford, CA, United States(计算机科学系,斯坦福大学,斯坦福,CA,美国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoughtbubbles是一种通过预训练学习并行自适应计算的转换器变体,能够在潜在空间中实现更高效的计算,提升模型的推理性能和零样本评估表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19514 2026-01-28 cs.CL cs.AI cs.LG 75%

SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback

SIPDO:通过合成数据反馈实现闭环提示优化

Yaoning Yu, Ye Yu, Peiyan Zhang, Kai Wei, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) University of South Florida(佛罗里达州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIPDO通过合成数据反馈闭环优化提示,提升提示性能并优于传统提示微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25423 2026-01-27 cs.SE 75%

What Challenges Do Developers Face in AI Agent Systems? An Empirical Study on Stack Overflow & GitHub Issues

人工智能代理系统中开发者面临哪些挑战?对Stack Overflow和GitHub问题的实证研究

Ali Asgari, Annibale Panichella, Pouria Derakhshanfar, Mitchell Olsthoorn

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过分析Stack Overflow和GitHub问题,识别出人工智能代理系统开发中的五大主要挑战,包括环境管理、检索与记忆、协调控制、交互契约及运行时可靠性。

Comments v2: Adds GitHub Issues analysis; expands dataset and taxonomy; updates results and discussion. (15 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05459 2026-01-16 cs.CR 75%

PrivCode: When Code Generation Meets Differential Privacy

PrivCode: 当代码生成遇见差分隐私

Zheng Liu, Chen Gong, Terry Yue Zhuo, Kecen Li, Weichen Yu, Matt Fredrikson, Tianhao Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PrivCode是一种专门设计用于代码数据集的差分隐私合成器,通过两阶段框架提升隐私和效用,生成高效用代码并保护敏感数据。

Comments Accepted at NDSS 2026; code available at https://github.com/Liuzzyg/PrivCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21324 2026-01-15 cs.CL cs.AI cs.LG 75%

Mathematical Derivation Graphs: A Relation Extraction Task in STEM Manuscripts

数学推导图:STEM论文中的关系提取任务

Vishesh Prasad, Brian Kim, Nickvash Kani

机构 * Electrical and Computer Engineering University of Illinois at Urbana-Champaign(电气与计算机工程学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数学推导图数据集,旨在通过关系提取任务分析STEM论文中数学表达式间的依赖关系,并评估不同模型的识别能力。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00919 2026-01-08 cs.LG cs.AI cs.CL 75%

Attention Needs to Focus: A Unified Perspective on Attention Allocation

注意力需要聚焦:注意力分配的统一视角

Zichuan Fu, Wentao Song, Guojing Li, Yejing Wang, Xian Wu, Yimin Deng, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Lazy Attention机制,通过位置歧视和Elastic-Softmax解决注意力过载和不足问题,提升注意力分配效率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01925 2026-01-06 cs.CV 75%

AR-MOT: Autoregressive Multi-object Tracking

AR-MOT:自回归多目标跟踪

Lianjie Jia, Yuhan Wu, Binghao Ran, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AR-MOT通过自回归范式将多目标跟踪建模为序列生成任务,利用灵活的序列构建实现结构化输出,引入物体分词器和区域感知对齐模块,提升多模态和长期跟踪能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07666 2026-01-01 cs.LG cs.AI cs.CL cs.CV 75%

Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities

在大语言模型、多模态大语言模型及更广泛的领域中进行模型融合:方法、理论、应用与机遇

Enneng Yang, Li Shen, Guibing Guo, Xingwei Wang, Xiaochun Cao, Jie Zhang, Dacheng Tao

机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) Northeastern University China(东北大学) Shenzhen Campus of Sun Yat-sen University China(中山大学深圳校区) Nanyang Technological University Singapore(南洋理工大学) Northeastern University(东北大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所) Inria Paris-Rocquencourt Rocquencourt France(巴黎-罗quentourt研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉贾·甘地大学) Tsinghua University Haidian Qu Beijing Shi China(清华大学) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了模型融合的方法、理论、应用及未来方向,提出新的分类方法并探讨其在多个机器学习领域的应用及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03814 2025-12-29 cs.LG cs.AI cs.CL 75%

Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?

LLMs中的递归训练循环:训练数据属性如何调节生成数据中的分布偏移

Grgur Kovač, Jérémy Perez, Rémy Portelas, Peter Ford Dominey, Pierre-Yves Oudeyer

机构 * Flowers TEAM, INRIA(INRIA Flowers TEAM) Ubisoft La Forge INSERM UMR 1093-CAPS Robot Cognition Laboratory, Institute Marey(Institute Marey Robot Cognition Laboratory)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLMs中递归训练循环中训练数据属性对生成数据分布偏移的影响,发现词汇多样性放大偏移,而语义多样性和数据质量减轻偏移,并揭示了不同领域数据之间的模块化影响。

Comments Accepted to EMNLP 2025 (Oral), Source Code: https://github.com/flowersteam/ce_llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00887 2025-12-23 cs.IR 75%

On Listwise Reranking for Corpus Feedback

基于语料反馈的列表级重排序

Soyoung Yoon, Jongho Kim, Daeyong Kwon, Avishek Anand, Seung-won Hwang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 L2G通过隐式诱导文档图实现高效基于图的检索,无需显式图计算开销,且在效果上与基于oracle的图方法相当。

Comments Accepted for WSDM 2026 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 75%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16901 2025-12-19 cs.LG cs.AI cs.CL cs.CY 75%

Impacts of Racial Bias in Historical Training Data for News AI

历史训练数据中的种族偏见对新闻AI的影响

Rahul Bhargava, Malene Hornstrup Jespersen, Emily Boardman Ndulue, Vivica Dsouza

机构 * Northeastern University(东北大学) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了基于历史训练数据的新闻AI中种族偏见的影响,发现'blacks'标签在某些群体中作为种族歧视检测器,但对现代案例表现不佳,揭示了新闻室在采用AI工具时需平衡效率与偏见风险的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15310 2025-12-18 cs.CV 75%

SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation

SynthSeg-Agents: 多智能体合成数据生成用于零样本弱监督语义分割

Wangyu Wu, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SynthSeg-Agents利用大型语言模型生成合成数据,无需现实图像即可实现零样本弱监督语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12938 2025-12-16 cs.IR 75%

SPAR: Session-based Pipeline for Adaptive Retrieval on Legacy File Systems

SPAR:基于会话的适应性检索管道

Duy A. Nguyen, Hai H. Do, Minh Doan, Minh N. Do

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SPAR通过轻量级两阶段流程整合LLMs与RAG架构,提升遗留文件系统中检索效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 75%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 75%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08764 2025-12-10 cs.CE 75%

Financial News Summarization: Can extractive methods still offer a true alternative to LLMs?

金融新闻摘要:提取方法是否仍然能为LLM提供真正的替代方案?

Nicolas Reche, Elvys Linhares-Pontes, Juan-Manuel Torres-Moreno

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了提取方法与LLM在金融新闻摘要中的性能,发现LLM虽更连贯但易出错,而提取方法在短文本上更高效且可靠。

Comments 8 pages, 5 tables

Journal ref Advances in Soft Computing. MICAI 2025. Lecture Notes in Computer Science, vol 16221. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02098 2025-12-08 cs.CL cs.AI cs.LG 75%

CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation

为你的数据集定制:通过语料检索与增强进行任务特定合成数据集生成

Ingo Ziegler, Abdullatif Köksal, Desmond Elliott, Hinrich Schütze

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Center for Information and Language Processing (CIS), LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CRAFT通过语料检索与增强生成任务特定合成数据集,有效提升问答和摘要任务的模型性能。

Comments Accepted at TACL; Pre-MIT Press publication version. Code and dataset available at: https://github.com/ziegler-ingo/CRAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 75%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 75%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 75%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18335 2025-11-25 cs.CL cs.AI cs.LG 75%

OmniStruct: Universal Text-to-Structure Generation across Diverse Schemas

OmniStruct: 跨多样的模式生成的通用文本到结构生成

James Y. Huang, Wenxuan Zhou, Nan Xu, Fei Wang, Qin Liu, Sheng Zhang, Hoifung Poon, Muhao Chen

机构 * University of Southern California(南加州大学) University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniStruct提出了一种跨多种模式的通用文本到结构生成方法,通过合成数据训练小型模型,实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16028 2025-11-21 cs.CY 75%

Can Online GenAI Discussion Serve as Bellwether for Labor Market Shifts?

在线生成式AI讨论能否作为劳动力市场转变的风向标?

Shurui Cao, Wenyue Hua, William Yang Wang, Hong Shen, Fei Fang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究在线生成式AI讨论是否能作为劳动力市场转变的早期预测指标,通过分析讨论强度与就业变化的关系,证明其对劳动力动态的预测有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12690 2025-11-18 cs.CL cs.AI cs.LG 75%

Improving Direct Persian-English Speech-to-Speech Translation with Discrete Units and Synthetic Parallel Data

Sina Rashidi, Hossein Sameti

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏