arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

1709.08878 2018-09-10 cs.CL cs.AI cs.LG cs.NE stat.ML 67%

Generating Sentences by Editing Prototypes

Kelvin Guu, Tatsunori B. Hashimoto, Yonatan Oren, Percy Liang

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, Transactions of the Association for Computational Linguistics (TACL), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.00224 2018-09-05 cs.AI cs.CL cs.LG 67%

Finding the Answers with Definition Models

Jack Parry

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments MSc Dissertation, University of Edinburgh, <10,000 words

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.00818 2018-07-04 cs.CL cs.AI cs.LG stat.ML 67%

Improving part-of-speech tagging via multi-task learning and character-level word representations

Daniil Anastasyev, Ilya Gusev, Eugene Indenbom

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Computational Linguistics and Intellectual Technologies, Papers from the Annual International Conference "Dialogue" (2018) Issue 17, 14-27

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00489 2017-12-08 cs.CL cs.AI cs.CV cs.LG eess.AS 67%

Visual Features for Context-Aware Speech Recognition

Abhinav Gupta, Yajie Miao, Leonardo Neves, Florian Metze

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 5 pages and 3 figures

Journal ref IEEE Xplore (ICASSP) (2017) 5020-5024

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.02467 2016-12-19 cs.AI cs.CL cs.LG cs.NE 67%

Log-Linear RNNs: Towards Recurrent Neural Networks with Flexible Prior Knowledge

Marc Dymetman, Chunyang Xiao

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Updated version of arXiv:1607.02467. Presented at the NIPS-2016 RNN Symposium, Barcelona, December 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.04808 2016-04-08 cs.CL cs.AI cs.LG cs.NE 67%

Building End-To-End Dialogue Systems Using Generative Hierarchical Neural Network Models

Iulian V. Serban, Alessandro Sordoni, Yoshua Bengio, Aaron Courville, Joelle Pineau

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages with references; Published in AAAI 2016 (Special Track on Cognitive Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/9809110 2009-11-30 cs.CL cs.AI cs.LG 67%

Similarity-Based Models of Word Cooccurrence Probabilities

Ido Dagan, Lillian Lee, Fernando C. N. Pereira

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 5 figures

Journal ref Machine Learning, 34, 43-69 (1999)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15250 2025-12-18 cs.LG cs.AI 66%

Leveraging Foundational Models and Simple Fusion for Multi-modal Physiological Signal Analysis

利用基础模型和简单融合进行多模态生理信号分析

Youssef Ghallab, Omar Iraqy, Mohamed Kandil, Mohamed Ashraf, Saadeldine Eletter, Morougue Ghazal, Ayman Khalafallah, Nagwa El-Makky

机构 * Computer and Communication Engineering Department, Alexandria University(亚历山大大学计算机与通信工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG;foundation model(comments)

AI总结 本文提出利用基础模型和简单融合方法,通过双掩码策略和对称编码器提升多模态生理信号分析的性能,实现情绪识别的高精度结果。

Comments Published at NeurIPS 2025 Workshop on Foundation Models for the Brain and Body

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09440 2025-07-15 cs.LG cs.AI 66%

Transformers Don't In-Context Learn Least Squares Regression

Joshua Hill, Benjamin Eyre, Elliot Creager

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG;foundation model(comments)

Comments 21 pages, 16 figures, ICML 2025 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07925 2024-05-14 cs.LG cs.AI cs.DC 66%

Stable Diffusion-based Data Augmentation for Federated Learning with Non-IID Data

Mahdi Morafah, Matthias Reisser, Bill Lin, Christos Louizos

专题命中 预训练与数据 :foundation model(abstract,comments);分类 cs.AI、cs.LG

Comments International Workshop on Federated Foundation Models for the Web 2024 (FL@FM-TheWebConf'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08496 2022-10-18 cs.LG cs.AI 66%

Self-Supervised Contrastive Pre-Training For Time Series via Time-Frequency Consistency

Xiang Zhang, Ziyuan Zhao, Theodoros Tsiligkaridis, Marinka Zitnik

专题命中 预训练与数据 :pretraining(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted by NeruIPS 2022; 32pages (14 pages main paper + 18 pages supplementary materials). Code: https://github.com/mims-harvard/TFC-pretraining

Journal ref NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11903 2026-06-02 cs.CL 65%

GeistBERT: Breathing Life into German NLP

GeistBERT: 为德语 NLP 注入活力

Raphael Scheible-Schmitt, Johann Frei

专题命中 预训练与数据 :language model(abstract,journal_ref);分类 cs.CL;large language model(journal_ref)

AI总结 通过在大规模德语语料库上使用 RoBERTa 架构和 Whole Word Masking 进行增量预训练,GeistBERT 在多项德语 NLP 任务上取得了领先性能,并在 GermEval 2018 细粒度文本分类中达到新 SOTA。

Journal ref Proceedings of the Workshop on Beyond English: Natural Language Processing for all Languages in an Era of Large Language Models, 2025, pp. 42-50

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12948 2025-02-19 cs.CV cs.AI 65%

Fake It Till You Make It: Using Synthetic Data and Domain Knowledge for Improved Text-Based Learning for LGE Detection

Athira J Jacob, Puneet Sharma, Daniel Rueckert

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI;large language model(comments);language model(comments)

Comments Poster at Workshop on Large Language Models and Generative AI for Health at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07657 2024-01-17 cs.LG cs.CE q-bio.BM 65%

Empirical Evidence for the Fragment level Understanding on Drug Molecular Structure of LLMs

Xiuyuan Hu, Guoqing Liu, Yang Zhao, Hao Zhang

专题命中 预训练与数据 :language model(abstract,comments);分类 cs.LG;large language model(comments)

Comments Accepted by AAAI 2024 workshop: Large Language Models for Biological Discoveries (LLMs4Bio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24127 2026-08-26 cs.CR cs.CL cs.CY cs.LG 新提交 62%

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

诈骗电话剖析:10000个真实诈骗与垃圾电话揭示电话诈骗者的运作方式

Ethan Traister, Ankit Raj, Jiaqi Gan, Xingyu Shen, Tyler Wu, Yuchen Zhou, Tommy Duong, Kidus Zewde, Siying Chen, Simiao Ren

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究通过分析10211个真实电话数据,揭示诈骗电话遵循办公时间规律,会针对目标年龄调整施压程度但固定索要内容,且仅从开场话术即可早期检测,词袋分类器表现与微调模型相当。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-08-24 cs.SD cs.AI cs.CL cs.MM eess.AS 版本更新 62%

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19684 2026-08-21 cs.AI cs.LG cs.RO 新提交 62%

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

利用离线质量多样性强化学习学习分层技能策略

Tanachai Anakewat, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDOS算法,通过优势加权质量多样性预训练与双数据集复用策略,在分层技能学习框架下,于稀疏奖励任务中显著提升性能,优于强基线算法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19491 2026-08-21 cs.LG cs.CL math.OC stat.ML 新提交 62%

DeltaMomentum: A Key-Value based Anisotropic Momentum Update via Delta Rule

DeltaMomentum:基于键值结构的Delta规则各向异性动量更新

Euijin Hong, Guannan Qu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 DeltaMomentum将方向感知融入动量更新,可作为优化器动量缓冲器的即插即用替代,在预训练中减少AdamW步数,在多模型和数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18486 2026-08-20 cs.CL cs.LG 新提交 62%

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

WhiteMatter:通过KV混合实现全对全跨层连接

Wenbo Zhang, Xiang Ren

机构 * University of Southern California(南加州大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 WhiteMatter通过将每个注意力层连接到所有过去token的所有层表示,以可变连接权重实现全对全跨层KV混合,在预训练中性能优于多50%层数的普通Transformer,缓存压缩50%仍保留大部分增益。

Comments 15 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16612 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Degradation-Aligned Self-Supervised Learning for State of Health Estimation of Lithium-Ion Batteries under Label Sparsity

标签稀疏场景下锂离子电池健康状态估计的退化对齐自监督学习

Jiaqi Yao, Julia Kowal

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对标签稀疏下锂离子电池SOH估计问题,提出基于CNN-GRU的退化对齐SSL框架,利用排序预训练结合微调,仅用1%标注数据即可实现高精度SOH估计,为实际应用提供新方向。

Comments Submitted to and under review at Energy and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15964 2026-08-18 cs.CL cs.AI 新提交 62%

LLMs Get Smarter from Targeted Synthetic Multilingual Data

大语言模型(LLMs)从针对性的合成多语言数据中提升性能

Ishika Agarwal, Arkajyoti Charaborty, Tanner Sorensen, Neha Gupta, Andreas Stolcke

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Uniphore(优尼佛(Uniphore)公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HOTFIXR数据生成框架,通过探测学生模型多语言弱点生成合成多语言数据,可提升大语言模型的多语言性能,降低微调引发的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14675 2026-08-18 cs.LG cs.AI 新提交 62%

Take it Personally: The Limits of General SSL Representations for Real-Life PPG Emotion Detection

个性化考量:通用自监督学习表征在真实生活光体积描记(PPG)情感检测中的局限性

Dominika Kunc, Przemysław Kazienko, Stanisław Saganowski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫科技大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估PPG-based SSL在真实生活情感检测中的效能,发现通用SSL表征无法胜任主观情感推理,微调时纳入个人数据才是性能关键,公开了RL-PPG编码器相关资源。

Comments 9 pages, 4 Figures, 2 Tables, Accepted as the 14th International Conference on Affective Computing and Intelligent Interaction (ACII 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08067 2026-08-17 cs.CL cs.AI 版本更新 62%

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

DialectS2S:面向低资源汉语方言的端到端语音对话建模

Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Wuhan AI Research(武汉人工智能研究院) GWM AI Lab(长城汽车人工智能实验室)

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源汉语方言语音数据稀缺及语义不一致问题,提出DialectS2S模型,通过合成流水线与自对齐后训练策略提升方言语音生成质量,开源框架实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交 62%

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02462 2026-08-12 cs.LG cs.AI 版本更新 62%

Can Computational Reducibility Lead to Transferable Models for Graph Combinatorial Optimization?

计算可约性能否导致图组合优化的可迁移模型?

Semih Cantürk, Thomas Sabourin, Frederik Wenkel, Michael Perlmutter, Guy Wolf

机构 * Operations Research, Université de Montréal(运营研究,蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Valence Labs(Valence实验室) Dept. of Mathematics, Boise State University(数学系,博伊州立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于计算可约性的方法,通过表达性消息传递和预训练策略,在图组合优化中实现跨任务的可迁移模型。

Comments Accepted at ICML 2026; 20 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01401 2026-08-11 cs.LG cs.AI cs.CV 版本更新 62%

NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis

NeuroBridge:桥接多任务MRI知识用于神经退行性疾病诊断

Mengyu Li, Guoyao Shen, Chad W. Farris, Xin Zhang

机构 * Department of Mechanical Engineering, Boston University(波士顿大学机械工程系) The Photonics Center, Boston University(波士顿大学光子中心) Rafik B. Hariri Institute for Computing and Computational Science & Engineering, Boston University(波士顿大学拉菲克·B·哈里里计算与计算科学与工程研究所) Department of Radiology, Boston University Chobanian & Avedisian School of Medicine(波士顿大学切博尼亚与阿维迪亚安医学学院放射科) Department of Radiology, Boston Medical Center(波士顿医学中心放射科) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Biomedical Engineering, Boston University(波士顿大学生物医学工程系) Division of Materials Science and Engineering, Boston University(波士顿大学材料科学与工程系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出NeuroBridge框架,通过大规模自监督MRI预训练与多任务学习(海马分割、萎缩分类、重建)及门控融合微调,在AD和MCI诊断中达到88.17%准确率,优于单任务方法。

Comments 5 figures. 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27341 2026-08-11 cs.AI cs.CV cs.LG 版本更新 62%

A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

外科AI的比较研究:数据、计算和扩展的潜力与局限

Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara, Shauna Otto, Zhuang-Fang Yi, John Zhu, Neeraj Mainkar, Margaux Masson-Forsythe, Daniel A. Donoho, X. Y. Han

机构 * Center for Applied AI, Chicago Booth(应用人工智能中心,芝加哥商学院) Surgical Data Science Collective(外科数据科学集体) Children’s National Hospital(儿童医学中心) Operations Management & Tolan Center for Healthcare, Chicago Booth(运营管理与托兰医疗中心,芝加哥商学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过2026年最先进的AI方法,研究了外科手术工具检测中的性能和限制,发现即使使用多十亿参数模型和大量训练数据,当前的视觉语言模型在神经外科手术工具检测任务中仍表现不足,且模型规模和训练时间的增加对性能提升效果有限,表明当前AI在手术应用中仍面临显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05423 2026-08-07 cs.LG cs.AI 新提交 62%

Why the Third Axis Is Freedom

为何第三轴是自由

Michael Timothy Bennett

机构 * The Australian National University(澳大利亚国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究指出生成式训练中XM的第三轴实际是自由,通过理论与实验证明自由选择优于MDL,且在分布偏移下针对自由度的选择可提升XM表现。

Comments Experiment code available on GitHub, in the papers folder: https://github.com/ViscousLemming/Technical-Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04377 2026-08-06 cs.LG cs.AI 新提交 62%

Towards Trustworthy Hypergraph Neural Networks under Label Noise

面向标签噪声下可信赖的超图神经网络

Mengyao Zhou, Zhiheng Zhou, Xiao Han, Guiying Yan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文针对标签噪声下超图节点分类问题,提出超图鲁棒框架HyperTrust,通过估计超边可信赖性及两个协同模块优化超图结构,在多数据集多噪声设置下验证了其有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 62%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏