arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140188 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2601.08699 2026-01-14 cs.CL 70%

RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis

RAGShaper: 通过自动化数据合成激发复杂的代理RAG技能

Zhengwei Tao, Bo Li, Jialong Wu, Guochen Yan, Huanyao Zhang, Jiahao Xu, Haitao Mi, Wentao Zhang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAGShaper通过自动化数据合成构建高质量RAG任务和代理轨迹,提升模型在复杂检索任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08316 2026-01-14 cs.LG cs.CV stat.ML 70%

Deep Exploration of Epoch-wise Double Descent in Noisy Data: Signal Separation, Large Activation, and Benign Overfitting

深度探索噪声数据中的按epoch双下降现象:信号分离、大激活和良性过拟合

Tomoki Kubo, Ryuken Uda, Yusuke Iida

机构 * Niigata University(Niigata大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过分析噪声数据中的深度双下降现象,揭示了良性过拟合、信号分离和大激活等关键现象之间的联系。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18284 2026-01-13 cs.AI 70%

What Can We Actually Steer? A Multi-Behavior Study of Activation Control

我们实际上能控制什么?激活控制的多行为研究

Tetiana Bas, Krystian Novak

机构 * Department of Computer Science(计算机科学系) Minerva University(明维大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了激活控制在不同行为类型中的有效性差异,发现行为类型显著影响控制效果,特征表达呈倒U型曲线,训练数据量影响控制强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06113 2026-01-13 cs.AI 70%

Towards Infinite Length Extrapolation: A Unified Approach

迈向无限长度外推:一种统一方法

Nitin Vetcha

机构 * Department of Computer Science(计算机科学系) Indian Institute of Science(印度科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一框架,通过自适应位置编码方法解决长序列处理中的限制,实现了无限上下文外推。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00005 2026-01-09 cs.CR cs.AI stat.AP 70%

Per-sender neural network classifiers for email authorship validation

针对电子邮件作者身份验证的每发件人神经网络分类器

Rohit Dube

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于每发件人写作风格的神经网络分类器,用于验证电子邮件的作者身份,通过实验表明Char-CNN模型在不同情况下均能实现高准确率和F1分数。

Comments 12 pages, 6 figures, 8 tables, 41 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02578 2026-01-07 cs.CL cs.IR 70%

DataParasite Enables Scalable and Repurposable Online Data Curation

DataParasite 实现可扩展和可复用的在线数据整理

Mengyi Sun

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataParasite通过轻量级配置和自然语言指令实现高效、可复用的在线数据收集,显著降低数据整理成本与技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20293 2026-01-06 cs.CL 70%

AprielGuard

AprielGuard:一个统一安全与对抗防御的8B参数模型

Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana, Lakshmi Sirisha Chodisetty, Sourav Sharma, Abhigya Verma, Abhishek Bhardwaj, Debasish Kanhar, Aakash Bhagat, Khalil Slimi, Seganrasan Subramanian, Sathwik Tejaswi Madhusudhan, Ranga Prasad Chenna, Srinivas Sunkara

机构 * AprielGuard

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 70%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00891 2026-01-06 cs.IR cs.AI 70%

Enhancing Retrieval-Augmented Generation with Topic-Enriched Embeddings: A Hybrid Approach Integrating Traditional NLP Techniques

通过主题增强嵌入提升检索增强生成:一种整合传统NLP技术的混合方法

Rodrigo Kataishi

机构 * National University of Tierra del Fuego(泰德菲国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种整合传统NLP技术的混合方法,通过主题增强嵌入提升检索增强生成系统的检索精度和语义聚类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24826 2026-01-01 cs.CV cs.AI 70%

Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free Control

用于多物体3D场景的2D系统中视频与语言对齐的多信息无导数控制

Jason Armitage, Rico Sennnrich

机构 * University of Zurich(苏黎世大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种无导数优化方法,用于在多物体3D场景中实现视频与语言的对齐,通过在线适应物体遮挡和区分特征来提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23611 2025-12-30 cs.CL 70%

Close the Loop: Synthesizing Infinite Tool-Use Data via Multi-Agent Role-Playing

闭环:通过多智能体角色扮演合成无限工具使用数据

Yuwen Li, Wei Zhang, Zelong Huang, Mason Yang, Jiajun Wu, Shawn Guo, Huahao Hu, Lingyi Sun, Jian Yang, Mingjie Tang, Byran Dai

机构 * Sichuan University(四川大学) Beihang University(北航) IQuest Research(IQuest研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 InfTool通过多智能体角色扮演自动生成无限工具使用数据,显著提升大语言模型的调用准确性,无需人工标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23524 2025-12-30 cs.LG stat.ML 70%

Trustworthy Machine Learning under Distribution Shifts

在分布偏移下可信的机器学习

Zhuo Huang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在通过提升鲁棒性、可解释性和适应性,在分布偏移下增强机器学习系统的可靠性与责任性。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23280 2025-12-30 cs.CL 70%

Chinese Morph Resolution in E-commerce Live Streaming Scenarios

电商直播场景中的中文形态解析

Jiahao Zhu, Jipeng Qiang, Ran Bai, Chenyu Liu, Xiaoye Ouyang

机构 * School of Information Engineering, Yangzhou University, China(扬州大学信息工程学院) China Academy of Electronic and Information Technology, China(中国电子信息技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出LiveAMR任务,通过形态解析技术提升电商直播中的虚假宣传检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22199 2025-12-30 cs.AI 70%

Bidirectional RAG: Safe Self-Improving Retrieval-Augmented Generation Through Multi-Stage Validation

双向RAG:通过多阶段验证实现安全的自我改进检索增强生成

Teja Chinthala

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 双向RAG通过多阶段验证实现安全的自我改进检索增强生成,提高了覆盖率并减少了文档数量,展示了RAG系统在严格验证下的可行性。

Comments 10 pages, 2 figures, 2 tables. 36 experiments across 4 datasets with 3 random seeds. Code available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22146 2025-12-30 eess.SP cs.LG cs.SD 70%

EEG-to-Voice Decoding of Spoken and Imagined speech Using Non-Invasive EEG

通过非侵入性EEG解码 spoken 和 imagined 语音

Hanbeot Park, Yunjeong Cho, Hunhee Kim

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出了一种无需显式时间对齐的EEG-to-Voice方法,通过非侵入性EEG信号直接重建说话和想象语音,结合生成器、语音编码器和自动语音识别模块,实现了稳定的声学重建和可比的语言准确性。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 70%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03634 2025-12-19 cs.LG 70%

nanoTabPFN: A Lightweight and Educational Reimplementation of TabPFN

nanoTabPFN:一种轻量级且教育性的TabPFN重实现

Alexander Pfefferle, Johannes Hog, Lennart Purucker, Frank Hutter

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Freiburg(弗赖堡大学) Prior Labs(Prior实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 nanoTabPFN通过轻量级实现和预生成训练数据,使表格基础模型更易于教育使用,预训练速度比TabPFN v2快160,000倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15446 2025-12-18 cs.CL 70%

Toward expert-level motivational interviewing for health behavior improvement with LLMs

迈向利用大语言模型的专家级激励访谈以改善健康行为

Run-ze Hu, Yang Yang, Yi-hang Yang, Jing-qi Kong, Jia-hui Luo, Wen-yu Yang, Jing Chen, Jing-yao Liu, Hui-qun Zeng, Lei Zhang, Zheng Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过开发和评估基于大语言模型的激励访谈系统,探索了利用AI促进健康行为改变的可行性,展示了微调后模型在激励访谈技术上的表现。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14239 2025-12-17 cs.CL 70%

Two CFG Nahuatl for automatic corpora expansion

两种CFG用于自动语料库扩展

Juan-José Guzmán-Landa, Juan-Manuel Torres-Moreno, Miguel Figueroa-Saavedra, Ligia Quintana-Torres, Graham Ranger Martha-Lorena Avendaño-Garrido

机构 * Laboratoire Informatique d’Avignon(阿维尼翁信息实验室) Laboratoire Identités Culturelles, Textes et Théâtralité Avignon Université(阿维尼翁文化身份、文本与戏剧性实验室) Instituto de Investigaciones en Educación(教育研究 institute) Facultad de Matemáticas Universidad Veracruzana(韦拉克鲁斯大学数学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出两种CFG用于扩展纳瓦特语语料库,以生成合成句子并提升嵌入学习效果。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13472 2025-12-16 cs.CL 70%

Scaling Laws for Code: Every Programming Language Matters

代码的缩放定律:每种编程语言都至关重要

Jian Yang, Shawn Guo, Lin Jing, Wei Zhang, Aishan Liu, Chuan Hao, Zhoujun Li, Wayne Xin Zhao, Xianglong Liu, Weifeng Lv, Bryan Dai

机构 * Beihang University(北京航空航天大学) Ubiquant

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文首次系统研究了多语言代码预训练的缩放定律,通过大规模实验揭示不同编程语言在模型大小和数据量上的差异影响,并提出比例依赖的多语言缩放定律以优化训练资源分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12201 2025-12-16 cs.HC cs.AI 70%

Epistemoverse: Toward an AI-Driven Knowledge Metaverse for Intellectual Heritage Preservation

Epistemoverse: 向一个由人工智能驱动的知识元宇宙,用于保护智力遗产

Predrag K. Nikolić, Robert Prentner

机构 * School of Design Arts\ University of Technology Kuching Malaysia Institute of Humanities ShanghaiTech University Shanghai China Arts\ University of Technology Institute of Humanities ShanghaiTech University

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Epistemoverse概念,通过AI驱动的互动,构建知识元宇宙以保护和扩展智力遗产。

Comments 7 pages, 7 figures, presented at SIGGRAPH VRCAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12175 2025-12-16 cs.AI 70%

Rethinking Label Consistency of In-Context Learning: An Implicit Transductive Label Propagation Perspective

重新思考上下文学习中的标签一致性:一种隐含的归纳标签传播视角

Haoyang Chen, Richong Zhang, Junfan Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从归纳标签传播视角重新思考上下文学习中的标签一致性问题,提出TopK-SD方法提升演示的一致性,优于传统TopK采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18156 2025-12-12 cs.AI 70%

AI Through the Human Lens: Investigating Cognitive Theories in Machine Psychology

通过人类之眼审视人工智能:在机器心理学中探究认知理论

Akash Kundu, Rishika Goswami

机构 * Heritage Institute of Technology(赫里蒂奇理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过四个心理学框架研究LLMs的认知模式,发现其在叙述生成、框架偏差、道德判断和自我矛盾等方面表现出与人类相似但受训练数据影响的行为特征。

Comments Accepted to IJCNLP-AACL 2025 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01790 2025-12-08 cs.LG cs.CR 70%

IF-GUIDE: Influence Function-Guided Detoxification of LLMs

IF-GUIDE:影响函数引导的LLM去毒化

Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学) University of Toronto(多伦多大学) Anthropic

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 IF-GUIDE通过影响函数主动识别并抑制训练数据中的有害标记,有效减少大语言模型的显性和隐性毒性。

Comments Accepted at NeurIPS 2025 [Poster]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04319 2025-12-05 cs.SE cs.AI 70%

MANTRA: a Framework for Multi-stage Adaptive Noise TReAtment During Training

MANTRA: 一个用于训练期间多阶段自适应噪声处理的框架

Zixiao Zhao, Fatemeh H. Fard, Jie JW Wu

机构 * University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MANTRA通过多阶段自适应噪声处理框架提升代码预训练模型和LLMs在软件工程任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16717 2025-12-05 cs.CL 70%

Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling

半监督合成数据生成与细粒度相关性控制用于短视频搜索相关性建模

Haoran Li, Zhiming Su, Junyan Yao, Enwei Zhang, Yang Ji, Yan Chen, Kan Zhou, Chao Feng, Jiao Ran

专题命中 预训练与数据 :SFT(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出一种半监督合成数据生成方法,通过细粒度相关性控制提升短视频搜索相关性建模效果,实验显示其在推荐系统中提升了CTR、SRR和IUPR

Comments Submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01269 2025-12-05 cs.CL cs.CY 70%

ChatGPT for President! Presupposed content in politicians versus GPT-generated texts

总统用ChatGPT!政治家与GPT生成文本中的预设内容

Davide Garassino, Nicola Brocca, Viviana Masia

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析ChatGPT生成文本与政治家演讲在预设使用上的差异,揭示其在政治话语中的潜在风险。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16345 2025-12-04 cs.CL 70%

NLP Datasets for Idiom and Figurative Language Tasks

用于隐喻和修辞语言任务的NLP数据集

Blake Matheny, Phuong Minh Nguyen, Minh Le Nguyen, Stephanie Reynolds

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究院) International College of Technology(国际技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出用于隐喻和修辞语言任务的NLP数据集,通过构建综合隐喻列表和人工标注数据集,评估预训练语言模型在隐喻识别任务中的表现。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19153 2025-12-04 cs.LG 70%

Test-Time Training Scaling Laws for Chemical Exploration in Drug Design

药物设计中的测试时间训练扩展规律用于化学探索

Morgan Thomas, Albert Bou, Gianni De Fabritiis

机构 * Computational Science Laboratory, Universitat Pompeu Fabra, Barcelona Biomedical Research Park (PRBB), C Dr. Aiguader 88, 08003 Barcelona, Spain(计算科学实验室,庞培法布拉大学,巴塞罗那生物医学研究公园(PRBB),C Dr. Aiguader 88,08003巴塞罗那,西班牙)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出通过扩展测试时间训练方法提升化学空间探索效率,引入MolExp基准并验证了扩展TTT的对数线性扩展规律,为生成分子设计提供了可扩展的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02713 2025-12-03 cs.AI 70%

Training Data Attribution for Image Generation using Ontology-Aligned Knowledge Graphs

利用本体对齐的知识图谱训练数据归因于图像生成

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research ``Demokritos''(国家科学研究中心「德莫克里特」) University of Glasgow(格拉斯哥大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用本体对齐的知识图谱方法,通过多模态大语言模型提取图像中的结构化三元组,以追踪生成模型中训练数据的影响,从而提升透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏