arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2409.10825 2026-02-02 cs.IR cs.AI cs.ET cs.LG 90%

Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness

揭示和缓解大型语言模型推荐中的偏见:走向公平的一条路

Anindya Bijoy Das, Shahnewaz Karim Sakib

机构 * Computer Science and Engineering, University of Tennessee at Chattanooga(计算机科学与工程系,田纳西大学查塔努加分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于LLM的推荐系统中的偏见问题,提出通过提示工程和检索增强生成策略来缓解偏见,以实现更公平的推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23090 2026-02-02 cs.CE q-bio.QM 82%

Omni-fMRI: A Universal Atlas-Free fMRI Foundation Model

Omni-fMRI:一种无图谱的fMRI基础模型

Mo Wang, Wenhao Ye, Junfeng Xia, Junxiang Zhang, Xuanye Pan, Minghao Xu, Haotian Deng, Hongkai Wen, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Omni-fMRI提出了一种无需图谱的fMRI基础模型,通过动态拼接机制实现高效预训练,提升了脑表示学习的可扩展性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04347 2026-02-02 cs.CL cs.LG 81%

Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models

揭示后门:通过梯度-注意力异常评分对预训练语言模型进行可解释防御

Anindya Sundar Das, Kangjie Chen, Monowar Bhuyan

机构 * Umeå University(乌梅学院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过梯度-注意力异常评分对预训练语言模型进行可解释防御,有效降低后门攻击成功率。

Comments 17 pages total (9 pages main text + 6 pages appendix + references), 16 figures. Preprint version; the final camera-ready version may differ. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22467 2026-02-02 cs.RO cs.CV 78%

CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control

CARE:用于机器人控制的潜在连续动作表示的多任务预训练

Jiaqi Shi, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CARE通过多任务预训练学习连续动作表示,提升机器人控制的可扩展性和可解释性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22935 2026-02-02 cs.CR cs.AI 77%

Protecting Private Code in IDE Autocomplete using Differential Privacy

在IDE自动补全中使用差分隐私保护私有代码

Evgeny Grigorenko, David Stanojević, David Ilić, Egor Bogomolov, Kostadin Cvejoski

机构 * JetBrains Research(JetBrains研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用差分隐私保护IDE自动补全中用户代码隐私,通过DP训练模型有效防御成员推断攻击,同时保持模型性能。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00219 2026-02-02 cs.LG cs.AI cs.CL cs.NE 75%

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

Thoughtbubbles: 一种用于潜在空间中并行思维的无监督方法

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás

机构 * Department of Computer Science, Stanford University, Stanford, CA, United States(计算机科学系,斯坦福大学,斯坦福,CA,美国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoughtbubbles是一种通过预训练学习并行自适应计算的转换器变体,能够在潜在空间中实现更高效的计算,提升模型的推理性能和零样本评估表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 73%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00068 2026-02-02 cs.CL cs.AI 73%

Framing Political Bias in Multilingual LLMs Across Pakistani Languages

在巴基斯坦多种语言中框架化政治偏见

Afrozah Nadeem, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了巴基斯坦五种语言中13种先进LLM的政治偏见,发现其在区域语言中表现出更集权的框架,强调文化适应的偏见审计框架的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23153 2026-02-02 cs.LG 70%

Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data

Behemoth:使用完全合成数据对LLM中的去学习进行基准测试

Eugenia Iofinova, Dan Alistarh

机构 * IST Austria(IST奥地利研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Behemoth通过完全合成数据框架评估大语言模型中的去学习效果,揭示了模型编辑的挑战与改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02521 2026-02-02 cs.SD cs.AI cs.CL 62%

FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training

FLM-Audio: 自然独白提升原生全双工聊天机器人通过双训练

Yiqun Yao, Xiang Li, Xin Jiang, Xuezhi Fang, Naitong Yu, Wenjia Ma, Aixin Sun, Yequan Wang

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 FLM-Audio通过双训练策略和连续独白提升全双工聊天机器人的响应质量和体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22439 2026-02-02 cs.CL 61%

Stop Jostling: Adaptive Negative Sampling Reduces the Marginalization of Low-Resource Language Tokens by Cross-Entropy Loss

停止推搡:自适应负采样减少交叉熵损失对低资源语言标记的边缘化

Galim Turumtaev

专题命中 预训练与数据 :language model(abstract,journal_ref);分类 cs.CL

AI总结 本文提出自适应负采样技术,通过减少交叉熵损失对低资源语言标记的边缘化影响,提升模型对低资源语言的表示能力。

Comments Accepted at LoResLM 2025 (COLING 2025 workshop). Oral presentation

Journal ref In Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025), pages 373-386, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22410 2026-02-02 cs.CL 57%

Word-Centered Semantic Graphs for Interpretable Diachronic Sense Tracking

基于词中心语义图的可解释历时意义跟踪

Imene Kolli, Kai-Robin Lange, Jonas Rieger, Carsten Jentsch

机构 * University of Zurich(苏黎世大学) TU Dortmund University(多特蒙德技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出基于词中心语义图的方法,用于可解释地追踪词义随时间的变化,通过整合分布相似性和词汇替代性,揭示多义性动态和意义演变轨迹。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06746 2026-02-02 cs.CV cs.AI 57%

AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment

AlignGemini: 通过任务-模型对齐实现通用的AI生成图像检测

Ruoxin Chen, Jiahui Gao, Kaiqing Lin, Keyue Zhang, Yandan Zhao, Isabel Guan, Taiping Yao, Shouhong Ding

机构 * Tencent Youtu Lab East China University of Science Shenzhen University Hong Kong University of Science Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 AlignGemini通过任务-模型对齐原则,结合语义和像素伪影检测,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21280 2026-02-02 cs.CV 50%

Token Entropy Regularization for Multi-modal Antenna Affiliation Identification

基于令牌熵正则化的多模态天线归属识别

Dong Chen, Ruoyu Li, Xinyan Zhang, Jialei Xu, Ruosen Zhao, Zhikang Zhang, Lingyun Li, Zizhuang Wei

机构 * Huawei(华为) The University of Hong Kong(香港大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于令牌熵正则化的多模态天线归属识别方法,通过融合视频、几何特征和PCI信号,提升通信网络优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏