arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-22 至 2026-01-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2601.14603 2026-01-22 cs.LG 90%

Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum

方差自适应缪子:通过NSR调制和方差缩放的动量加速大语言模型预训练

Jingru Li, Yibo Fan, Huan Li

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出缪子-NSR和缪子-VS两种方法,通过方差自适应归一化和NSR调制或方差缩放,加速大语言模型预训练,提升收敛速度并降低验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12986 2026-01-22 cs.CR 88%

KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing

KinGuard:分层的亲属意识指纹法用于防御大语言模型窃取

Zhenhua Xu, Xiaoning Tian, Wenjun Zeng, Wenpeng Xing, Tianliang Lu, Gaolei Li, Chaochao Chen, Meng Han

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 KinGuard通过构建基于亲属叙述的知识库,利用增量预训练内化知识,实现对大语言模型的高效且安全的指纹保护。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14780 2026-01-22 cs.CL cs.AI 87%

RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models

RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉

Anqi Li, Yuqian Chen, Yu Lu, Zhaoming Chen, Yuan Xie, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14532 2026-01-22 cs.LG 85%

Search over Self-Edit Strategies for LLM Adaptation

基于自我编辑策略的LLM适应研究

Alistair Cheong, Haolin Cong, Tyler Yang, Dustin Miao

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本研究探讨了LLM能否利用任务反馈自适应更新其权重,通过SEAL框架测试,发现有档案变体在SQuAD上表现优于基线,但未超越人类设计策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11789 2026-01-22 cs.CL 85%

Personality Editing for Language Models through Adjusting Self-Referential Queries

通过调整自我参照查询进行语言模型的人格编辑

Seojin Hwang, Yumin Kim, Byeongjeong Kim, Donghoon Shin, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 PALETTE通过调整自我参照查询实现语言模型的人格编辑,仅需12个样本即可显著提升人格对齐性。

Comments Accepted to EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14658 2026-01-22 cs.CL cs.AI 79%

Say Anything but This: When Tokenizer Betrays Reasoning in LLMs

说任何事但并非如此:当分词器背叛大语言模型的推理

Navid Ayoobi, Marcus I Armstrong, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现分词器的不一致导致LLM推理错误,通过一致性探针揭示了分词引起的表征缺陷,并提出分词层面的修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12534 2026-01-22 cs.CV cs.AI 70%

Encoding Emotion Through Self-Supervised Eye Movement Reconstruction

通过自监督眼动重建编码情感

Marcus Ma, Jordan Prescott, Emily Zhou, Tiantian Feng, Kleanthis Avramidis, Gabor Mihaly Toth, Shrikanth Narayanan

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种自监督眼动重建模型,用于从自然主义低分辨率视频中预测情绪表达的多模态标记,通过微调两个下游任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24709 2026-01-22 cs.CV cs.AI cs.LG q-bio.NC 62%

Does Object Binding Naturally Emerge in Large Pretrained Vision Transformers?

大规模预训练视觉变换器中物体绑定是否自然涌现?

Yihao Li, Saeed Salehi, Lyle Ungar, Konrad P. Kording

机构 * University of Pennsylvania(宾夕法尼亚大学) Machine Learning Group, Technical University of Berlin(柏林技术大学机器学习小组)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大规模预训练视觉变换器中自然涌现出物体绑定能力,通过分析ViT各层嵌入发现IsSameObject能有效引导注意力,挑战了ViTs缺乏物体绑定的传统观点。

Comments Accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14633 2026-01-22 cs.LG 57%

Relational Graph Modeling for Credit Default Prediction: Heterogeneous GNNs and Hybrid Ensemble Learning

关系图建模用于信用违约预测:异构GNN与混合集成学习

Yvonne Yang, Eranki Vasistha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出异构图神经网络与混合集成学习方法,通过构建大规模异构图整合借款人与交易数据,提升信用违约预测的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14771 2026-01-22 cs.CV 50%

Using Multi-Instance Learning to Identify Unique Polyps in Colon Capsule Endoscopy Images

利用多实例学习识别结肠胶囊内镜图像中的独特息肉

Puneet Sharma, Kristian Dalsbø Hindberg, Eibe Frank, Benedicte Schelde-Olesen, Ulrik Deding

机构 * Department of Automation and Process Engineering, Machine Learning Group(自动化与过程工程系,机器学习组) UiT – The Arctic University of Norway(UiT – 北极大学) Department of Physics and Technology, Machine Learning Group(物理与技术系,机器学习组) University of Waikato(瓦卡托大学) Odense University Hospital(奥登塞大学医院) University of Southern Denmark(南丹麦大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出利用多实例学习和注意力机制提升结肠胶囊内镜图像中息肉识别的准确性,通过自监督学习优化模型性能,达到86.26%的测试准确率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏