arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2601.02830 2026-01-08 cs.CL 89%

The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture

中中美大语言模型在中华文化传播主题上的表现

Feiyan Liu, Siyan Zhao, Chenxun Zhuo, Tianming Liu, Bao Ge

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了中美开发的大语言模型在中华文化传播问题上的表现,发现中国模型在相关任务上普遍优于美国模型,且Gemini 2.5Pro和GPT-5.1表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03600 2026-01-08 cs.LG cs.AI cs.IR 84%

ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification

ALERT: 通过内部不一致放大实现零样本LLM jailbreak检测

Xiao Lin, Philip Li, Zhichen Zeng, Tingwei Li, Tianxin Wei, Xuying Ning, Gaotang Li, Yuzhong Chen, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Visa

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ALERT通过内部不一致放大技术实现零样本LLM jailbreak检测,有效提升安全检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03676 2026-01-08 cs.CL cs.AI 79%

Towards Compositional Generalization of LLMs via Skill Taxonomy Guided Data Synthesis

通过技能分类引导的数据合成实现大语言模型的组合泛化

Yifan Wei, Li Du, Xiaoyan Yu, Yang Feng, Angsheng Li

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Institute of Technology(北京理工大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 STEPS通过技能分类引导的数据合成提升大语言模型的组合泛化能力。

Comments The code and data for our methods and experiments are available at https://github.com/weiyifan1023/STEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08106 2026-01-08 cs.CV 78%

Generalized Logit Adjustment: Calibrating Fine-tuned Models by Removing Label Bias in Foundation Models

广义对数调整:通过消除基础模型中的标签偏见来校准微调模型

Beier Zhu, Kaihua Tang, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出广义对数调整方法,通过消除基础模型中的标签偏见,提升多种任务的性能。

Comments Accepted by NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00919 2026-01-08 cs.LG cs.AI cs.CL 75%

Attention Needs to Focus: A Unified Perspective on Attention Allocation

注意力需要聚焦:注意力分配的统一视角

Zichuan Fu, Wentao Song, Guojing Li, Yejing Wang, Xian Wu, Yimin Deng, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Lazy Attention机制,通过位置歧视和Elastic-Softmax解决注意力过载和不足问题,提升注意力分配效率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03469 2026-01-08 econ.EM cs.AI cs.CL cs.CY 73%

Content vs. Form: What Drives the Writing Score Gap Across Socioeconomic Backgrounds? A Generated Panel Approach

内容与形式:不同社会经济背景下写作分数差距的驱动因素?一种生成面板方法

Nadav Kunievsky, Pedro Pertusi

机构 * Knowledge Lab, University of Chicago(芝加哥大学知识实验室) Insper, Institute of Education and Research(Insper教育与研究学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过生成面板方法研究社会经济地位对写作分数差距的影响,发现内容质量占69%,风格差异占26%,评估标准差异占5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03420 2026-01-08 cs.LG cs.AI cs.CR 73%

Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks

无需梯度或先验知识的LLM劫持:有效且可转移的攻击

Zhakshylyk Nurlanov, Frank R. Schmidt, Florian Bernard

机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) Bosch Center for Artificial Intelligence(博世人工智能中心) University of Bonn(波恩大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23163 2026-01-08 cs.CL cs.AI 73%

Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs

超越直接生成:一种分解方法用于利用LLM进行精心构思的剧本创作

Hang Lei, Shengyi Zong, Zhaoyan Li, Ziren Zhou, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出双阶段细化框架,通过分解生成方法提升LLM在剧本创作中的表现,实现高质量剧本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15722 2026-01-08 cs.CL cs.AI 73%

Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similarities

共享路径:通过语言相似性揭示多语言大语言模型中的记忆现象

Xiaoyu Luo, Yiyi Chen, Johannes Bjerva, Qiongxiu Li

机构 * Department of Computer Science(计算机科学系) Department of Electronic Systems(电子系统系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过语言相似性分析,揭示多语言大语言模型中记忆现象的跨语言关联及其影响因素。

Comments 17 pages, 14 tables, 10 figures

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 19372-19388, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03368 2026-01-08 cs.CL cs.LG stat.ML 62%

A path to natural language through tokenisation and transformers

通过分词和转换器模型实现自然语言的一条路径

David S. Berman, Alexander G. Stapleton

机构 * Centre for Theoretical Physics, Queen Mary University of London(理论物理中心,伦敦女王学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了BPE分词对自然语言统计特性的影响,发现其不仅压缩数据,还重构了语言的信息属性。

Comments 19 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03906 2026-01-08 cs.LG cs.AI cs.CE 62%

Instructor-inspired Machine Learning for Robust Molecular Property Prediction

受指导的机器学习用于鲁棒分子性质预测

Fang Wu, Shuting Jin, Siyuan Li, Stan Z. Li

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 InstructMol通过指导学习方法提升分子性质预测的鲁棒性,有效利用大规模未标记数据提高预测准确性。

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03782 2026-01-08 cs.RO cs.AI cs.CV 57%

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

PointWorld: 为真实世界机器人操作扩展3D世界模型

Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, Li Fei-Fei

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI

AI总结 PointWorld通过统一状态和动作的3D点流模型,实现了在真实世界中机器人操作的高效预测与控制,无需额外演示或训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03955 2026-01-08 cs.CV 50%

ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation

ResTok: 在1D视觉分词器中学习层次化残差以实现自回归图像生成

Xu Zhang, Cheng Da, Huan Yang, Kun Gai, Ming Lu, Zhan Ma

机构 * Vision Lab, Nanjing University(南京大学视觉实验室) Kolors Team, Kuaishou Technology(快手技术Kolors团队)

专题命中 预训练与数据 :language model(abstract)

AI总结 ResTok通过引入层次化残差机制提升自回归图像生成效果,实现更高效的潜在分布建模与生成过程。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03449 2026-01-08 cs.RO 50%

FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin

FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪

Chris Webb, Mobin Habibpour, Mayamin Hamid Raha, Ali Reza Tavakkoli, Janice Coen, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) University of Nevada, Reno(内华达大学拉斯维加斯分校) NSF NCAR(国家科学基金会NCAR)

专题命中 预训练与数据 :language model(abstract)

AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏