arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2511.03270 2025-12-12 cs.CL 88%

SCALE: Upscaled Continual Learning of Large Language Models

SCALE:大规模语言模型的扩展持续学习

Jin-woo Lee, Junhwa Choi, Bongkyu Hwang, Jinho Choo, Bogun Kim, JeongSeon Yi, Joonseok Lee, DongYoung Jung, Jaeseon Park, Kyoungwon Park, Suk-hoon Jung

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15432 2025-12-12 cs.AI cs.CL cs.LG 86%

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01951 2025-12-12 cs.AI cs.CL cs.CY 84%

The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data

大语言模型穿Prada:通过在线购物数据分析性别偏见和刻板印象

Massimiliano Luca, Ciro Beneduce, Bruno Lepri, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过在线购物数据分析大语言模型中的性别偏见,发现模型在性别预测中受刻板印象影响,且减少偏见指令只能降低预测确定性,无法消除刻板印象模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10169 2025-12-12 cs.AI cs.CY cs.LG 81%

The 2025 Foundation Model Transparency Index

2025基础模型透明度指数

Alexander Wan, Kevin Klyman, Sayash Kapoor, Nestor Maslej, Shayne Longpre, Betty Xiong, Percy Liang, Rishi Bommasani

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 2025基础模型透明度指数评估了基础模型开发者的透明度,发现整体透明度下降,IBM表现突出,而xAI和Midjourney得分极低,揭示了政策干预的必要性。

Comments Website: https://crfm.stanford.edu/fmti/December-2025/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10630 2025-12-12 cs.CL cs.CY 77%

From Data Scarcity to Data Care: Reimagining Language Technologies for Serbian and other Low-Resource Languages

从数据匮乏到数据关怀:重新构思塞尔维亚及其他低资源语言的语言技术

Smiljana Antonijevic Ubois

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出Data Care框架,旨在通过CARE原则重构低资源语言的语言技术,以解决数据偏见和文化不平等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18156 2025-12-12 cs.AI 70%

AI Through the Human Lens: Investigating Cognitive Theories in Machine Psychology

通过人类之眼审视人工智能:在机器心理学中探究认知理论

Akash Kundu, Rishika Goswami

机构 * Heritage Institute of Technology(赫里蒂奇理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过四个心理学框架研究LLMs的认知模式,发现其在叙述生成、框架偏差、道德判断和自我矛盾等方面表现出与人类相似但受训练数据影响的行为特征。

Comments Accepted to IJCNLP-AACL 2025 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10956 2025-12-12 cs.CV 50%

Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision

通过立体视觉和中等层次视觉增强动态城市导航

Wentao Zhou, Xuweiyi Chen, Vignesh Rajagopal, Jeffrey Chen, Rohan Chandra, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出StereoWalker,通过引入立体视觉和中等层次视觉模块,提升动态城市导航性能,仅用1.5%数据即可达到先进水平。

Comments Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/

详情

展开后加载摘要…

URL PDF HTML 收藏