arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 135 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2511.03270 2025-12-12 cs.CL 88%

SCALE: Upscaled Continual Learning of Large Language Models

SCALE:大规模语言模型的扩展持续学习

Jin-woo Lee, Junhwa Choi, Bongkyu Hwang, Jinho Choo, Bogun Kim, JeongSeon Yi, Joonseok Lee, DongYoung Jung, Jaeseon Park, Kyoungwon Park, Suk-hoon Jung

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15432 2025-12-12 cs.AI cs.CL cs.LG 86%

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01951 2025-12-12 cs.AI cs.CL cs.CY 84%

The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data

大语言模型穿Prada:通过在线购物数据分析性别偏见和刻板印象

Massimiliano Luca, Ciro Beneduce, Bruno Lepri, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过在线购物数据分析大语言模型中的性别偏见,发现模型在性别预测中受刻板印象影响,且减少偏见指令只能降低预测确定性,无法消除刻板印象模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10169 2025-12-12 cs.AI cs.CY cs.LG 81%

The 2025 Foundation Model Transparency Index

2025基础模型透明度指数

Alexander Wan, Kevin Klyman, Sayash Kapoor, Nestor Maslej, Shayne Longpre, Betty Xiong, Percy Liang, Rishi Bommasani

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 2025基础模型透明度指数评估了基础模型开发者的透明度,发现整体透明度下降,IBM表现突出,而xAI和Midjourney得分极低,揭示了政策干预的必要性。

Comments Website: https://crfm.stanford.edu/fmti/December-2025/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10630 2025-12-12 cs.CL cs.CY 77%

From Data Scarcity to Data Care: Reimagining Language Technologies for Serbian and other Low-Resource Languages

从数据匮乏到数据关怀:重新构思塞尔维亚及其他低资源语言的语言技术

Smiljana Antonijevic Ubois

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出Data Care框架,旨在通过CARE原则重构低资源语言的语言技术,以解决数据偏见和文化不平等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18156 2025-12-12 cs.AI 70%

AI Through the Human Lens: Investigating Cognitive Theories in Machine Psychology

通过人类之眼审视人工智能:在机器心理学中探究认知理论

Akash Kundu, Rishika Goswami

机构 * Heritage Institute of Technology(赫里蒂奇理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过四个心理学框架研究LLMs的认知模式,发现其在叙述生成、框架偏差、道德判断和自我矛盾等方面表现出与人类相似但受训练数据影响的行为特征。

Comments Accepted to IJCNLP-AACL 2025 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10956 2025-12-12 cs.CV 50%

Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision

通过立体视觉和中等层次视觉增强动态城市导航

Wentao Zhou, Xuweiyi Chen, Vignesh Rajagopal, Jeffrey Chen, Rohan Chandra, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出StereoWalker,通过引入立体视觉和中等层次视觉模块,提升动态城市导航性能,仅用1.5%数据即可达到先进水平。

Comments Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 11 篇

2512.10150 2025-12-12 cs.CL cs.AI 88%

Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning

遗忘的安全性:通过持续学习保持大型语言模型的安全对齐

Lama Alssum, Hani Itani, Hasan Abed Al Kader Hammoud, Philip Torr, Adel Bibi, Bernard Ghanem

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过持续学习方法有效缓解大型语言模型在适应新任务时的安全退化问题,证明了持续学习在保持模型安全性和任务实用性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL 87%

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10043 2025-12-12 cs.LG 85%

Local LLM Ensembles for Zero-shot Portuguese Named Entity Recognition

本地大语言模型集成用于零样本葡萄牙命名实体识别

João Lucas Luz Lima Sarcinelli, Diego Furtado Silva

机构 * Instituto de Ciências Matemáticas e Computação, Universidade de São Paulo(数学与计算科学学院,圣保罗大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种本地大语言模型集成方法,用于零样本葡萄牙命名实体识别,通过选择最优模型组合提升性能,无需标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10750 2025-12-12 cs.CV 85%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12820 2025-12-12 cs.AI cs.CL 81%

Emotional Support with LLM-based Empathetic Dialogue Generation

基于大语言模型的共情对话生成情感支持

Shiquan Wang, Ruiyu Fang, Zhongjiang He, Shuangyong Song, Yongxiang Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(人工智能研究院(TeleAI),中国电信股份有限公司)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型和提示工程的共情对话生成方法,在NLPCC 2025任务中实现第二名,展示了LLM与适应方法结合在情感支持任务中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00614 2025-12-12 cs.LG physics.chem-ph 79%

RoFt-Mol: Benchmarking Robust Fine-Tuning with Molecular Graph Foundation Models

RoFt-Mol:基于分子图基础模型的鲁棒微调基准测试

Shikun Liu, Deyu Zou, Nima Shoghi, Victor Fung, Kai Liu, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 RoFt-Mol通过结合简单权重插值与复杂权重集合微调方法,提升分子图基础模型在回归和分类任务中的鲁棒微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14315 2025-12-12 cs.CL 79%

Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning

通过低困惑度标记学习缓解大语言模型微调中的遗忘问题

Chao-Chung Wu, Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Shao-Hua Sun, Hung-yi Lee

机构 * Appier AI Research(Appier AI研究院) National Taiwan University(国立台湾大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.CL

AI总结 本文通过降低标记困惑度来缓解大语言模型微调后的遗忘问题,发现使用LLM生成数据可提升目标任务性能并减少非目标任务退化。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10172 2025-12-12 cs.HC cs.AI cs.CL 79%

Offscript: Automated Auditing of Instruction Adherence in LLMs

Offscript: LLMs指令遵循自动审计

Nicholas Clark, Ryan Bai, Tanu Mitra

机构 * University of Washington Information School Seattle Washington USA University of Washington\ G. Allen School of Computer Science \& Engineering Seattle Washington USA University of Washington Information School University of Washington\ G. Allen School of Computer Science \& Engineering

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Offscript通过自动化审计检测LLM指令遵循问题,揭示86.4%的对话中存在潜在违规行为,其中22.2%经人工确认为实质性违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10545 2025-12-12 cs.CL 77%

XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs

XDoGE: 多语言数据重新加权以增强大语言模型中的语言包容性

Iñaki Lacunza, José Javier Saiz, Alexander Shvets, Aitor Gonzalez-Agirre, Marta Villegas

机构 * Language Technologies Lab(语言技术实验室) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 XDoGE通过多语言数据重新加权提升大语言模型的语言包容性,优化语言分布并改进模型性能。

Comments Accepted and presented at the LLMs4All workshop at the IEEE BigData 2025 Conference, Macau - December 8-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00846 2025-12-12 cs.CV 75%

AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent

AFRAgent:一种基于自适应特征归一化的高分辨率感知GUI代理

Neeraj Anand, Rishabh Jain, Sohan Patnaik, Balaji Krishnamurthy, Mausoom Sarkar

机构 * Media and Data Science Research, Adobe(Adobe媒体与数据科学研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AFRAgent通过自适应特征归一化技术,在保持高分辨率细节的同时,实现了更高效的GUI自动化性能,比现有模型小四分之一。

Comments Accepted at WACV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10691 2025-12-12 cs.AI cs.CV 70%

Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning

通过强化学习增强放射学报告生成和视觉基础识别

Benjamin Gundersen, Nicolas Deperrois, Samuel Ruiperez-Campillo, Thomas M. Sutter, Julia E. Vogt, Michael Moor, Farhad Nooralahzadeh, Michael Krauthammer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。

Comments 10 pages main text (3 figures, 3 tables), 31 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2512.10040 2025-12-12 cs.LG cs.AI stat.ML 86%

Intelligently Weighting Multiple Reference Models for Direct Preference Optimization of LLMs

智能加权多个参考模型以直接优化大语言模型的偏好

Skyler Wu, Aymen Echarghaoui

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种新的加权策略以优化大语言模型的偏好,发现单参考DPO在多数情况下优于多参考方法。

Comments Working paper. 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10601 2025-12-12 cs.LG 85%

Multi-Objective Reward and Preference Optimization: Theory and Algorithms

多目标奖励与偏好优化:理论与算法

Akhil Agnihotri

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本论文提出多目标约束优化算法MOPO,通过理论与算法结合,提升约束强化学习在控制、偏好学习和大语言模型对齐中的性能与安全性。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10365 2025-12-12 cs.LG cs.AI cs.CL 75%

GPG: Generalized Policy Gradient Theorem for Transformer-based Policies

基于Transformer策略的广义策略梯度定理

Hangyu Mao, Guangting Dong, Zhicheng Dou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于Transformer策略的广义策略梯度定理,揭示了标准策略梯度定理和GRPO的特殊案例,并探讨了其在训练大型语言模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03772 2025-12-12 cs.LG cs.AI cs.CL 75%

GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control

GTPO:通过梯度和熵控制稳定群体相对策略优化

Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士学院,罗马萨皮恩扎大学) Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna, Pisa(机器人与人工智能卓越部门,TeCIP,圣安娜高等学院,比萨) Institute of Informatics and Telematics, National Research Council of Italy, Pisa(信息与电信研究所,意大利国家研究理事会,比萨)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GTPO通过梯度和熵控制稳定群体相对策略优化,提升大语言模型对齐的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10575 2025-12-12 cs.CL 70%

RoleRMBench & RoleRM: Towards Reward Modeling for Profile-Based Role Play in Dialogue Systems

RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模

Hang Ding, Qiming Feng, Dongqi Liu, Qi Zhao, Tao Yao, Shuo Wang, Dongsheng Chen, Jian Li, Zhenye Gan, Jiangning Zhang, Chengjie Wang, Yabiao Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Saarland University(萨尔兰州大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 5 篇

2512.10547 2025-12-12 cs.LG 83%

Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders

解开地址簿:通过稀疏自编码器解剖LLM键值缓存的稀疏语义结构

Qingsen Ma, Dianyun Wang, Jiaming Lyu, Yaoye Wang, Lechen Ning, Sujie Zhu, Zhenbo Xu, Liuyu Xiang, Huining Li, Huijia Wu, Zhaofeng He

机构 * Beijing University of Posts(北京邮电大学) Baidu Inc.(百度公司)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出STA-Attention框架,通过Top-K稀疏自编码器解剖LLM键值缓存的稀疏语义结构,实现可解释的语义原子分解,提升模型的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01426 2025-12-12 cs.LG cs.AI 81%

UniExtreme: A Universal Foundation Model for Extreme Weather Forecasting

UniExtreme: 一种用于极端天气预报的通用基础模型

Hang Ni, Weijia Zhang, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 UniExtreme是一种通用极端天气预报基础模型,通过自适应频率调制和事件先验增强模块,提升对多样化极端天气事件的预测能力。

Comments 35 pages, 80 figures, submitted to ACM KDD 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17208 2025-12-12 cs.CL 79%

A Simple Yet Strong Baseline for Long-Term Conversational Memory of LLM Agents

为LLM代理构建一个简单却强大的长期对话记忆基线

Sizhe Zhou, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出基于事件的对话记忆方法,通过异构图结构实现高效检索,提升LLM代理的长期对话能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15952 2025-12-12 cs.AI 70%

Executable Epistemology: The Structured Cognitive Loop as an Architecture of Intentional Understanding

可执行的元认知:结构化认知循环作为意图理解的架构

Myung Ho Kim

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结构化认知循环(SCL)作为可执行的元认知框架,通过定义智能为持续的循环过程,重新定义智能为重构自身知识状态的能力,并在哲学、人工智能和认识论领域产生影响。

Comments v4: Clarified the structural role of 'Regulation' as a governing constraint distinct from the loop cycle. Revised Figures 1 and 2 for better architectural clarity and unified terminology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00087 2025-12-12 cs.CV 67%

Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data

探索多模态课堂数据中教学活动和话语的自动化识别

Ivo Bueno, Ruikun Hou, Babette Bühler, Tim Fütterer, James Drimalla, Jonathan Kyle Foster, Peter Youngs, Peter Gerjets, Ulrich Trautwein, Enkelejda Kasneci

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract)

AI总结 本文通过多模态分析方法,实现了课堂活动中教学活动和话语的自动化识别,展示了微调模型在视频和 transcripts 上的高准确率,为可扩展的教师反馈系统提供了基础。

Comments This article has been accepted for publication in the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 26 篇

2512.10080 2025-12-12 cs.CL cs.AI 91%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 89%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏