SCALE: Upscaled Continual Learning of Large Language Models
SCALE:大规模语言模型的扩展持续学习
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SCALE:大规模语言模型的扩展持续学习
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。
SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据
机构 * ServiceNow Inc.(ServiceNow公司)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。
大语言模型穿Prada:通过在线购物数据分析性别偏见和刻板印象
机构 * University of Trento(特伦托大学)
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过在线购物数据分析大语言模型中的性别偏见,发现模型在性别预测中受刻板印象影响,且减少偏见指令只能降低预测确定性,无法消除刻板印象模式。
2025基础模型透明度指数
机构 * UC Berkeley(伯克利大学) ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 2025基础模型透明度指数评估了基础模型开发者的透明度,发现整体透明度下降,IBM表现突出,而xAI和Midjourney得分极低,揭示了政策干预的必要性。
Comments Website: https://crfm.stanford.edu/fmti/December-2025/index.html
从数据匮乏到数据关怀:重新构思塞尔维亚及其他低资源语言的语言技术
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出Data Care框架,旨在通过CARE原则重构低资源语言的语言技术,以解决数据偏见和文化不平等问题。
通过人类之眼审视人工智能:在机器心理学中探究认知理论
机构 * Heritage Institute of Technology(赫里蒂奇理工学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过四个心理学框架研究LLMs的认知模式,发现其在叙述生成、框架偏差、道德判断和自我矛盾等方面表现出与人类相似但受训练数据影响的行为特征。
Comments Accepted to IJCNLP-AACL 2025 Student Research Workshop
通过立体视觉和中等层次视觉增强动态城市导航
机构 * University of Virginia(弗吉尼亚大学)
专题命中 预训练与数据 :foundation model(abstract)
AI总结 本文提出StereoWalker,通过引入立体视觉和中等层次视觉模块,提升动态城市导航性能,仅用1.5%数据即可达到先进水平。
Comments Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/
遗忘的安全性:通过持续学习保持大型语言模型的安全对齐
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过持续学习方法有效缓解大型语言模型在适应新任务时的安全退化问题,证明了持续学习在保持模型安全性和任务实用性方面的有效性。
教导语言模型与用户共同进化:面向个性化对齐的动态资料模型
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。
Comments NeurIPS 2025 Camera-ready
本地大语言模型集成用于零样本葡萄牙命名实体识别
机构 * Instituto de Ciências Matemáticas e Computação, Universidade de São Paulo(数学与计算科学学院,圣保罗大学)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种本地大语言模型集成方法,用于零样本葡萄牙命名实体识别,通过选择最优模型组合提升性能,无需标注数据。
LDP:多模态大语言模型在医疗报告生成中的参数高效微调
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。
Comments Work in progress
基于大语言模型的共情对话生成情感支持
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(人工智能研究院(TeleAI),中国电信股份有限公司)
专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于大语言模型和提示工程的共情对话生成方法,在NLPCC 2025任务中实现第二名,展示了LLM与适应方法结合在情感支持任务中的潜力。
RoFt-Mol:基于分子图基础模型的鲁棒微调基准测试
机构 * Georgia Institute of Technology(佐治亚理工学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG
AI总结 RoFt-Mol通过结合简单权重插值与复杂权重集合微调方法,提升分子图基础模型在回归和分类任务中的鲁棒微调性能。
通过低困惑度标记学习缓解大语言模型微调中的遗忘问题
机构 * Appier AI Research(Appier AI研究院) ; National Taiwan University(国立台湾大学)
专题命中 指令微调 :LLM(title,abstract);分类 cs.CL
AI总结 本文通过降低标记困惑度来缓解大语言模型微调后的遗忘问题,发现使用LLM生成数据可提升目标任务性能并减少非目标任务退化。
Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems
Offscript: LLMs指令遵循自动审计
机构 * University of Washington Information School Seattle Washington USA ; University of Washington\ G. Allen School of Computer Science \& Engineering Seattle Washington USA ; University of Washington Information School ; University of Washington\ G. Allen School of Computer Science \& Engineering
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Offscript通过自动化审计检测LLM指令遵循问题,揭示86.4%的对话中存在潜在违规行为,其中22.2%经人工确认为实质性违规。
XDoGE: 多语言数据重新加权以增强大语言模型中的语言包容性
机构 * Language Technologies Lab(语言技术实验室) ; Barcelona Supercomputing Center(巴塞罗那超级计算中心)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 XDoGE通过多语言数据重新加权提升大语言模型的语言包容性,优化语言分布并改进模型性能。
Comments Accepted and presented at the LLMs4All workshop at the IEEE BigData 2025 Conference, Macau - December 8-11, 2025
AFRAgent:一种基于自适应特征归一化的高分辨率感知GUI代理
机构 * Media and Data Science Research, Adobe(Adobe媒体与数据科学研究所)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 AFRAgent通过自适应特征归一化技术,在保持高分辨率细节的同时,实现了更高效的GUI自动化性能,比现有模型小四分之一。
Comments Accepted at WACV 2026 Conference
通过强化学习增强放射学报告生成和视觉基础识别
机构 * University of Zurich(苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院) ; Zurich University of Applied Sciences(苏黎世应用科学大学)
专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI
AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。
Comments 10 pages main text (3 figures, 3 tables), 31 pages in total
智能加权多个参考模型以直接优化大语言模型的偏好
机构 * Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出四种新的加权策略以优化大语言模型的偏好,发现单参考DPO在多数情况下优于多参考方法。
Comments Working paper. 13 pages, 4 figures
多目标奖励与偏好优化:理论与算法
专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本论文提出多目标约束优化算法MOPO,通过理论与算法结合,提升约束强化学习在控制、偏好学习和大语言模型对齐中的性能与安全性。
Comments PhD thesis
基于Transformer策略的广义策略梯度定理
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于Transformer策略的广义策略梯度定理,揭示了标准策略梯度定理和GRPO的特殊案例,并探讨了其在训练大型语言模型中的应用。
GTPO:通过梯度和熵控制稳定群体相对策略优化
机构 * National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士学院,罗马萨皮恩扎大学) ; Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna, Pisa(机器人与人工智能卓越部门,TeCIP,圣安娜高等学院,比萨) ; Institute of Informatics and Telematics, National Research Council of Italy, Pisa(信息与电信研究所,意大利国家研究理事会,比萨)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GTPO通过梯度和熵控制稳定群体相对策略优化,提升大语言模型对齐的训练稳定性与性能。
RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Saarland University(萨尔兰州大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。
解开地址簿:通过稀疏自编码器解剖LLM键值缓存的稀疏语义结构
机构 * Beijing University of Posts(北京邮电大学) ; Baidu Inc.(百度公司)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出STA-Attention框架,通过Top-K稀疏自编码器解剖LLM键值缓存的稀疏语义结构,实现可解释的语义原子分解,提升模型的可解释性和性能。
UniExtreme: 一种用于极端天气预报的通用基础模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 UniExtreme是一种通用极端天气预报基础模型,通过自适应频率调制和事件先验增强模块,提升对多样化极端天气事件的预测能力。
Comments 35 pages, 80 figures, submitted to ACM KDD 2026 conference
为LLM代理构建一个简单却强大的长期对话记忆基线
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL
AI总结 本文提出基于事件的对话记忆方法,通过异构图结构实现高效检索,提升LLM代理的长期对话能力。
Comments Work in progress
可执行的元认知:结构化认知循环作为意图理解的架构
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出结构化认知循环(SCL)作为可执行的元认知框架,通过定义智能为持续的循环过程,重新定义智能为重构自身知识状态的能力,并在哲学、人工智能和认识论领域产生影响。
Comments v4: Clarified the structural role of 'Regulation' as a governing constraint distinct from the loop cycle. Revised Figures 1 and 2 for better architectural clarity and unified terminology
探索多模态课堂数据中教学活动和话语的自动化识别
专题命中 长上下文与记忆 :language model(abstract);prompting(abstract)
AI总结 本文通过多模态分析方法,实现了课堂活动中教学活动和话语的自动化识别,展示了微调模型在视频和 transcripts 上的高准确率,为可扩展的教师反馈系统提供了基础。
Comments This article has been accepted for publication in the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI
AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。
揭示大型语言模型中反思的潜在方向
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG
AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。