arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 186 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2601.09100 2026-01-16 cs.AI 88%

DScheLLM: Enabling Dynamic Scheduling through a Fine-Tuned Dual-System Large language Model

DScheLLM:通过微调双系统大语言模型实现动态调度

Lixiang Zhang, Chenggong Zhao, Qing Gao, Xiaoke Zhao, Gengyi Bai, Jinhu Lv

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 DScheLLM通过微调双系统大语言模型,首次在动态环境中应用大语言模型解决作业车间调度问题,展示其在智能调度优化中的潜力。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19631 2026-01-16 cs.AI 88%

Leveraging Open-Source Large Language Models for encoding Social Determinants of Health using an Intelligent Router

利用开源大型语言模型对健康社会决定因素进行编码的方法

Akul Goel, Surya Narayanan Hari, Belinda Waltman, Matt Thomson

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于开源LLM的智能路由系统,用于高准确率提取SDOH相关医疗记录信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19531 2026-01-16 cs.CL 86%

MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models

MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差

Zhenpeng Su, Xing Wu, Xue Bai, Zijia Lin, Hui Chen, Guiguang Ding, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 MiLe Loss通过熵加权机制减轻大语言模型在学习困难方面的偏差,提升模型对难学标记的关注度,从而在下游任务中取得更好的表现。

Comments This paper has been accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21621 2026-01-16 cs.CL cs.AI 86%

The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs

开放证明语料库:大规模研究LLM生成的数学证明

Jasper Dekoninck, Ivo Petrov, Kristian Minchev, Mislav Balunovic, Martin Vechev, Miroslav Marinov, Maria Drencheva, Lyuba Konova, Milen Shumanov, Kaloyan Tsvetkov, Nikolay Drenchev, Lazar Todorov, Kalina Nikolova, Nikolay Georgiev, Vanesa Kalinkova, Margulan Ismoldayev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里德斯基") Institute of Mathematics and Informatics, Bulgarian Academy of Sciences(保加利亚科学院数学与信息学研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 开放证明语料库通过大规模研究LLM生成的数学证明,探索自动化证明生成中的关键问题,包括自然语言与形式证明的性能差距、最终答案准确性与完整证明有效性之间的差异,以及最佳n选择对证明质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10018 2026-01-16 cs.HC cs.AI 85%

Empowering Older Adults in Digital Technology Use with Foundation Models

通过基础模型赋能老年人数字技术使用

Hasti Sharifi, Homaira Huda Shomee, Sourav Medya, Debaleena Chattopadhyay

机构 * Department of Computer Science University of Illinois Chicago(计算机科学系伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过基础模型解决老年人在数字技术使用中的沟通障碍,开发了OATS数据集,提高了解决方案的准确性和用户信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 82%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09733 2026-01-16 cs.CL cs.AI 82%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10645 2026-01-16 cs.CL 77%

Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs

用于解释大语言模型 verbalized 自信心的有影响力训练数据检索

Yuxi Xia, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TracVC通过追踪训练数据来解释LLMs表达自信心的来源,揭示了模型可能依赖无关数据模仿自信,而非真实内容基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05459 2026-01-16 cs.CR 75%

PrivCode: When Code Generation Meets Differential Privacy

PrivCode: 当代码生成遇见差分隐私

Zheng Liu, Chen Gong, Terry Yue Zhuo, Kecen Li, Weichen Yu, Matt Fredrikson, Tianhao Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PrivCode是一种专门设计用于代码数据集的差分隐私合成器,通过两阶段框架提升隐私和效用,生成高效用代码并保护敏感数据。

Comments Accepted at NDSS 2026; code available at https://github.com/Liuzzyg/PrivCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10510 2026-01-16 cs.LG stat.ML 70%

MixMin: Finding Data Mixtures via Convex Minimization

MixMin: 通过凸优化寻找数据混合

Anvith Thudi, Evianne Rovers, Yangjun Ruan, Tristan Thrush, Chris J. Maddison

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MixMin通过凸优化方法改进数据混合,提升了语言模型和化学任务的性能,且在不同规模模型上均有效。

Comments Proceedings of the 42nd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24626 2026-01-16 cs.CL 70%

Relative Scaling Laws for LLMs

大语言模型的相对扩展定律

William Held, David Hall, Percy Liang, Diyi Yang

机构 * Stanford University(斯坦福大学) OpenAthena(开放阿塔纳) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出相对扩展定律,通过分析不同测试分布在规模变化下的性能差异,揭示大语言模型在扩展过程中并非普遍均衡器,强调了鲁棒性挑战的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10684 2026-01-16 cs.LG cond-mat.dis-nn cs.AI stat.ML 62%

On the origin of neural scaling laws: from random graphs to natural language

神经缩放定律的起源:从随机图到自然语言

Maissam Barkeshli, Alberto Alfarano, Andrey Gromov

机构 * Meta Superintelligence Labs, FAIR(Meta超智能实验室,FAIR) Department of Physics, University of Maryland, College Park(大学物理系,马里兰大学College Park分校) Joint Quantum Institute(联合量子研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了从随机图到自然语言的神经缩放定律起源,发现即使在无幂律结构的数据中,简化设置也能产生缩放定律,并展示了语言复杂性降低时缩放指数的单调变化。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10264 2026-01-16 eess.SP cs.LG 57%

Sim2Real Deep Transfer for Per-Device CFO Calibration

面向异构软件定义无线电平台的Sim2Real深度迁移用于每设备载波频率偏移校准

Jingze Zheng, Zhiguo Shi, Shibo He, Chaojie Gu

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) College of Control Science and Engineering(控制科学与工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种Sim2Real深度迁移框架,通过模拟驱动预训练和轻量级接收机适应,实现异构SDR平台中每设备CFO校准,显著提升CFO估计性能。

Comments Accepted by Globecom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09732 2026-01-16 cs.CL 57%

Benchmarking Cross-Lingual Semantic Alignment in Multilingual Embeddings

在多语言嵌入中评估跨语言语义对齐的基准测试

Wen G. Gong

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本研究提出语义亲和力指标,评估多语言嵌入的跨语言语义对齐,发现训练目标而非规模决定对齐效果,强调显式翻译监督的重要性。

Comments 20 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25677 2026-01-16 cs.CR cs.CL 57%

ZK-SenseLM: Verifiable Large-Model Wireless Sensing with Selective Abstention and Zero-Knowledge Attestation

ZK-SenseLM:基于选择性回避和零知识证明的可验证大模型无线传感

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 ZK-SenseLM通过选择性回避和零知识证明提升无线传感的安全性和可验证性,实现高精度和鲁棒性。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2509.23773 2026-01-16 cs.LG cs.AI cs.CL cs.SI 90%

Knowledge Homophily in Large Language Models

大型语言模型中的知识同质性

Utkarsh Sahu, Zhisheng Qi, Mahantesh Halappanavar, Nedim Lipka, Ryan A. Rossi, Franck Dernoncourt, Yu Zhang, Yao Ma, Yu Wang

机构 * University of Oregon Eugene OR USA Pacific Northwest National Laboratory Richland WA USA Adobe Research San Jose CA USA Texas A\&M University College Station TX USA Rensselaer Polytechnic Institute Troy NY USA University of Oregon Pacific Northwest National Laboratory Adobe Research Texas A\&M University Rensselaer Polytechnic Institute

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于图神经网络的模型,通过分析LLM知识的同质性,提高知识标注效率和推理问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11806 2026-01-16 cs.CL 89%

Exploring the Translation Mechanism of Large Language Models

探索大型语言模型的翻译机制

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Xiucheng Li, Yang Xiang, Min Zhang

机构 * Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究提出子空间干预路径修补法,揭示大型语言模型翻译机制,发现稀疏组件子集主导翻译,通过微调提升性能并推广至复杂任务。

Comments Accepted in NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09750 2026-01-16 cs.SE cs.AI cs.HC cs.MA 87%

SAGE: Tool-Augmented LLM Task Solving Strategies in Scalable Multi-Agent Environments

SAGE:可扩展多智能体环境中基于工具的LLM任务解决策略

Robert K. Strehlow, Tobias Küster, Oskar F. Kupke, Brandon Llanque Kurps, Fikret Sivrikaya, Sahin Albayrak

机构 * Technische Universität Berlin(柏林技术大学) DAI-Labor, TU Berlin, Chair of Agent Technologies(柏林技术大学DAI实验室,代理技术系) GT-ARC gGmbH(GT-ARC公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SAGE通过OPACA框架实现动态工具整合,提供灵活的任务解决策略,提升LLM在多智能体环境中的效率与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09728 2026-01-16 cs.CL cs.AI 82%

Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens

通过参数化阶段令牌消除引言生成中的代理工作流

Meicong Zhang, Tiancheng su, Guoxiu He

机构 * School of Economics and Management, East China Normal University(经济管理学院,东华大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出STIG方法,通过参数化阶段令牌消除代理工作流,使LLM在单次推理中生成连贯的引言,提升逻辑结构和语义相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18434 2026-01-16 cs.CV cs.AI 79%

Benchmarking Foundation Models and Parameter-Efficient Fine-Tuning for Prognosis Prediction in Medical Imaging

在医学影像中评估基础模型和参数高效微调用于预后预测的基准测试

Filippo Ruffini, Elena Mulero Ayllon, Linlin Shen, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究通过基准测试比较了基础模型和CNN在医学影像预后预测中的性能,发现CNN在低资源情况下表现稳健,而FMs在数据充足时通过参数高效微调能取得良好效果。

Journal ref Computer Methods and Programs in Biomedicine, Vol. 275, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10141 2026-01-16 cs.LG cs.AI 79%

Understanding and Preserving Safety in Fine-Tuned LLMs

理解并保持在微调大语言模型中的安全性

Jiawen Zhang, Yangfan Hu, Kejia Chen, Lipeng He, Jiachen Ma, Jian Lou, Dan Li, Jian Liu, Xiaohu Yang, Ruoxi Jia

机构 * Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Waterloo(滑铁卢大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出安全保持微调(SPF)方法,通过分析安全性与实用性梯度的几何关系,有效解决微调过程中安全性与实用性之间的矛盾,保持模型性能并恢复预训练的安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 78%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10043 2026-01-16 q-fin.CP cs.LG 77%

Instruction Finetuning LLaMA-3-8B Model Using LoRA for Financial Named Entity Recognition

使用LoRA对LLaMA-3-8B模型进行指令微调以实现金融命名实体识别

Zhiming Lian

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本文通过结合指令微调和LoRA技术,提升LLaMA-3-8B模型在金融命名实体识别任务中的性能,取得微F1得分为0.894。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11788 2026-01-16 cs.CL cs.AI 73%

WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms

WebRollback: 通过显式回滚机制增强网络代理

Zhisong Zhang, Tianqing Fang, Kaixin Ma, Wenhao Yu, Hongming Zhang, Haitao Mi, Dong Yu

机构 * City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过显式回滚机制提升网络代理的导航效率与灵活性

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10535 2026-01-16 cs.CV 67%

SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery

SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设

Chong Liu, Luxuan Fu, Yang Jia, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)

专题命中 指令微调 :language model(abstract);prompting(abstract)

AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10045 2026-01-16 cs.CR 67%

Privacy Enhanced PEFT: Tensor Train Decomposition Improves Privacy Utility Tradeoffs under DP-SGD

隐私增强的PEFT:张量分解改善DP-SGD下的隐私与效用权衡

Pradip Kunwar, Minh Vu, Maanak Gupta, Manish Bhattarai

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 TTLoRA通过张量分解低秩适应提升DP-SGD下的隐私与效用权衡,减少参数规模并降低成员泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10318 2026-01-16 cs.CL 57%

Boundary-Aware NL2SQL: Integrating Reliability through Hybrid Reward and Data Synthesis

边界感知的NL2SQL:通过混合奖励和数据合成集成可靠性

Songsong Tian, Kongsheng Zhuo, Zhendong Wang, Rong Shen, Shengtao Zhang, Yong Wu

机构 * Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 BAR-SQL通过混合奖励和数据合成方法,提升NL2SQL在生成准确性和边界感知回避能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09859 2026-01-16 cs.CV cs.LG 57%

Breaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIP

突破开放权重CLIP的限制:一种用于CLIP自监督微调的优化框架

Anant Mehta, Xiyuan Wei, Xingyu Chen, Tianbao Yang

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 TuneCLIP通过自监督微调框架提升开放权重CLIP模型在多种下游任务上的性能,实现显著的性能提升。

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2601.10416 2026-01-16 cs.AI 92%

LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models

LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐

Tiesunlong Shen, Rui Mao, Jin Wang, Heming Sun, Jian Zhang, Xuejie Zhang, Erik Cambria

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏