arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2606.13049 2026-06-12 cs.RO 新提交 67%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12744 2026-06-12 cs.CV 新提交 67%

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

GRIP:面向大型多模态模型的反馈引导提示检索

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Bonn(波恩大学) Microsoft(微软)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 67%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11201 2026-06-11 cs.LG cs.AI cs.CL 新提交 67%

To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

干预还是不干预:通过概率模型混合指导推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlendIn框架,通过质量感知对齐和按可靠性加权混合模型知识,解决推理时对齐中指导有效性差异大的问题,在困难模型对上实现最高50%的性能提升。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10945 2026-06-10 cs.CR cs.SE 新提交 67%

Context-Based Adversarial Attacks on AI Code Generators: Vulnerability Analysis and Implications

基于上下文的AI代码生成器对抗攻击:漏洞分析与影响

Walther A. Del Orbe, John D. Hastings, Varghese Vaidyan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究通过2800次实验,发现上下文对抗攻击使代码生成漏洞增加10.7倍,并提出双层防御框架实现89.1%检测率。

Comments 6 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10808 2026-06-10 cs.RO 新提交 67%

Bridging Semantics and Physical Execution: A Neuro-Symbolic Framework for Multi-Pair Robotic Assembly

桥接语义与物理执行:面向多对机器人装配的神经符号框架

Xinyi Li, Aiguo Song, Linhu Wei, Huijun Li

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出一种端到端神经符号框架,通过分层生成最优子图、解耦通用性与边缘情况、协调全局序列,解决非结构化环境中多对装配的空间干扰和接触不确定性,在100个真实场景中达到97%全局可执行性,UR3机械臂部署成功率90%。

Comments Corresponding author: Aiguo Song (a.g.song@seu.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10702 2026-06-10 cs.SE 新提交 67%

Watts and Debts of Agentic Frameworks: An Empirical Study (Registered Report)

智能体框架的能耗与债务:一项实证研究(注册报告)

Aneetta Sara Shany, Chandrasekar S, Karthik Vaidhyanathan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10533 2026-06-10 cs.CV 新提交 67%

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

音频-视觉交换感知令牌剪枝用于高效音频-视觉字幕生成

Zihan Meng, Dexiang Hong, Weidong Chen, Ziyu Zhou, Bo Hu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出基于强化学习的AVEX-Prune方法,通过跨模态令牌交换策略选择高置信度令牌,在40%保留率下保持全令牌质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09659 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

End-to-End Context Compression at Scale

端到端上下文压缩的规模化

Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(Modal实验室) University of Maryland(马里兰大学) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) FAIR at Meta(Meta FAIR实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过架构搜索和持续预训练,提出潜在上下文语言模型(LCLMs),一种端到端编码器-解码器压缩器,在通用任务性能、压缩速度和峰值内存上改进帕累托前沿,并可作为长时智能体的高效骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08869 2026-06-09 cs.DC 新提交 67%

A Low-Latency Semantic State Estimator using Latent Predictive Learning for Dynamic Network Monitoring and Orchestration

一种用于动态网络监控与编排的低延迟语义状态估计器,基于潜在预测学习

Hari Madhukumar, Haiyuan Li, Xiaolan Liu, Andy Corston-Petrie, Dimitra Simeonidou

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出潜在预测状态估计器(LPSE),通过将变基数节点遥测转换为拓扑自适应表示并与监控问题融合,实现固定成本单次推理,在Kubernetes集群上达到82.42%语义预测准确率,推理延迟降低约41倍,内存占用减少15倍。

Comments 6 pages, 2 figures, 2 tables. Submitted to IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08511 2026-06-09 cs.CV 新提交 67%

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs

少看多思:面向高效多模态大语言模型的块级注意力跳过

Jie Ma, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01400 2026-08-04 cs.LG cs.AI 新提交 66%

TabDPT-Turbo: Efficient In-Context Learning for Tabular Prediction

TabDPT-Turbo:面向表格预测的高效上下文学习方法

Rasa Hosseinzadeh, Alex Labach, Zexin Xue, Shuyi Han, Valentin Thomas, Anthony L. Caterini

专题命中 效率与部署 :foundation model(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出TabDPT-Turbo模型,通过结合基于行的注意力、长上下文预训练及SSL预训练,在保持与TabDPT v1.1相当性能的同时大幅提升推理速度,是当前最快的表格预测基础模型。

Comments Presented as a poster at the non-archival ICML workshop on Foundation Models for Structured Data (FMSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08268 2026-07-10 cs.AI cs.CL 新提交 66%

Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment

不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏

Vinay Kumar Chaganti

专题命中 效率与部署 :prompting(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。

Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23473 2026-08-25 cs.LG cs.AI 新提交 62%

MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters

MetaCaster:用于轻量级时间序列预测器小样本端到端学习的元调控优化智能体

ChengAo Shen, Wenchao Yu, Fangyu Wu, Dongjin Song, Hanghang Tong, Dongsheng Luo, Wei Cheng, Haifeng Chen, Jingchao Ni

机构 * University of Houston(休斯顿大学) NEC Labs(NEC实验室) University of Waterloo(滑铁卢大学) University of Connecticut(康涅狄格大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对资源受限场景下轻量级时间序列预测器小样本学习的困境,提出MetaCaster多智能体框架,可高效训练专用预测器,在18个数据集等实验中兼顾数据、计算效率与预测性能。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18261 2026-08-20 cs.AI cs.LG 新提交 62%

Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study

可设计为可缓存的?针对边缘内存带宽瓶颈训练混合专家模型路由器:一项带系统测量研究的预注册负面结果

Shriniwas Ramesh Suram

机构 * University of Cumberlands(坎伯兰大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘部署MoE模型的内存带宽瓶颈,通过系统测量与预注册实验发现,训练路由器提升缓存性的方案无法满足预注册的困惑度阈值,仅结合无训练重路由可实现高效缺失减少。

Comments Pre-registered negative result plus a systems measurement study. Code, router-telemetry tool (llama-moe-trace), traces, data manifests, and the frozen pre-registration: https://github.com/Shriniwas410/cacheable-by-design

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17188 2026-08-19 cs.CL cs.AI 新提交 62%

Token Optimization and Context Window Management in Multi-Agent AI Workflows

多智能体AI工作流中的令牌优化与上下文窗口管理

Dvir Shamay

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出多智能体AI工作流的令牌优化与上下文窗口管理框架,含六种模式,可缩短延迟、减少令牌用量;经2420次试验发现相关性对比上下文可提升模型准确率,为模型研究与生产实践提供可重复方法。

Comments 29 pages (main paper + technical appendix), 3 figures. Also archived on Zenodo: 10.5281/zenodo.21924612

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14728 2026-08-18 cs.LG cs.AI 新提交 62%

Tail-Aware Top-$k$ On-Policy Distillation

感知长尾的Top-k在线策略蒸馏

Huipeng Huang, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有Top-k在线策略蒸馏丢弃长尾概率信号的问题,提出TA-OPD方法,通过引入携带长尾概率的长尾词优化,在常见基准上使Avg@8最高提升8.05个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11775 2026-08-13 cs.AI cs.CL 新提交 62%

The Sleeping Agent: What Gist-Based Context Compression Loses and Why

休眠智能体:基于主旨的上下文压缩会丢失什么以及为什么

Nicholas E. Kyrkewood

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以SWC为工具,发现主旨压缩对多跳推理等任务表现优于截断,但会损害时间相关问题的性能,通过修改提示可提升时间问题的评判准确率。

Comments 7 pages, 5 tables, appendices. Code and results at https://github.com/kyrkewood/sleeping-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11227 2026-08-13 cs.AI cs.LG 新提交 62%

Forecasting Side Effects of Activation Steering

预测激活引导的副作用

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对激活引导易产生意外副作用的问题,构建交叉效应矩阵揭示副作用的系统性与可预测性,为激活引导的安全部署提供支持。

Comments 24 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10837 2026-08-12 cs.LG cs.AI 新提交 62%

TACTICL: Task-Aware Compression of Tabular ICL Models

TACTICL:面向表格上下文学习模型的任务感知压缩框架

Mykhailo Koshil, Matthias Feurer, Katharina Eggensperger

机构 * TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对表格基础模型推理成本高、蒸馏后损失上下文适应性的问题,提出TACTICL框架,剪枝Transformer层并替换为轻量适配器,在47个基准数据集上可替换85%层且性能无显著下降,对数据偏移鲁棒。

Comments Accepted for publication at AutoML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08176 2026-08-11 cs.AI cs.LG 新提交 62%

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

匹配监督与学生学习能力:一种用于在线自蒸馏的统一框架

Yongkang Yang, Zhezheng Hao, Hong Zhang, Yi Liu, Xiankun Lin, Wence Ji, Fanjunduo Wei, Jiarui Yu, Qiang Lin, Xiaoyun Liang, Hande Dong

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对在线自蒸馏的次优问题,提出统一在线自蒸馏(USD)框架,该框架通过耦合学习难度预算与师生 divergence,在多模型规模及推理基准上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07851 2026-08-11 cs.LG cs.CL 新提交 62%

TEMPER: Tensorized Efficient Manifold-constrained Parameterization for Expressive Residual Routing

TEMPER:用于表达性残差路由的张量化高效流形约束参数化

Yuxuan Gu, Wuyang Zhou, Huijun Xing, Danilo Mandic

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对残差路由方法参数随流增长过快的问题,提出TEMPER方法,用张量网络参数化生成器,在语言建模等任务上性能相当或更优,参数效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07814 2026-08-11 cs.LG cs.AI 新提交 62%

Shape Mutating Expert Compression:LorExperts and BTExperts

形状变异专家压缩:LorExperts与BTExperts

Inesh Chakrabarti, Sourjya Roy, Bowen Bao, Thiago Crepaldi, Spandan Tiwari, Ashish Sirasao

机构 * Advanced Micro Devices(超威半导体公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对混合专家(MoE)语言模型的专家权重压缩问题,提出LorExperts与BTExperts方法,在保留所有专家与原始路由的前提下实现约50%专家压缩,性能优于基线且随专家数量增长优势更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 62%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02365 2026-08-04 cs.AI cs.LG cs.RO 新提交 62%

Faster-WAM: Do World Action Models Need Deep Action Modules?

Faster-WAM:世界动作模型需要深度动作模块吗?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Celia Team(华为Celia团队) Labs(2012实验室)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01422 2026-08-04 cs.CL cs.LG 新提交 62%

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

QR-Erase:基于子空间的高效机器遗忘方法,结合层定位技术

Tyler Lizzo, Larry Heck

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出QR-Erase框架,结合层定位技术实现高效机器遗忘,在多类遗忘任务中取得优于优化方法的权衡效果,为基础模型提供了SVD的高效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00737 2026-08-04 cs.LG cs.AI cs.PF 新提交 62%

An Embedded RISC-V Evaluation of Kolmogorov--Arnold Networks in Hard-Constrained Recurrent Physics-Informed Models

硬约束循环物理信息模型中柯尔莫哥洛夫-阿诺德网络的嵌入式RISC-V评估

Enzo Nicolas Spotorno, Josafat Leal Filho

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文在RISC-V嵌入式平台上评估硬约束循环物理信息模型的KAN残差分支,发现其部署时延迟和能耗高于MLP,量化后可靠性更差,不适合作为默认选择。

Comments 6 pages, submitted to SBESC 2026 as an extension to the ICLR Workshop Paper https://openreview.net/forum?id=iHpbQn99RB

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00301 2026-08-04 cs.LG cs.CL 新提交 62%

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案

Xujun Che, Yuchen Yuan, Weida Zhao, Chenyang Yu

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏