arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2608.17310 2026-08-19 cs.LG 新提交 87%

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.LG

AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17632 2026-08-19 cs.IR cs.AI 新提交 86%

DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval

DEPT:用于统一查询扩展与检索的文档嵌入保留调优

Jingyuan Wang, Richong Zhang, Zhijie Nie, Mingxin Li, Yanzhao Zhang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DEPT方法,通过端到端训练单个仅解码器LLM实现统一查询扩展与检索,保留调优文档嵌入以解决移动目标问题,在BE基准数据集上提升了检索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17719 2026-08-19 cs.SE cs.AI cs.CL 新提交 86%

What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations

聚合分数所遗漏的:商业大语言模型API迁移中项目级回归的测量

Xiaonan Xu, Wenjing Wu

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对GPT-5.4到GPT-5.6 Sol的三次升级,发现聚合分数遗漏了项目级双向变化,发布了响应级档案与项目级评分输出。

Comments 25 pages, 1 figure, 10 tables (including 8 appendix tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26654 2026-08-19 cs.CL cs.AI cs.CY cs.LG 版本更新 86%

Constitutional Midtraining: Content Presence Drives Alignment Gains

宪法式中间训练:内容存在驱动对齐增益

Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt

机构 * University of Oxford(牛津大学) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Geodesic Research Oxford Internet Institute, University of Oxford(牛津大学互联网研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出宪法式中间训练方法,在中间训练中插入基于原则价值观的内容,可提升模型对齐的泛化性与持久性,削弱SFT灌输的敲诈倾向且不造成能力损失,为以SFT为中心的流程提供低成本补充方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17162 2026-08-19 cs.LG 新提交 85%

OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics

OraclePhys:面向结构力学的大语言模型微调系统框架

Mingyu Li, Guorui Song, Jing Lin, Haoqian Wang

机构 * University of Houston(休斯顿大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出OraclePhys,一种面向结构力学的大语言模型微调系统框架,含自动评分基准、多形式监督数据集及对照训练研究,发现标签答案形式而非比特数决定微调效果,训练所得8B模型达空间结构响应任务数据精度前沿。

Comments 18 pages, 8 figures, 9 tables. Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13132 2026-08-19 cs.NI 版本更新 85%

LLM-Driven Large-Scale Spectrum Access

基于大语言模型的大规模频谱接入

Ning Yang, Jinliang Gao, Haijun Zhang

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文提出基于群体相对策略优化的LSA框架,通过分层状态序列化机制解决超长提示导致的计算崩溃问题,实现高效频谱管理。

Comments 11 pages, 2 figures, 8 tables. Submitted to IEEE Transactions on Mobile Computing (TMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23088 2026-08-19 cs.CV 版本更新 85%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract)

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17723 2026-08-19 cs.CV 新提交 82%

Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability

用于模拟仪表读数的视觉-语言模型:专业化、迁移与可靠性的实证研究

Abdul Mueez, Aaditya Baranwal, Junior Chaj-Mejia, Guneet Bhatia, Jason T. Voelker, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学) Siemens Energy(西门子能源)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 本研究通过实证评估Qwen2.5-VL-7B-Instruct模型在模拟仪表读数任务中的表现,发现其经QLoRA微调后在三类数据集上误差较低,但存在迁移性能下降和高置信度错误问题,暂不适合直接部署为工厂监控流程。

Comments Submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23047 2026-08-19 cs.CL cs.AI cs.CE 版本更新 81%

Parametric Knowledge in RAG-SFT for Domain-Specific Document Generation

参数化知识与检索行为在电子设计自动化RAG微调中的研究

Julian Oestreich, Maximilian Bley, Frank Binder, Lydia Müller, André Alcalde, Maksym Sydorenkoq

机构 * Institute for Applied Informatics (InfAI) at Leipzig University(莱比锡大学应用信息学院) CELUS GmbH, Munich(慕尼黑CELUS GmbH)

专题命中 指令微调 :SFT(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨RAG微调在电子设计自动化长文本生成中的应用,提出TriFEX评估框架和参数化知识精度指标,揭示传统指标的局限性,并展示小型模型在专用任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17306 2026-08-19 cs.CV cs.AI 新提交 79%

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优

Yang Chen, Zhan Zhuang, Yanbin Wei, Zebin Chen, Hua Liu, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17180 2026-08-19 cs.LG cs.AI 新提交 79%

Task Specialization Fine-Tuning for Contextual Reinforcement Learning

上下文强化学习的任务专业化微调

Jianan Zhou, Jung-Hoon Cho, Tianyue Zhou, Han Zheng, Jie Zhang, Roy Dong, Yining Ma, Cathy Wu

机构 * Nanyang Technological University(南洋理工大学) MIT(麻省理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对上下文强化学习的任务专业化微调难题,提出TSFT框架,通过整数线性规划分配微调预算,在多领域实验中提升了任务覆盖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-19 cs.CL cs.AI 版本更新 79%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17926 2026-08-19 cs.CV 新提交 78%

PerFact: Perception-Derived Fact Prompting for 3D Brain MRI Report Generation

PerFact:用于3D脑部MRI报告生成的感知衍生事实提示方法

Jianyu Sun, Zhenxuan Zhang, Guang Yang, Peter J. Lally

专题命中 指令微调 :prompting(title);language model(abstract)

AI总结 该研究针对3D脑部MRI报告生成,提出PerFact方法,以上游3D分割分类输出的结构化事实提示LoRA适配的视觉语言模型,证实grounding信息是报告质量的主导因素而非模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17063 2026-08-19 cs.LG cs.CL 新提交 73%

J-Miner: Recovering Executable Decision Knowledge from Language-Model Classifiers

J-Miner:从语言模型分类器中恢复可执行的决策知识

Yunfan Gao, Xinyi Huang, Tao Sheng, Haorui Song, Yun Xiong, Haofen Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院上海市数据科学重点实验室) Meituan(美团) College of Design and Innovation, Tongji University(同济大学设计创意学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 J-Miner可从微调后的语言模型分类器中挖掘隐含的决策知识,生成可执行规则,规则复现源分类器决策精度高、保真度优,还能迁移至轻量级模型并保留高准确率。

Comments 19 pages, 12 figures, and 13 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交 70%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 70%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-19 cs.CV cs.AI 版本更新 70%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15209 2026-08-19 cs.CL 版本更新 57%

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

扩展基于吉兹语的非洲语言词汇:阿姆哈拉语和提格雷尼亚语的比较研究

Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对低资源非拉丁脚本语言表现不佳问题,提出VEXMLM。通过训练特定语言分词器扩展XLM - R词汇并初始化嵌入,分两阶段训练,在多种任务上评估。贡献为定制程序、两阶段策略及多语言评估,提升了相关语言任务性能。

Comments 13 pages , 7 tables , 2 figurs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04574 2026-08-19 cs.CV 版本更新 50%

VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking

VL-UniTrack:一种用于无人机-地面视觉跟踪的融合视觉-语言提示的统一框架

Boyue Xu, Ruichao Hou, Tongwei Ren, Gangshan Wu

专题命中 指令微调 :prompting(abstract)

AI总结 针对无人机-地面视觉跟踪中现有双流方法的特征孤立与外观匹配不可靠问题,提出VL-UniTrack统一框架,通过视觉-语言提示实现跨视角交互,在最新基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17475 2026-08-19 cs.CV 新提交 50%

S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection

S³AM:一种用于多模态显著目标检测的、具备可靠性校准频率适配器的单流SAM

Ruichao Hou, Boyue Xu, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao

机构 * China Pharmaceutical University(中国药科大学) Nanjing University(南京大学) Yunnan University(云南大学) Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对多模态显著目标检测的冗余计算问题,提出融合可靠性校准频率适配器的单流SAM框架,仅用12.20M参数即实现竞争力性能,相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 12 篇

2608.17411 2026-08-19 cs.LG 新提交 92%

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models

GUPO:面向后训练大语言模型的梯度不确定性感知策略优化

Peizheng Guo, Jianqi Zhang, Xingyu Zhang, Yun Fan, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对GRPO中组梯度冲突导致策略更新效果差的问题,提出GUPO方法,通过贝叶斯框架建模组梯度并结合狄利克雷公式校准梯度贡献,经多基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16926 2026-08-19 cs.LG 新提交 91%

Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 后训练与偏好优化 :LLM(title);post-training(title);preference optimization(title);SFT(abstract,abstract_cn)

AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17804 2026-08-19 cs.LG cs.CL 新提交 90%

An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning

基于GRPO的大语言模型遗忘中奖励规范与基准可靠性的实证研究

Rubén Balbastre, Juan Manuel Orduña, Mariano Pérez

机构 * University of Valencia(瓦伦西亚大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对基于GRPO的LLM遗忘,探究奖励规范与基准可靠性问题,对比四种奖励设计开展实验,发现优化成功与行为遗忘并不等价,并分析了分歧的来源。

Comments 32 pages, 4 figures. Code and artifacts linked in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 89%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13428 2026-08-19 cs.CL cs.AI 版本更新 87%

MCTS-KBQA: Monte Carlo Tree Search with Information Gain Rewards for Knowledge Base Question Answering

MCTS-KBQA:基于信息增益奖励的知识库问答蒙特卡洛树搜索

Guanming Xiong, Haochen Li, Zonghong Dai, Liqiang Wen, Wen Zhao

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基于LLM的KBQA中MCTS应用的奖励设计与计算成本问题,提出Fast MCTS方法,以信息增益奖励替代中间状态终端展开,在四个KBQA基准上提升了准确率-成本权衡。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17171 2026-08-19 cs.CL cs.DB 新提交 84%

Polaris: Learning to Generate Table Descriptions from Retrieval Feedback

Polaris:基于检索反馈学习生成表格描述

Ting Cai, Tuan Minh Phan, AnHai Doan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL

AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17528 2026-08-19 cs.AI cs.SE 新提交 77%

Agent Lightning v1.0: Towards Harnessed Agentic RL

Agent Lightning v1.0:走向可控的智能体强化学习

Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang, Yuge Zhang, Luna K. Qiu, Tin Yan Tsui, Jiahang Xu, Chong Luo

机构 * Microsoft(微软) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17776 2026-08-19 cs.LG 新提交 70%

Debate Training Reduces Reward Hacking in RLAIF

辩论训练可减少RLAIF中的奖励黑客行为

Zachary Kenton, Lili Janzer, Rory Greig, Tian Huey Teh, Kirill Tyshchuk, Jonah Brown-Cohen, Harri Edwards, Senthooran Rajamanoharan, Noah Y. Siegel, Natasha Jaques, Rohin Shah

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出用辩论训练替代RLAIF基线,在数学任务中可减少奖励黑客行为,维持裁判性能并恢复45%的性能差距,还验证了多方面相关实验结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17289 2026-08-19 cs.AI 新提交 70%

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

PlanPO:面向多轮智能体大语言模型的组规划感知策略优化

Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 57%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏