arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 17 篇

2608.27351 2026-08-28 cs.LG 新提交 91%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract_cn);language model(abstract_cn);post-training(abstract)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26730 2026-08-28 cs.AI 新提交 89%

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training

知晓何时不重用:自主大语言模型后训练中的条件经验迁移

Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究针对自主大语言模型后训练中经验重用的决策问题,提出BCIT方法,通过绑定效果上下文、检查条件等减少有害更新,提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27065 2026-08-28 cs.CV 新提交 89%

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-28 cs.CL cs.AI 版本更新 88%

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27338 2026-08-28 cs.MA 新提交 88%

One Model, Many Minds: Unlocking Multi-Agent Synergy in a Single Agent via Mixture of Roles

一个模型,多种心智:通过角色混合在单个智能体中解锁多智能体协同

Zhichen Zeng, Huiyuan Chen, Jingru Cheng, Juan Zha, Ming Liu, Ying Chen, Xiyuan Yang, Chaosheng Dong, Haiyang Zhang, Hanghang Tong

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出 MoRe 方法,将多种专门化组合为单个引导向量,使单智能体实现多视角专门化,性能优于单智能体基线,与 MAS 相当且 token 成本大幅降低。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24982 2026-08-28 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 88%

Unsupervised Post-Training of Foundation Models: A Survey

基础模型的无监督后训练:一项综述

Yijie Xu, Qianyi Cai, Huizai Yao, Yili Wang, Tianfu Wang, Cehao Yang, Xingbo Yao, Zhiyu Guo, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Xiaohongshu Inc.(小红书公司) WeChat, Tencent(腾讯微信) CUHK(香港中文大学) AI Robotics(人工智能机器人)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。

Comments Accepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06179 2026-08-28 cs.LG 版本更新 83%

SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐

Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

机构 * Linköping University(林雪平大学) University of Iceland(冰岛大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26193 2026-08-28 cs.AI 新提交 81%

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理

Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) Hainan University(海南大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交 80%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27448 2026-08-28 cs.CL 新提交 77%

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27161 2026-08-28 cs.CL 新提交 77%

STAR: Sentence Translation Alignment Rate for Document-to-Document Machine Translation

STAR:面向文档到文档机器翻译的句子翻译对齐率

Yichen Dong, Hao Wang, Junhui Li, Linlong Xu, Longyue Wang, Weihua Luo

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27032 2026-08-28 cs.LG 新提交 77%

Disentangling Optimization Scale from Preference Scale in DPO

在DPO中解耦优化尺度与偏好尺度

Ivan Kruzhilov

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26544 2026-08-28 cs.LG 新提交 77%

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27254 2026-08-28 cs.LG 新提交 74%

Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit

电路浓缩:将行为因果电路集中化的训练后方法

Sai Adith Senthil Kumar

机构 * George Mason University(乔治梅森大学)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

AI总结 本文提出Circuit Condensation方法,通过训练后处理将模型行为的因果电路集中,在4种行为8个模型的实验中大幅缩减电路规模,且能保留任务性能,可用于提升机械可解释性的电路分析效率。

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26120 2026-08-28 cs.CL cs.LG 新提交 73%

Recipes for Steering and Scaling LLMs via Sampling

通过采样引导和扩展大语言模型的方法

Jiajun He, Zongyu Guo, José Miguel Hernández-Lobato, Yuanqi Du

机构 * Microsoft(微软公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种灵活的理论框架,基于序贯蒙特卡洛和副本交换两种算法,用于通过采样引导和扩展大语言模型,其扩展性优于Best-of-N和标准MCMC基线。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-28 cs.AI cs.CL 版本更新 73%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27017 2026-08-28 cs.IR 新提交 67%

ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

ProRetrieval:通过可执行程序合成学习编排混合搜索

Chengsong You, Zhen Sun, Yunhai Hu, Junwei Zhou, Xiaoyu Cao, Binyu Li, Ziyan Zhao, Weiyao Wang, Liren Lu, Zhijie Ye, Yumo Cao, Yitao Long, Yiwei Xu, Qiyi Jiang, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yiran Zou, Nan Du

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract)

AI总结 ProRetrieval 将语言模型作为检索编排器,通过混合 DSL 合成可执行程序,在两个新基准上训练 Qwen3-4B,其 4B 模型在电商、邮件检索任务中优于 GPT-5.5 等主流模型及各类基线。

Comments 15 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏