arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 63 篇

2505.00333 2026-08-25 cs.LG eess.SP 版本更新 70%

Two Stage Wireless Federated LoRA Fine-Tuning with Sparsified Orthogonal Updates

双阶段无线联邦LoRA微调与稀疏正交更新

Bumjun Kim, Wan Choi

机构 * Department of Electrical and Computer Engineering, and the Institute of New Media and Communications, Seoul National University (SNU)(电气与计算机工程系,以及新媒体与通讯研究所,首尔国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种双阶段联邦算法,通过稀疏正交微调方法优化学习性能和通信效率,减少通信开销同时保持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22972 2026-08-25 cs.CV 新提交 67%

Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution

优化手术三元组识别:一种知识驱动的混合专家解决方案

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 针对手术三元组识别的三大冲突问题,提出MoeCo框架,通过组件定制适配器、协同梯度学习及知识驱动混合专家机制,在CholecT45和CholecT50数据集上验证了方法的有效性与优越性。

Comments Accepted in TMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22885 2026-08-25 cs.CV 新提交 67%

DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

DRAgent:用于指代表达分割的判别推理智能体

Yujie Qi, Luyan Zhang

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文针对指代表达分割中MLLM单次坐标预测导致的定位偏差问题,提出DRAgent判别推理框架,通过两阶段目标选择与LoRA微调提升性能,在多个基准数据集上表现具竞争力。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22388 2026-08-25 cs.CL cs.AI cs.LG 新提交 67%

ProBel: Propaganda Detection with Techniques, Spans, and Explanations

ProBel:结合技术、 spans 与解释的宣传检测

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Elisa Sartori, Giovanni Da San Martino, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) University of Padova(帕多瓦大学)

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ProBel 是含阿拉伯语和英语的宣传检测资源,支持多任务,双语多任务模型性能最优,联合训练效果更稳定,将发布相关数据与代码。

Comments Under review at

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08015 2026-08-25 cs.RO 版本更新 67%

Q-VGM: Q-Value-Gradient Matching for Offline-to-Online Reinforcement Learning of Flow-Matching VLA

Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略

Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新 67%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21367 2026-08-25 q-bio.BM cs.AI cs.LG 新提交 62%

PepLLM: ESM-Guided Llama for Structured Protein-Peptide Binding Interface Analysis

PepLLM:基于ESM引导的Llama的结构化蛋白质-肽结合界面分析

Hao Qian, Shikui Tu, Lei Xu

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出PepLLM框架,整合ESM与LLaMA,生成蛋白质-肽结合界面的多属性结构化注释,为可解释的蛋白质-肽界面分析建立新任务与建模范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21386 2026-08-25 cs.LG cs.AI 新提交 62%

Model of Models: When Does Emitting a Specialist Beat Attending, Adapting, or Tuning?

模型的模型:何时生成专家模型优于注意力、适配或微调?

John C. Howell

机构 * Nineonefour

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究对比零样本、上下文注意力等四种模型专业化机制,发现生成专家模型在匹配质量下成本更低,但在高维序列建模中不及上下文注意力,还提出可证伪论点界定各机制适用场景。

Comments 14 pages, 7 sections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20054 2026-08-25 cs.AI cs.LG cs.MA 版本更新 62%

What You Can't See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies

你看不见的是你所学的:受限证据可见性有利于共享基因组语言模型社群中的组合泛化

Narcis Marincat

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究受限证据可见性对共享基因组语言模型社群的影响,发现受限可见性可显著提升组合泛化能力,虽未通过完整预注册测试,但利于形成可重用的值索引接口。

Comments 16 pages, 3 figures, 5 tables. Code and evaluation records: https://github.com/tokenosopher/populus-evidence-partitioning ; checkpoints: https://huggingface.co/tokenosopher/populus-evidence-partitioning-checkpoints v2: adds Appendix F (cross-family portability scout)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09819 2026-08-25 cs.LG cs.CL 版本更新 62%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Aaron Guan, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Echo Lee, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Zhuoran Shen, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Schacter Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Xuening Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang, Mindverse Team

专题命中 指令微调 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 50 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08051 2026-08-25 cs.AI cs.LG 版本更新 62%

How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

你能做到多小?面向金融交易中商户信息抽取的 270M-8B 模型 LoRA 微调

Donghao Huang, Tomas Drietomsky, Benjamin Barrett, Zhaoxia Wang

机构 * Singapore Management University(新加坡管理大学) Mastercard(万事达卡) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对金融交易中从嘈杂银行字符串提取结构化商户信息的生产需求,系统评估 24 种模型变体,发现 Qwen 3.5 4B 在参数量减半下 F1 仅低 0.35 点,0.8B 模型匹配 2.5-4 倍大模型性能,且思维链微调提升有限。

Comments 10 pages, 5 figures, 6 tables. Accepted for publication at the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21756 2026-08-25 cs.LG cs.CV nucl-ex physics.ins-det 新提交 57%

How Architecture and Training Affect TPC Representations Across Experiments

架构与训练如何影响跨实验的TPC表示

Tyler Wheeler, Michelle P. Kuchera, Raghuram Ramanujan, William Sieland, Ryan Krupp, Daniel Bazin, Connor L. Cross, Hoi Yan Ian Heung, Andrew J. Jones, Ruchi Mahajan, Saiprasad Ravishankar, Pranjal Singh, Benjamin Votaw, Chris Wrede

机构 * Michigan State University(密歇根州立大学) Grand Valley State University(大峡谷州立大学) Davidson College(戴维森学院) University of Kentucky(肯塔基大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本研究以TPC数据为测试平台,通过冻结编码器的探针方法,发现架构是TPC嵌入中任务相关结构的主要来源,其诱导的表示可跨实验和探测器系统复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-08-25 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15798 2026-08-25 cs.LG 版本更新 57%

Model Merging is Secretly Certifiable: Non-Vacuous Generalisation Bounds for Low-Shot Learning

模型合并具有隐式可认证性:小样本学习的非空泛化界

Taehoon Kim, Henry Gouk, Minyoung Kim, Timothy Hospedales

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Samsung AI Center, Cambridge(三星人工智能中心)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 该研究建立了模型融合学习与泛化认证的联系,发现仅用100个示例、VIT-B和mistral-7B等模型时,融合式学习可获得非平凡泛化保证,为大模型小样本学习的可信认证提供了新方向。

Comments UAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05684 2026-08-25 cs.LG cs.CV 版本更新 57%

Fairness-Aware Low-Rank Representation Fine-Tuning

公平感知低秩表示微调

Parameswaran Kamalaruban, Mark Anderson, Stuart Burrell, Maeve Madigan, Piotr Skalski, David Sutton

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 针对现有公平感知微调方法需敏感属性标签的局限,提出四种公平感知LoRA策略,实验显示其中两种策略在效用与公平性上优于标准微调,同时也揭示了多公平目标优化的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22996 2026-08-25 cs.CV 新提交 50%

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法

Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :language model(abstract)

AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。

Journal ref ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22419 2026-08-25 cs.RO cs.CV 新提交 50%

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

基于极其简单的模态掩码机制的鲁棒双臂视觉-语言-动作模型

Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Southeast University(东南大学)

专题命中 指令微调 :pretraining(abstract)

AI总结 该研究针对双臂操作中查询式VLA模型的动作不连续问题,提出仅训练用的模态掩码机制(M3),在RoboTwin 2.0等任务上使平均成功率提升超11.4%至30%以上,有效增强了模型鲁棒性。

Comments 35 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22370 2026-08-25 cs.CV 新提交 50%

LiST: Local-Simplex Test-Time LoRA Fusion

LiST:局部单纯形测试时LoRA融合

Yihua Shao, Jia Li, Siyu Chen, Xinyu Luo, Yang Liu, Kecheng Chen, Xinwei Long, Lingyu Zhu, Fanhu Zeng, Maolin Wang, Ziyang Yan, Jingcai Guo, Hao Tang, Nicu Sebe, Zhenyi Wang

机构 * SUSTech(南方科技大学) PolyU(香港理工大学) CASIA(中国科学院自动化研究所) GDUT(广东工业大学) CityU(香港城市大学) BigAI(北京智源人工智能研究院) THU(清华大学) TAU(特拉维夫大学) PKU(北京大学) UniTrento(特伦托大学)

专题命中 指令微调 :language model(abstract)

AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。

Comments Accepted by EMNLP 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21486 2026-08-25 cs.CV 新提交 50%

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) TU Darmstadt(达姆施塔特工业大学)

专题命中 指令微调 :language model(abstract)

AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。

Comments Accepted at the ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21632 2026-08-25 cond-mat.mtrl-sci physics.chem-ph 版本更新 50%

Fine-Tuning a Universal Machine-Learned Interatomic Potential for Oxygen Plasma Interactions with WS$_2$

微调通用机器学习原子间势用于氧等离子体与WS$_2$的相互作用

Jaehong Kwon, Andrew S. Rosen, David B. Graves

专题命中 指令微调 :foundation model(abstract)

AI总结 通过迭代微调预训练的通用机器学习原子间势(UMA模型),结合SOAP和FPS采样、DFT标注,实现了对氧等离子体与WS$_2$相互作用的准确模拟,能量和力MAE分别降至4.5×10^{-3}eV/原子和0.076eV/Å。

Comments 29 pages, 9 figures in the main text, 8 figures in appendix section, and 2 supplementary videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 50%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 指令微调 :LLM(abstract_cn)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10376 2026-08-25 cs.CV 版本更新 50%

STA-VPT: SpatioTemporally Aligned Visual Prompt Tuning

STA-VPT:时空对齐的视觉提示微调

Wenjie Pei, Tongqi Xia, Qizhong Tan, Jiandong Tian, Guangming Lu, Jun Yu

专题命中 指令微调 :prompting(abstract)

AI总结 针对现有视觉提示微调无法捕捉空间关系、缺乏细粒度提示能力的问题,提出时空对齐的视觉提示微调模型STA-VPT,通过空间/时空对齐的提示令牌实现个性化区域提示,提升提示性能。

Comments Extension to AAAI 2024, substantially revised version; added new experiments, expanded the methodology section

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 30 篇

2603.02229 2026-08-25 cs.LG cs.CL 版本更新 91%

Safety Training May Persist Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14643 2026-08-25 cs.CL 版本更新 89%

Length-Controlled Margin-Based Preference Optimization without Reference Model

无参考模型的长度可控基于间隔的偏好优化

Gengxu Li, Tingyu Xia, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对DPO的局限提出LMPO,引入统一参考模型与平均对数概率优化策略,通过长度可控间隔损失调控响应长度并缓解概率退化,在Mistral和LLaMA3上的6个基准中性能优于现有方法。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21501 2026-08-25 cs.AI 新提交 88%

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

Qifan Shi, Zhaolu Kang, Chenghua Zhu

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-25 cs.CL cs.AI 新提交 88%

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-08-25 cs.LG cs.AI 版本更新 88%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V2, 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-25 cs.CL 新提交 85%

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21376 2026-08-25 cs.CL cs.AI 新提交 85%

On the Role of Citations in Preference Data

引用在偏好数据中的作用

Yu Hou, Hal Daumé, Rachel Rudinger, William Walden

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21993 2026-08-25 cs.LG 新提交 81%

Gated Decoupled Compositional Bandits: A Unified Theory of Contextual Bandits with Supervised-Calibrated Action Scaling and Pre-Execution Gating

门控解耦组合多臂老虎机:带监督校准动作缩放与预执行门控的上下文多臂老虎机统一理论

Oleg Miroshnichenko

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出门控解耦组合多臂老虎机(GDCB),证明其可统一多个工业系统,核心定理可将非平稳问题转化为近似平稳问题,还推广了相关结果,配套论文已验证短期租赁动态定价实例。

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏