arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 176 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2608.18033 2026-08-19 stat.ML cs.LG 新提交 94%

Where A Small Language Model Helps in Invoice Categorisation, Understood Through Embedding Geometry

小型语言模型在发票分类中的作用:通过嵌入几何分析的理解

Emma Ceccherini, Daniel Lawson, Anjulika Salhan

专题命中 预训练与数据 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract)

AI总结 研究通过分析SBERT和DeBERTa的嵌入几何,发现内部微调的SBERT在发票分类中表现优于零-shot LLM,且特定客户发票数据可提升其泛化性能,同时揭示结构化输入对SLM无帮助的反直觉结论。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17268 2026-08-19 cs.LG cs.AI 新提交 90%

Understanding Curriculum Learning in Large Language Models via Cross-Difficulty Optimization Dynamics

基于跨难度优化动力学的大语言模型课程学习理解

Zhikai Ding, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析不同课程调度的优化动力学,提出衡量跨难度知识迁移的Relative Transfer指标,据此推导TDCS方法,经多推理基准实验证明其性能优于代表性调度策略,为课程学习提供统一优化解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 89%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17521 2026-08-19 cs.CV 新提交 88%

BrainNorm: A Foundation Model that knows Normal via Semantic Atlas Pretraining

BrainNorm:一种通过语义图谱预训练了解正常状态的基础模型

Madhumitha Venkatesh, Shanawaj S Madarkar, Konda Reddy Mopuri

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 该研究提出BrainNorm基础模型,经约6.6万例T1w sMRI数据训练,通过语义图谱预训练学习规范表征,在多类下游任务上泛化性能优异,其识别的神经退行性偏差与临床病理吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17957 2026-08-19 cs.LG 新提交 84%

Understanding the Surprising Generalization Properties of Tabular Foundation Models

表格基础模型的出人意料的泛化特性研究

Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Chandar Research Lab(钱达尔研究实验室) University of Toronto(多伦多大学) Layer 6 AI(第六层人工智能公司) Prior Labs(普里奥实验室) ELLIS Institute Tübingen(埃利斯研究所图宾根分部) University of Freiburg(弗赖堡大学) Cohere(科here公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究揭示仅在单个真实表格上预训练的TFMs有强迁移性,提出以任务为中心、基于检索的新视角,为TFMs的模型与语料库设计提供了新框架。

Comments This work extends our previous work, Generalization Can Emerge in Tabular Foundation Models From a Single Table (arXiv:2511.09665)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17187 2026-08-19 stat.ME stat.OT 新提交 80%

Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation

识别模型质量对用户参与度的影响:一种结合合成数据验证的版本内因果估计器

John Tribbia

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM模型更新与用户参与度的因果识别难题,提出结合合成数据验证的版本内因果估计器,经衰减调整后可准确估计模型质量对参与度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17722 2026-08-19 cs.CR cs.LG 新提交 79%

MemCatalyst: Amplifying Data Auditing on Vision-Language Models via Data Poisoning

MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计

Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17120 2026-08-19 cs.CL 新提交 79%

Children, but not language models, show accelerating returns in word learning

儿童在词汇学习中表现出加速回报,而语言模型则不然

Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究对比儿童与语言模型的词汇学习,发现儿童词汇学习呈加速积累特征,而语言模型则呈现恒定比例回报,且儿童学习所需训练数据远少于语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 79%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 预训练与数据 :language agent(title,abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17843 2026-08-19 cs.CL cs.AI 新提交 79%

Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints

已编码但不可执行:审计冻结大语言模型中几何约束的解码-生成-引导差距

Man Liang, Xinzhao Cheng, Faizan Wajid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究以参数化CAD约束为测试平台,审计6个冻结LLMs的解码-生成-引导差距,发现几何关系可解码性与生成、引导能力存在差异,区分了编码与表达控制失败。

Comments 13 pages, 7 figures, 8 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交 73%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 70%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 70%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 15 篇

2608.18017 2026-08-19 cs.AI 新提交 92%

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法

Lu Xu, Xu Li, Linjiang Zheng, Fan Li, Riquan Zhang, Jiaxing Shang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。

Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17485 2026-08-19 cs.CR 新提交 91%

KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation

KeyPooling:测量LLM API中继路径在提示缓存隔离中的崩溃位置

Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei Xiao

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出KeyPooling测量方法,发现LLM API中继服务默认未将客户绑定到上游凭证,存在跨客户缓存读取漏洞,并提出防御契约及优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17744 2026-08-19 cs.CL cs.LG cs.RO stat.ML 新提交 90%

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

在低资源语言中思考:SFT构建了什么,RL修正了什么,以及准确率无法察觉的问题

Ayoub Kirouane, Christos Petrocheilos

机构 * Sophea AI(索非亚人工智能公司) KIEFER SA(基弗股份有限公司)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.LG

AI总结 该研究针对三个混合专家模型,发现低资源语言推理中SFT可提升推理语言一致性与流畅性,RL可修正格式遗漏与答案泄露问题,而仅靠准确率无法察觉关键变化,相关工具可推广至其他低资源语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17310 2026-08-19 cs.LG 新提交 87%

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.LG

AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17632 2026-08-19 cs.IR cs.AI 新提交 86%

DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval

DEPT:用于统一查询扩展与检索的文档嵌入保留调优

Jingyuan Wang, Richong Zhang, Zhijie Nie, Mingxin Li, Yanzhao Zhang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DEPT方法,通过端到端训练单个仅解码器LLM实现统一查询扩展与检索,保留调优文档嵌入以解决移动目标问题,在BE基准数据集上提升了检索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17719 2026-08-19 cs.SE cs.AI cs.CL 新提交 86%

What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations

聚合分数所遗漏的:商业大语言模型API迁移中项目级回归的测量

Xiaonan Xu, Wenjing Wu

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对GPT-5.4到GPT-5.6 Sol的三次升级,发现聚合分数遗漏了项目级双向变化,发布了响应级档案与项目级评分输出。

Comments 25 pages, 1 figure, 10 tables (including 8 appendix tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17162 2026-08-19 cs.LG 新提交 85%

OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics

OraclePhys:面向结构力学的大语言模型微调系统框架

Mingyu Li, Guorui Song, Jing Lin, Haoqian Wang

机构 * University of Houston(休斯顿大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出OraclePhys,一种面向结构力学的大语言模型微调系统框架,含自动评分基准、多形式监督数据集及对照训练研究,发现标签答案形式而非比特数决定微调效果,训练所得8B模型达空间结构响应任务数据精度前沿。

Comments 18 pages, 8 figures, 9 tables. Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17723 2026-08-19 cs.CV 新提交 82%

Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability

用于模拟仪表读数的视觉-语言模型:专业化、迁移与可靠性的实证研究

Abdul Mueez, Aaditya Baranwal, Junior Chaj-Mejia, Guneet Bhatia, Jason T. Voelker, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学) Siemens Energy(西门子能源)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 本研究通过实证评估Qwen2.5-VL-7B-Instruct模型在模拟仪表读数任务中的表现,发现其经QLoRA微调后在三类数据集上误差较低,但存在迁移性能下降和高置信度错误问题,暂不适合直接部署为工厂监控流程。

Comments Submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17306 2026-08-19 cs.CV cs.AI 新提交 79%

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优

Yang Chen, Zhan Zhuang, Yanbin Wei, Zebin Chen, Hua Liu, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17180 2026-08-19 cs.LG cs.AI 新提交 79%

Task Specialization Fine-Tuning for Contextual Reinforcement Learning

上下文强化学习的任务专业化微调

Jianan Zhou, Jung-Hoon Cho, Tianyue Zhou, Han Zheng, Jie Zhang, Roy Dong, Yining Ma, Cathy Wu

机构 * Nanyang Technological University(南洋理工大学) MIT(麻省理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对上下文强化学习的任务专业化微调难题,提出TSFT框架,通过整数线性规划分配微调预算,在多领域实验中提升了任务覆盖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17926 2026-08-19 cs.CV 新提交 78%

PerFact: Perception-Derived Fact Prompting for 3D Brain MRI Report Generation

PerFact:用于3D脑部MRI报告生成的感知衍生事实提示方法

Jianyu Sun, Zhenxuan Zhang, Guang Yang, Peter J. Lally

专题命中 指令微调 :prompting(title);language model(abstract)

AI总结 该研究针对3D脑部MRI报告生成,提出PerFact方法,以上游3D分割分类输出的结构化事实提示LoRA适配的视觉语言模型,证实grounding信息是报告质量的主导因素而非模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17063 2026-08-19 cs.LG cs.CL 新提交 73%

J-Miner: Recovering Executable Decision Knowledge from Language-Model Classifiers

J-Miner:从语言模型分类器中恢复可执行的决策知识

Yunfan Gao, Xinyi Huang, Tao Sheng, Haorui Song, Yun Xiong, Haofen Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院上海市数据科学重点实验室) Meituan(美团) College of Design and Innovation, Tongji University(同济大学设计创意学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 J-Miner可从微调后的语言模型分类器中挖掘隐含的决策知识,生成可执行规则,规则复现源分类器决策精度高、保真度优,还能迁移至轻量级模型并保留高准确率。

Comments 19 pages, 12 figures, and 13 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交 70%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 70%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17475 2026-08-19 cs.CV 新提交 50%

S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection

S³AM:一种用于多模态显著目标检测的、具备可靠性校准频率适配器的单流SAM

Ruichao Hou, Boyue Xu, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao

机构 * China Pharmaceutical University(中国药科大学) Nanjing University(南京大学) Yunnan University(云南大学) Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对多模态显著目标检测的冗余计算问题,提出融合可靠性校准频率适配器的单流SAM框架,仅用12.20M参数即实现竞争力性能,相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2608.17411 2026-08-19 cs.LG 新提交 92%

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models

GUPO:面向后训练大语言模型的梯度不确定性感知策略优化

Peizheng Guo, Jianqi Zhang, Xingyu Zhang, Yun Fan, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对GRPO中组梯度冲突导致策略更新效果差的问题,提出GUPO方法,通过贝叶斯框架建模组梯度并结合狄利克雷公式校准梯度贡献,经多基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16926 2026-08-19 cs.LG 新提交 91%

Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 后训练与偏好优化 :LLM(title);post-training(title);preference optimization(title);SFT(abstract,abstract_cn)

AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏