arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 346 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 30 篇

2606.02502 2026-08-31 cs.CL 版本更新 85%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2026-08-31 cs.CV cs.AI cs.CL 版本更新 85%

Long Story Short: Story-level Video Understanding from 20K Short Films

长话短说:基于2万部短片的故事级视频理解

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * Ecole Polytechnique(巴黎综合理工学院) IP Paris(巴黎理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 针对现有视频理解数据集的局限,本文构建了2万部业余电影组成的SF20K数据集及配套问答基准,验证其数据泄露有限,证明指令微调可提升VLMs在长期视频理解上的性能。

Comments International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28402 2026-08-31 cs.AI 新提交 84%

VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings

VERA-8B:基于SEC文件的证据支撑审计风险推理模型

Menghan Liu, Elynn Chen

机构 * New York University(纽约大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出端到端审计推理系统VERA-8B,统一SFT与GRPO实现证据支撑审计推理,引入弃权机制,设计AuditBridge实现原始文件到可用报告的转换,性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28458 2026-08-31 cs.CL cs.LG 新提交 84%

Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents

获取、修复、保留:面向小模型对话游戏智能体的诊断引导式后训练方案

Nan Li

机构 * Utrecht University(乌得勒支大学)

专题命中 指令微调 :post-training(title);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究针对小模型对话游戏智能体提出诊断引导式后训练方案,通过三步训练在LM Playschool Challenge中大幅提升了模型的域内对话游戏表现,同时保留了通用静态性能。

Comments 14 pages, 14 tables; Accepted to the LM Playschool Workshop at EMNLP 2026; HF model card: this https URL (https://huggingface.co/chnln/Qwen3.5-2B-playpen-playornotplay)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28237 2026-08-31 cs.LG 新提交 83%

Efficient Online Continual Foundation Model Fine-Tuning for Predictive Process Monitoring

面向预测过程监控的高效在线持续基础模型微调

Sjoerd van Straten, Marwan Hassani

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Wuppertal(伍珀塔尔大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 针对PPM领域基础模型在线持续微调的冷启动问题,提出COMPASS框架,通过自适应子空间与漂移检测技术实现更优性能,且计算开销可接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28207 2026-08-31 cs.CV cs.LG 新提交 83%

Explainable Diabetic Retinopathy Classification Using Vision Foundation Models

基于视觉基础模型的可解释糖尿病视网膜病变分类

Abhishek Verma, Anila Krishna, Abhishek Gajanan Bankar, Juan Miguel Lopez Alcaraz

机构 * Carl von Ossietzky Universität Oldenburg(卡尔·冯·奥西茨基奥尔登堡大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究提出基于视觉基础模型的可解释DR分类框架,评估DINOv2等模型及LoRA等训练策略,在ODIR、APTOS等数据集上取得良好分类性能,验证了模型注意力与临床病灶的相关性。

Comments 11 pages, 4 figures, source code under this https URL (https://github.com/UOLMDA26/retinopathy_vision_foundational)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25853 2026-08-31 cs.CL cs.AI cs.LG 版本更新 82%

G-Loss: Graph-Guided Fine-Tuning of Language Models

G-Loss:图引导的语言模型微调

Aditya Sharma, Vinti Agarwal, Rajesh Kumar

机构 * BITS Pilani(BITS 派拉尼) Bucknell University(巴克内尔大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出G-Loss损失函数,通过构建文档相似度图并利用半监督标签传播捕捉全局语义结构,引导语言模型学习更具判别性和鲁棒性的嵌入,在多个分类任务上提升准确率并加速收敛。

Comments 20 pages, Learning on Graphs Conference (LoG 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 80%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27672 2026-08-31 cs.CL cs.AI 新提交 79%

First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents

先让它可玩,再让它变好:面向小型对话游戏智能体的分阶段交互学习

Syed Mahbubul Huq, Pranava Madhyastha

机构 * City, University of London(伦敦城市大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Qwen-GuidePlay-2B模型,通过分阶段微调方法训练小型对话游戏智能体,在Playpen挑战赛中取得优异成绩,证明精心筛选策略可让小型模型实现高性能。

Comments Accepted at the LMP Challenge (EMNLP 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28138 2026-08-31 cs.CV 新提交 78%

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型

Xiaoyang Guo, Guoping Luo, Jusheng Zhang, Keze Wang, Wenhao Wang

机构 * Sun Yat-sen University(中山大学) The University of British Columbia(不列颠哥伦比亚大学) Vast Intelligence Lab(威斯特智能实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出令牌预算蒸馏(TBD)框架,通过双路径师生设计结合LoRA适配器与FlashVID压缩,在固定令牌预算下适配视频VLMs,大幅压缩令牌时仍能保留高语义性能,在多基准测试中优于仅压缩基线。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27836 2026-08-31 cs.CR cs.AI cs.DC 新提交 77%

FISGuard: Defending Against Membership Inference via Fixed Input Subspaces

FISGuard:通过固定输入子空间防御成员推理攻击

Haocheng Jiang, Hua Shen

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对ProjRes利用梯度几何结构的成员推理攻击,本文提出FISGuard防御方法,通过固定公开数据构建的低维表示子空间,在保持模型效用的同时有效降低攻击效果,实现了隐私与效用的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27893 2026-08-31 cs.CV 新提交 75%

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

CommerceVibe:通过双反馈强化学习学习将电商创意设计为可执行视觉代码

Yajiao Xu, Jin Zhang, Jiangbo Ai, Tao Jiang, Mo Xu, Lina Huang, Chengfu Huo

机构 * Tongji University(同济大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 该研究提出CommerceVibe,将电商创意转化为可执行视觉代码,通过双反馈强化学习优化生成效果,在基准测试中优于仅监督微调的变体及外部模型,实现可控可编辑的规模化电商创意生产。

Comments 20 pages, 13 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 75%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21751 2026-08-31 cs.CL cs.AI cs.CY 版本更新 73%

Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs

为什么所有大语言模型(LLMs)都痴迷于日本文化?关于大语言模型的隐藏文化与区域偏见

Joseba Fernandez de Landa, Carla Perez-Almendros, Jose Camacho-Collados

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了涵盖24种语言的文化相关开放问题(CROQ)数据集,发现LLMs在文化问题回答中存在偏向日本等国家的区域偏见,且该偏见在监督微调后出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27919 2026-08-31 cs.AI 新提交 70%

From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning

从文档到推理:面向金融数值推理的经验证合成数据流水线与语义感知微调

Lokendra Birla, Milind Savagaonkar, Visnu Srinivasan, Sowmya Rasipuram, Shubhashis Sengupta

机构 * Accenture Labs(埃森哲实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对金融数值推理任务,提出经验证合成数据流水线与语义感知微调方法,结合QLoRA、新型评估指标及改进损失函数,在ConvFinQA数据集上实现问答准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27906 2026-08-31 cs.AI 新提交 70%

Rubric-to-Code Credit Assignment for Reinforcement Learning

用于强化学习的从评分规则到代码的信用分配

Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong Wang, Chenyi Zhuang

机构 * Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) Zhongnan University(中南大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对网页应用代码生成中信用分配被削弱的问题,提出RCCA强化学习框架,构建分层奖励与归因对齐机制,使Ling-RCCA-Flash在MiniAppBench和ArtifactsBench上创出新的最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27796 2026-08-31 cs.AI 新提交 70%

ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL

ReToolSQL:用于鲁棒文本到SQL的智能体强化学习

Pratik Kakkar, Chandra Dhir, Ravi Shankar, Pareekshit Reddy Gaddam, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 ReToolSQL为文本到SQL提出两阶段训练框架,结合监督微调与智能体强化微调,在BIRD-SQL基准上取得高执行准确率,登顶单模型开发集排行榜,是实现企业级鲁棒文本到SQL的可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21756 2026-08-31 cs.LG cs.CV nucl-ex physics.ins-det 版本更新 57%

How Architecture and Training Affect TPC Representations Across Experiments

架构与训练如何影响跨实验的TPC表示

Tyler Wheeler, Michelle P. Kuchera, Raghuram Ramanujan, William Sieland, Ryan Krupp, Yassid Ayyad, Daniel Bazin, Connor L. Cross, Hoi Yan Ian Heung, Andrew J. Jones, Ruchi Mahajan, Saiprasad Ravishankar, Pranjal Singh, Benjamin Votaw, Chris Wrede

机构 * Michigan State University(密歇根州立大学) Grand Valley State University(大峡谷州立大学) Davidson College(戴维森学院) University of Kentucky(肯塔基大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本研究以TPC数据为测试平台,通过冻结编码器的探针方法,发现架构是TPC嵌入中任务相关结构的主要来源,其诱导的表示可跨实验和探测器系统复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00250 2026-08-31 cs.CL cs.CV 版本更新 57%

LV-ROVER-MLT: Low-Resource Maltese OCR by Synthetic Fine-Tuning and Multi-Stream Arbitration

LV-ROVER:用于马耳他语段落OCR的多流Tesseract投票

Adam Darmanin

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对马耳他语OCR资源匮乏的问题,提出合成训练管道和5流Tesseract LV-ROVER集成,在422段落基准上将字符错误率从0.0234降至0.00700(降幅70%),其中集成识别贡献44%的改进。

Comments 10 pages, including 8 page and references plus appendices. Working paper. Updated with DocEng 2026 Maltese OCR competition results; LV-ROVER-MLT placed first with held-out CER 0.0074

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26624 2026-08-31 cs.CV 版本更新 50%

MSCGC-KAN: Multi-scale Causal Graph Convolution and KAN-inspired Analytic-basis Mapping for EEG Emotion Recognition

MSCGC-KAN: 用于脑电情感识别的多尺度因果图卷积与Kolmogorov-Arnold特征映射

Haoliang Gong, Qingshan She, Jiale Xu, Yunyuan Gao, Xugang Xi

机构 * School of Automation, Hangzhou Dianzi University, Hangzhou 310018, China(杭州电子科技大学自动化学院) Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology(浙江省脑机协同智能技术与应用重点实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出MSCGC-KAN方法,通过多尺度因果图卷积和Kolmogorov-Arnold特征映射构建结构化任务头,在预训练CBraMod骨干上增强多尺度时间建模、可学习通道间连接建模和非线性判别映射,显著提升脑电情感识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19145 2026-08-31 cs.CV 版本更新 50%

Activation Boundary Matching: Task-Informed Initialization for Low-Rank Adaptation

ABM-LoRA: 激活边界匹配用于低秩适应中的快速收敛

Dongha Lee, Jinhee Park, Minjun Kim, Junseok Kwon

机构 * Chung-Ang University(Chung-Ang 大学) Korea Electronics Technology Institute (KETI)(韩国电子技术研究所)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 ABM-LoRA通过激活边界匹配提升低秩适应的收敛速度,适用于多种任务和架构,实现最高精度和效率。

Comments 20 pages, 12 figures. v2: updated title, abstract, and author information; expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 91%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-31 cs.LG 版本更新 91%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract_cn);language model(abstract_cn);post-training(abstract)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-08-31 cs.CR cs.LG 版本更新 91%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);prompting(abstract);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27750 2026-08-31 cs.LG cs.CL 新提交 88%

The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs

调用来自模型内部:研究基于探针的大型语言模型工具调用错误检测方法

Eric Yeats, Brendan Kennedy, Loc Truong, John Buckheit, Jung Lee, Jesse Friedbaum, John Emanuello, Henry Kvinge

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Security Agency(美国国家安全局)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究探究基于线性探针的工具调用错误检测方法,在18个工具调用LLM上验证其效能,发现探针可捕捉多种工具调用错误,还能泛化到新型错误,为LLM工具调用错误检测提供有效手段。

Comments 4 main pages, 8 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新 88%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-08-31 cs.CV 版本更新 88%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30504 2026-08-31 cs.CL 版本更新 87%

Auditing LLM Benchmarks with Item Response Theory

使用项目反应理论审计LLM基准测试

Sander Land, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL

AI总结 本文引入基于项目反应理论的指标,通过114个模型的响应在七个偏好和多选基准测试中识别出前200个示例中95%精度的可能错误标签,并追踪错误来源,同时揭示奖励模型在风格偏好而非事实知识上的专业化。

Comments Accepted at EMNLP 2026. Associated data at this https URL (https://huggingface.co/datasets/Writer/IRT-mislabeled-items)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28199 2026-08-31 cs.GT 新提交 83%

Fine-Tuning Autobidders with Group Relative Policy Optimization

使用分组相对策略优化对自动出价器进行微调

Anton Safin, Alexandra Khirianova, Andrey Pudovikov, Aleksandr Katrutsa, Egor Samosvat

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究将分组相对策略优化(GRPO)框架适配自动出价场景,经BAT等基准测试,其在点击量上优于基线,转化量为最佳或次佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07188 2026-08-31 cs.CV 版本更新 82%

Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks

用于训练后神经网络的分层特征级反向传播

Ni Ding, Shuchang Wang, Lei He, Shengbo Eben Li, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学智能绿色车辆与移动系统国家重点实验室) School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学数学与统计学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出FR-PT分层框架,基于CCP和MDP及相关算法处理逆问题,在85种训练后设置中63项优于基准,实现神经网络训练后可控适应与透明度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏