arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 1045 篇

2607.01181 2026-07-02 cs.LG cs.AI cs.CL 新提交 75%

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

以正确的方式正确:结合可验证奖励和人类演示的LM训练

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出对抗生成器-判别器框架,在可验证奖励基础上加入人类演示信号,同时优化任务准确性和非可验证属性,在代码修复、故事生成等任务中提升人类相似度并减少奖励黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30704 2026-07-01 cs.LG cs.AI cs.CL 新提交 75%

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

从搜索到合成:训练大语言模型为零样本工作流生成器

Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交 75%

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23700 2026-06-24 cs.CL cs.AI cs.LG 新提交 75%

Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

自我识别微调可以预防和逆转突现性失调

Arush Tagade, Shaoheng Zhou, Jiaxin Wen, Shi Feng

机构 * George Washington University(乔治·华盛顿大学) Google(谷歌) UC Berkeley(伯克利大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过自我生成文本识别微调作为角色定向干预,在GPT-4.1等模型上实验发现,该方法能有效预防和逆转突现性失调,且预防效果优于其他干预。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16349 2026-06-17 cs.CR 新提交 75%

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning

从拒绝几何到安全几何:动态对抗微调下的有害性-拒绝耦合

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 研究通过双安全几何协议测量语言模型在对抗微调中有害性与拒绝机制的耦合程度,发现R2D2训练早期高耦合带来强鲁棒性但牺牲实用性,后期低耦合恢复部分实用性但攻击成功率回升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12923 2026-06-15 cs.LG cs.AI cs.CL 新提交 75%

Order Is Not Control: Driven-Dissipative Response Laws Across Artificial and Biological Systems

秩序并非控制

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证秩序不等于控制,提出接收器门控响应定律,并在生物、大语言模型、适配器和随机算子面板中验证,表明控制是局部的、可测量的。

Comments 52 pages, 7 figures, updated title

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08169 2026-06-09 cs.RO cs.AI cs.CL cs.HC cs.LG 新提交 75%

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning

CLASP: 基于语言驱动的机器人技能选择与组合,采用任务参数化学习

Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR),机器人与机电一体化研究所(RMC)) Technical University of Munich (TUM)(慕尼黑工业大学(TUM))

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CLASP架构,结合任务参数化核化运动基元(TP-KMP)与预训练视觉语言模型(VLM),通过自然语言命令实现技能选择、组合和主动学习,无需微调,在7自由度机械臂上达到73.3%-100%成功率。

Comments 23 pages, 11 figues, 4 tables, 1 listing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19710 2026-08-21 cs.CV cs.AI 新提交 74%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15351 2026-08-18 cs.LG stat.ME 新提交 74%

Spectral Rank Certification for Foundation Model Adapters

基础模型适配器的谱秩验证

Mohammed Ahnouch, Lotfi Elaachak

机构 * Université Paris 1(巴黎第一大学) Faculty of Science and Technology of Tangier(丹吉尔科学与技术学院) Abdelmalek Essaadi University(阿卜杜勒-马利克·埃萨迪大学)

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 本研究针对基础模型适配器开发有限样本谱秩验证框架,提出PEFT LoRA适配器的经验空工作流程,经26个公开适配器审计发现校准有效秩远小于名义秩,且能量保留与统计惊喜对应不同问题。

Comments 11 pages, 4 figures , KDD 2026 Workshop TensorKDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15223 2026-08-18 cs.CL 新提交 74%

TRACE-BN: Transferring Bangla-English Tutoring Behavior to a Sub-1B Offline Language Model

TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型

Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Mohammad Tushar Abdullah, Asfee Bhuiyan Leen, Sumaiya Tabassum Nimi

机构 * North South University(北南大学)

专题命中 指令微调 :language model(title);分类 cs.CL

AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13304 2026-08-14 cs.CL 新提交 74%

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

拒绝意图,而非形式:基于包装器的意图组监督用于大语言模型安全

Ping Wu, Haibo Tong, Feifei Zhao, Han Shen, Yu Shi, Yilin Zhao, Sicheng Shen, Guobin Shen, Yun Luo, Yi Zeng

机构 * Ant Group(蚂蚁集团)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 该研究针对大语言模型安全调优的表面形式捷径问题,提出WIFA方法,结合两种微调路径提升有害内容拒绝能力并降低良性提示过度拒绝率,在Qwen和Llama上验证了效果。

Comments 23 pages, 11 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12389 2026-08-14 cs.AI 新提交 74%

Learning to Adapt Cross-Domain Preferences via Meta-LoRA for LLM Personalization

通过元LoRA学习适应跨领域偏好以实现大语言模型个性化

Xuefei Wang, Jun Han, Zixuan Wang, Qingkai Zeng, Xiao Wang, Ruijie Wang, Jianxin Li

专题命中 指令微调 :LLM(title);分类 cs.AI

AI总结 针对跨领域个性化的过拟合与负迁移问题,提出PAC-Bayes正则化的Meta-LoRA,分解个性化先验为用户与领域组件,在多基准任务上取得胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12219 2026-08-13 cs.LG 新提交 74%

ScreenShot: A Foundation Model for Few-Shot Combination Drug Screening

ScreenShot:用于少样本组合药物筛选的基础模型

Antoine de Mathelin, Christopher Tosh, Wesley Tansey

机构 * Computational Oncology(计算肿瘤学) Memorial Sloan Kettering Cancer Center(纪念斯隆-凯特琳癌症中心)

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 本研究提出用于少样本组合药物筛选的基础模型ScreenShot,其经多药物筛选数据集预训练,可通过上下文学习直接预测患者样本的组合疗法响应,在预留数据集上优于基线,还可驱动主动学习策略以降低实验预算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11949 2026-08-13 cs.AI 新提交 74%

ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models

ExRole:从团队轨迹到多智能体语言模型中的可执行角色

Zhou Liu, Chaoyang Han, Zewei Pan, Zeli Su, Wentao Zhang

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 ExRole是一种多智能体语言模型的轨迹转角色框架,可学习可执行角色,在两个问答基准上显著优于单智能体及其他角色设置,能捕捉可迁移的行为专业化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 74%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 指令微调 :language model(title);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01369 2026-08-04 cs.AI cs.MA 新提交 74%

CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation

CRAFTS:面向化工过程仿真的大语言模型智能体协同角色自适应微调

Ziyun Zhang, Yuxin Lin, Eldin Wee Chuan Lim, Xinghao Ding

机构 * National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 指令微调 :LLM(title);分类 cs.AI

AI总结 CRAFTS 模仿化工工程师分阶段工作流,将仿真任务分配给7个角色,微调3个关键角色,基于 OpenIDAES-450 数据集验证,在82个保留案例上完成91.5%的合约,取得多项F1高分,实现可靠自动化化工过程模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24803 2026-07-29 cs.IR cs.CL 新提交 74%

SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking

SciClaimSeekers参加CheckThat! 2026:使用大语言模型重排检索社交媒体声明的科学来源

Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

机构 * University of North Texas(北得克萨斯大学) CheckThat! Lab(CheckThat!实验室)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 针对社交媒体科学声明难核实且少链接原始学术来源的问题,提出SciClaimSeekers系统,结合BM25、E5检索及倒数排名融合,经Qwen2.5-14B-Instruct重排,在相关评估中表现良好,证明大型预训练模型组合在该任务中可与微调方法竞争。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22397 2026-07-27 cs.HC cs.LG q-bio.NC 新提交 74%

Universal BCI Personalization: One API for Frozen EEG Trunks and Foundation Models

通用脑机接口个性化:用于冻结脑电图主干和基础模型的单一应用程序编程接口

Sergey Musienko

机构 * NimbusBCI

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 研究针对冻结脑电图编码器微调难的问题,提出Nimbus Personalizer,通过与主干无关的API,可在异构冻结主干上运行,在多数据集和基础编码器上验证,相比传统方法成本低且能恢复精度增益,结果具探索性。

Comments 20 pages, 12 figures. Companion paper on the control layer forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16808 2026-07-21 cs.CL 新提交 74%

Schema-Constrained Document-Level Event Argument Extraction with Lightweight LLM Fine-Tuning

基于轻量级语言模型微调的模式约束文档级事件论元抽取

Roberto Pietrantuono, Antonio Guerriero, Pouya Sattari

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Salerno(萨勒诺大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 研究文档级模式约束事件论元抽取,结合角色集注入、参数高效监督微调及确定性解码后处理方法,使微调后的中型开放模型在MAVEN-ARG评估中优于GPT基线,最好模型在事件共指级别达42.39% F1值。

Comments Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 74%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15299 2026-07-20 cs.MM cs.CV cs.LG 新提交 74%

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation

MLLM-DataEngine:闭合多模态指令微调数据生成的循环

Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :instruction tuning(title);分类 cs.LG

AI总结 本文提出MLLM-DataEngine闭环系统,通过自适应坏例采样模块分析模型弱点,为GPT-4提供信息以生成高质量增量数据集,能有针对性且自动地提升MLLMs能力,有望成为MLLMs数据管理通用方案。

Comments 6 pages, 4 figures, 7 tables; accepted by ICME 2026

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 30 June 2025 - 04 July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08079 2026-07-10 cs.AI 新提交 74%

PARA-PV: Physics-Aware Retrieval-Augmented PV Prediction Based on Frozen Foundation Model and Distribution Shift Correction

PARA-PV:基于冻结基础模型和分布偏移校正的物理感知检索增强型光伏功率预测

Hang Fan, Weican Liu, Ying Lu, Dunnan Liu, Long Cheng, Wei Wei

机构 * School of Economics and Management(经济管理学院) School of Electrical and Electronic Engineering(电子电气工程学院) School of Control and Computer Engineering(控制与计算机工程学院) Department of Electrical Engineering(电气工程系)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 研究针对光伏功率预测难题,提出PARA-PV框架,通过编码观测、检索历史数据、校准基础预测及校正分布偏移,并采用物理约束损失函数,嵌入物理知识实现准确预测,为可靠电网调度和可再生能源整合助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08908 2026-06-09 cs.CV cs.AI 新提交 74%

Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

面向光刻缺陷检测的视觉-语言模型失败感知精炼

Pangyun Jeong, Jiyeong Kong, Yuehua Hu, Dohee Jeong, Kyung-Tae Kang

机构 * Hanyang University(汉阳大学) Korea University(高丽大学) Korea Institute of Industrial Technology(韩国生产技术研究院)

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 提出两阶段视觉-语言框架,先微调Qwen3-VL检测缺陷,再通过训练精炼模块修正第一阶段错误,提升检测可靠性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23897 2026-08-26 cs.CL cs.AI 新提交 73%

Names Can Hurt: Spotting Slopsquatting Risks Caused by Package Name Hallucinations in Local Coding LLMs

名称会造成危害:检测本地编码大语言模型中包名幻觉引发的slopsquatting风险

Akash Raj, Sargam Sahu

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对本地编码大语言模型的包名幻觉引发的slopsquatting风险,提出双层检测器结合LangGraph状态机,在300个提示词上实现76%无幻觉代码,用户满意度达4.4分,21/24用户有采用意向。

Comments 14 pages, 2 figures, 6 tables. Code and data at https://github.com/sargamsahu1011/package-hallucination-detector

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20350 2026-08-24 cs.CL cs.AI 新提交 73%

How to Train a Real-World Silicon Concierge? Internalizing Complex Business Workflow to Only OneModel

如何训练一个实用的硅基智能管家?将复杂业务工作流内化至单个模型

Chang Liu, Chaoyang Ning, Dayi Jiang, Enrui Gu, Fang Ran, Hongyan Xue, Huaqing Li, Hui Cai, Jia Liu, Jiang-Ming Yang, Jianshe Li, Jiawei Luo, Jin Zhou, Leshen Zhu, Lihui Chen, Liying Ma, Lyuxin Xue, Mengjian Ji, Ruijia Xu, Wei Ren, Wei Wu, Xiaoling Qu, Xiaoyun Feng, Xin Zhang, Xixie Zhou, Xuanwei Hu, Yan Chen, Yichao Wang, Yongqi Tong, Yu Liu, Yuhong Zhou, Zemin Sun, Zhenwen Xu, Zhiling Liu, Zifan Wang

机构 * Ant International(蚂蚁国际)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对传统工业智能体模块化流水线的缺陷,提出OneModel范式,将业务逻辑与SOP内化至模型,在金融服务系统中实现延迟大幅降低、解决率提升,为工业智能体架构升级提供蓝图。

Comments Accepted to the ACL 2026 Industry Track (Oral). To appear in Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19726 2026-08-21 cs.CL cs.CV cs.LG 新提交 73%

Projector Is All You Train

仅训练投影器就足够

Nyx Iskandar, Saathvik Selvan, Slater Victoroff

机构 * Ramen VR(拉面VR公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18142 2026-08-20 cs.AI cs.CL 新提交 73%

Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu

低资源语言仇恨言论检测的大语言模型高效适配:以罗马乌尔都语为例的比较研究

Toneema Zubair, Muhammad Junaid Asif, Faisal Kamiran, Hafiz Hassan Saeed, Rana Fayyaz Ahmad

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对罗马乌尔都语仇恨言论检测的低资源语言场景,对比评估Mistral等大语言模型,发现采用LoRA参数高效微调可显著提升性能,且计算效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17063 2026-08-19 cs.LG cs.CL 新提交 73%

J-Miner: Recovering Executable Decision Knowledge from Language-Model Classifiers

J-Miner:从语言模型分类器中恢复可执行的决策知识

Yunfan Gao, Xinyi Huang, Tao Sheng, Haorui Song, Yun Xiong, Haofen Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院上海市数据科学重点实验室) Meituan(美团) College of Design and Innovation, Tongji University(同济大学设计创意学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 J-Miner可从微调后的语言模型分类器中挖掘隐含的决策知识,生成可执行规则,规则复现源分类器决策精度高、保真度优,还能迁移至轻量级模型并保留高准确率。

Comments 19 pages, 12 figures, and 13 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 73%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15381 2026-08-18 cs.AI cs.LG 新提交 73%

FedPA-LoRA: Product-Aligned Framework for Mitigating Aggregation and Initialization Errors in Heterogeneous Federated LoRA

FedPA-LoRA:用于缓解异构联邦LoRA中聚合与初始化误差的产品对齐框架

Juseok Jeon, Ramy E. Ali, Doyun Kwon, Myungbeom Her, Jinhwi Kim, Jinhyun So

机构 * DGIST(大邱庆北科学技术院) Samsung(三星)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FedPA-LoRA是缓解异构联邦LoRA聚合与初始化误差的产品对齐框架,在多任务实验中较基线方法平均GLUE准确率最高提升6.82个百分点。

Comments 35 pages, 6 figures. Code: https://github.com/Juseok-Jeon/FedPA-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏