arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 956 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 956 篇

2607.22622 2026-07-28 cs.CL cs.AI 新提交 91%

Learning When to Reason for Text-to-SQL via SFT and DPO

通过监督微调(SFT)和直接偏好优化(DPO)学习何时对文本到SQL进行推理

Soohyuk Jang, Jiheum Yeom, Nohil Park, Sang Hun Kim, Yoonyoung Choi, Kiwook Bae, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) AI Center, Samsung Electronics(三星电子人工智能中心) AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(首尔国立大学人工智能研究所、高级科学研究所以及综合纳米技术中心、信息存储研究中心和人工智能平台研究所)

专题命中 指令微调 :SFT(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究文本到SQL推理问题,提出AutoThinkSQL框架,集成自动思考机制到SFT和DPO中,使模型能根据查询难度动态调整推理,在基准测试中提升效果,减少输出令牌和延迟,让推理决策与查询难度匹配。

Comments 8 pages, 5 figures. Model checkpoints are available at https://huggingface.co/autothinksql

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10276 2026-08-12 cs.HC cs.CY 新提交 91%

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

针对学生数学隐喻回答的密码本引导编码任务微调大型语言模型

Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究通过LoRA微调开放权重LLM,使其在学生数学隐喻的密码本引导编码任务中性能提升,表现媲美甚至超越仅提示的专有模型,可用于数学教育的规模化AI辅助测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18132 2026-08-20 cs.CL cs.SD eess.AS 新提交 91%

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

对齐即全部所需:通用音频-语言模型的无指令训练

Xuanru Zhou, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 91%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 指令微调 :SLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05156 2026-08-07 cs.CL 新提交 91%

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

支架介导的后训练:协同演化模型参数与程序性支架图

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对大型语言模型后训练中参数与推理支架脱节的问题,提出支架介导的后训练范式,通过协同演化实现技能提升,在FeatureBench上较标准SFT取得显著性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04697 2026-08-06 cs.AI 新提交 91%

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

基于ASRS报告的可追踪LLM生成航空系统运行安全分析危险场景

Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对航空系统运行安全分析,提出AI辅助方法结合ASRS报告,用LLM生成可追踪危险场景,通过进化溯因优化混合变体,经评估验证了模型与提示对生成场景有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27443 2026-07-31 cs.AI 新提交 91%

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

利用轨迹图实现智能体大语言模型系统的预执行错误诊断

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Arizona State University(亚利桑那州立大学) NEC Laboratories America(美国 NEC 实验室) Singapore Management University(新加坡管理大学)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出Trajectory Graph Copilot框架,以Graph Debugger为核心,通过预执行错误诊断提升LLM智能体完成长周期任务的能力,在多基准测试中平均提升14.69%通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22651 2026-07-28 cs.AI 新提交 91%

ARdena: Scenario-driven control of real-time LLM agents

ARdena:实时大语言模型智能体的场景驱动控制

Luka Borozan, Domagoj Matijević

机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19523 2026-07-23 cs.CL 新提交 91%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 91%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(abstract);foundation model(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22942 2026-06-23 cs.CL 新提交 91%

Understanding Knowledge Distillation in Post-Training: When It Helps and When It Fails

理解后训练中的知识蒸馏:何时有效与何时失败

Xin Liu, Simin Ma, Shujian Liu, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Lu Wang, Kaiqiang Song

机构 * University of Michigan(密歇根大学) Zoom Video Communications(Zoom视频通信公司)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统研究后训练阶段的知识蒸馏,发现低数据场景下KD优于SFT,但数据充足时优势减弱;从更强教师蒸馏可恢复增益,并提出两阶段KD策略提升数据稀缺环境下的学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11786 2026-06-11 cs.CL 新提交 91%

Lius: Translation Model Based Instructional Lingustic Using Continual Instruction Tuning In Kupang Malay

Lius:基于持续指令调优的库邦马来语教学语言学翻译模型

Joanito Agili Lopo, Yunita Sari, Guntur Budi Herwanto

机构 * Universitas Gadjah Mada(加札马达大学)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对低资源语言库邦马来语,提出利用双语词典的词汇和语义特征设计指令,并采用持续指令调优(CIT)范式微调大语言模型,在多个指标上超越基线4-6分,优于NMT和多语言LLM 10-13分。

Comments This paper is the result of the Master Thesis in Master of Artificial Intelligence at Universitas Gadjah Mada

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 91%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26027 2026-06-25 cs.CL cs.LG 新提交 91%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 91%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11206 2026-06-11 cs.CL cs.LG 新提交 91%

Compatibility-Aware Dynamic Fine-Tuning for Large Language Models

兼容性感知的动态微调用于大型语言模型

Yucheng Zhou, Junwei Sheng, Qianning Wang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学科技学院电脑与信息科学系及智慧城市物联网国家重点实验室) Auckland University of Technology(奥克兰理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出兼容性感知动态微调(CADFT),通过模型似然度动态调整监督更新,抑制不兼容样本的高方差梯度,提升训练稳定性和泛化能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08676 2026-06-09 cs.SE cs.AI cs.CL 新提交 91%

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

迷失在代码对话者的流程中:揭示代码任务中大语言模型的指令微调税

Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

机构 * Singapore Management University(新加坡国立管理学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 本研究首次实证发现指令微调在代码任务中导致权衡:增强指令遵循能力却削弱代码填充性能,称之为“指令微调税”,并通过定性和定量分析总结出七项发现和四项启示。

Comments 25 pages, 6 figures. Evaluation toolkit and dataset: https://github.com/arkosioscambions/CodeTalkers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24824 2026-07-29 cs.IR 新提交 90%

Retrieval-based and Fine-tuned LLM Approaches for Industrial Asset Health Monitoring and Decision Support

基于检索和微调的大语言模型方法用于工业资产健康监测和决策支持

Seshu Kumar Damarla, Xiuli Zhu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于检索和微调的大语言模型方法在工业资产健康监测中的故障传感器诊断推理表现,通过FailureSensorIQ基准测试,发现语义搜索和混合搜索效果好,基于LLM的微调模型性能最佳,且各方法对一些干扰因素敏感。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 90%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02523 2026-07-07 cs.DC cs.NI 新提交 90%

Edge-Deployable LLM Fine-Tuning on a Single GPU for Telecom Network Troubleshooting

用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调

Chenhua Shi, Bhavika Jalli, John Zou, Gregor Macdonald, Wanlu Lei, Mridul Jain, Joji Philip

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18487 2026-06-23 cs.LG cs.AI cs.CL 新提交 90%

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

SFT 过训练通过熵崩溃预测 RLVR 下的排名反转

Siddharth Aphale, Kelly Liu

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现 SFT 过度训练导致 rollout 分布熵降低,使 GRPO 中优势信号消失,从而引发排名反转;提出基于熵的两阶段诊断方法可预警高风险检查点。

Comments Accepted at the Deep Learning for Code (DL4C) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11510 2026-08-13 q-bio.NC cs.AI 新提交 90%

Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task

大语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争

Xiaoyang Hu, Mike Angstadt, Shane Storks, Zan Huang, Aman Taxali, Alex Weigard, Richard L. Lewis, Chandra Sripada

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究通过言语冲突任务,探究LLM中一致性效应的机制,发现其源于权重内默认映射与上下文内规则映射的竞争,为分析此类响应竞争提供了模型系统。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 90%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09109 2026-08-11 cs.AI 新提交 90%

Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models

不同反馈,不同更新:针对大语言模型的用户交互选择性自学习

Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对LLM用户反馈的泛化范围差异问题,提出选择性自学习框架SLIFT,通过训练两个互补LoRA适配器,在MemoryBench和WildFB上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26594 2026-07-30 eess.SY cs.AI cs.SY 新提交 90%

A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents

基于大语言模型智能体的化工过程PID整定的物理信息框架

Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao

专题命中 指令微调 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 本研究提出一种适用于大、小语言模型的PID整定框架,将工程师整定流程形式化,通过微调Qwen3-0.6B并在测试案例中取得优异整定成功率,提升了PID整定的可靠性与稳定裕度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27634 2026-06-29 cs.LG 新提交 90%

Continual Learning for Sequential Personalization of Small Language Models: A Stability Monitoring Analysis

小语言模型的持续学习与顺序个性化:稳定性监测分析

Thomas S. Paula, Lucas S. Kupssinskü, Rodrigo C. Barros

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS(MALTA,机器学习理论与应用实验室,PUCRS) Kunumi Institute(Kunumi研究所)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract_cn)

AI总结 研究小语言模型在顺序LoRA个性化中的灾难性遗忘问题,提出基于检查点的监测协议,利用轻量级参考集分布诊断揭示模型特定不稳定性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23533 2026-06-29 cs.AI 新提交 90%

POTracker: Optimizing Large Language Models for Standard-Compliant Power Outage Report Generation

POTracker:优化大语言模型以生成符合标准的停电报告

Hung Phan, Aniroop Naladala, Dubey Avanindra, Supryia Chinthavali, Lunga Dalton, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出POTracker,通过新损失函数POTrackerLoss同时优化文本相似度和结构相似度,微调Qwen2.5-7B-Instruct生成符合美国电力行业标准的停电报告,结构准确率达86.47%。

Comments Data Science paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17832 2026-06-19 cs.LG 新提交 90%

From Drift to Coherence: Stabilizing Beliefs in LLMs

从漂移到一致:稳定LLM中的信念

SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

机构 * Department of Statistics, Seoul National University Korea Advanced Institute of Science \& Technology Department of AI, Kookmin University University of Hong Kong

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在多项选择问答中的信念漂移问题,提出提示式预测重采样(PPR)方法,发现信念过程会自稳定并收敛,进而提出种子答案提示策略和自一致性损失以加速稳定并提高预测一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16801 2026-06-16 cs.CL 新提交 90%

The Art of Mixology: Mixup-based Obfuscation for Privacy-Preserving Split Learning in Large Language Models

混合艺术:基于混合的混淆方法用于大型语言模型中隐私保护的分割学习

Chen Chen, Xiang Gao, Xianshun Wang, Chengran Li, Shengyu Xia, Xueluan Gong, Linru Zhang, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University, China(武汉大学网络空间安全学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MIXGUARD框架,通过令牌级混淆、表示级混淆和自适应梯度扰动机制,在保护隐私的同时保持模型效用,实验表明其优于现有方法。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏