arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 956 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 956 篇

2606.11256 2026-06-11 physics.chem-ph cs.LG cs.NE 新提交 90%

My Chemical Harness: Evolutionary Molecular Design over Synthetic Pathways with Large Language Model Agents

我的化学缰绳:基于合成路径的大语言模型智能体进化分子设计

César Ojeda, Darius A. Faroughy, Maryam Karimi, Payam Zarrintaj, Mir Mehdi Seyedebrahimi, Martín Carballo-Pacheco

机构 * Institute of Mathematics, Faculty of Science, University of Potsdam(数学研究所,科学学院,波茨坦大学) NHETC, Department of Physics and Astronomy, Rutgers University(NHETC,物理与天文学系,罗格斯大学) Potsdam Transfer, University of Potsdam(波茨坦转移,波茨坦大学) E3 LLC

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种以可执行合成路径为种群、大语言模型仅作策略控制器的进化框架,在可溶性环氧化物水解酶代理任务上达到最优性能。

Comments 27 pages | 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10989 2026-06-10 cs.AI 新提交 90%

Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning

零空间约束的低秩自适应用于指定响应的大型语言模型遗忘

Bocheng Ju, Jianhua Wang, Chengliang Liu, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University(北京交通大学智能交通信息安全与隐私保护北京市重点实验室) College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院) Institute of Computing Technologies, China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司计算技术研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出零空间约束响应指定遗忘框架,通过正交投影低秩参数化将LoRA更新限制在保留子空间的零空间内,在抑制遗忘知识的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17744 2026-08-19 cs.CL cs.LG cs.RO stat.ML 新提交 90%

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

在低资源语言中思考:SFT构建了什么,RL修正了什么,以及准确率无法察觉的问题

Ayoub Kirouane, Christos Petrocheilos

机构 * Sophea AI(索非亚人工智能公司) KIEFER SA(基弗股份有限公司)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.LG

AI总结 该研究针对三个混合专家模型,发现低资源语言推理中SFT可提升推理语言一致性与流畅性,RL可修正格式遗漏与答案泄露问题,而仅靠准确率无法察觉关键变化,相关工具可推广至其他低资源语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09510 2026-08-11 cs.CL cs.AI cs.SI 新提交 90%

Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts

构建它、攻破它、重复它:基准测试与改进大语言模型生成的社交媒体虚假信息检测

Kevin Thomas, Milosz Kasprzyk, Reuel C Igbokwe Onuigbo, Elliott Pert, Cameron Tovey, João A. Leite, Olesya Razuvayevskaya, Carolina Scarton

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出BiBiR迭代框架测试虚假信息检测器鲁棒性,结合回译与LLM角色改写的攻破技术实现95%标签翻转率,DASS架构三元组对比模型准确率72.68%,优于基线模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29378 2026-08-03 cs.CL cs.LG 新提交 90%

PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction

PTP:基于前序令牌预测的大语言模型反演方法,用于近精确提示重构

Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi

机构 * IIT Bombay(印度理工学院孟买分校) Adobe Research(奥多比研究中心)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PTP方法,在黑盒场景下从零训练逆语言模型,通过前序令牌预测实现近精确提示重构,泛化性与迁移性良好,性能优于现有LLM反演工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26119 2026-07-30 cs.AI cs.CL 新提交 90%

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量

Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。

Comments Second Workshop on XAI4Science, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25069 2026-07-29 cs.CL cs.AI 新提交 90%

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

DS@GT ARC在CheckThat! 2026中的应用:基于大语言模型的多语言数值声明验证的推理轨迹排序和分组奖励建模

Sagnik Sinha, Shreyas Shrestha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言数值声明验证,探索基于大语言模型(LLM)的推理轨迹排序和分组奖励建模两种方法。LLM方法用LoRA微调验证器评分,还尝试子声明分解;奖励模型用TF-IDF及特征评分。结果显示LLM方法多数指标更优,阿拉伯语中AraBERT表现更佳且子声明分解未提升性能。

Comments 10 pages, 2 figures. Accepted at CLEF 2026 CheckThat!. To appear in CEUR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 90%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01433 2026-07-03 cs.AI cs.LG 新提交 90%

CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse

CreativityNeuro: 引导语言模型权重以改善发散思维并减少模式崩溃

Samuel Schapiro, Core Francisco Park, Felix Sosa, Lav R. Varshney

机构 * Center for Brain Science, Harvard University(哈佛大学脑科学中心) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学CBS-NTT智能物理项目) Prior Computers AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出数据无关的对比权重引导方法CreativityNeuro,通过调整LLM权重增强发散思维,在多项创造力测试中提升原创性并减少模式崩溃,无需重新训练或微调。

Comments Accepted at ICML 2026 Workshop on Creativity & Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00006 2026-07-02 cs.CL cs.AI 新提交 90%

Persona Without Substrate: Regime-Dependence and the LLM Individuation Problem

无基座的人格:体制依赖性与LLM个体化问题

Shuaizhi Cheng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过实验揭示LLM个体化问题中跨体制共指假设的漏洞,提出体制索引个体化框架,将表征内容的身份单位视为(载体,体制)对。

Comments 30 pages, 2 figures, 1 table. Replies to Beckmann & Butlin (arXiv:2604.17031)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13864 2026-07-16 cs.SD 新提交 90%

Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?

重新思考语音基础模型微调:更好的监督微调还是更好的匹配?

Wangjin Zhou, Yizhou Zhang, Yichi Wang, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)

专题命中 指令微调 :SFT(title,summary_cn);foundation model(title)

AI总结 研究语音基础模型微调,通过对3个SUPERB分类任务、9个预训练检查点的8种SFT变体进行系统研究,发现SFT结果强烈依赖预训练实例,顶级SFT方法常因检查点而异,下游增益多为实例和种子依赖的匹配,非普遍性能提升。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11033 2026-06-10 cs.LG cs.AI cs.CL 新提交 90%

AuRA: Internalizing Audio Understanding into LLMs as LoRA

AuRA: 将音频理解内化到LLM中作为LoRA

Bo Cheng, Lei Shi, Zhanyu Ma, Yuan Wu, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Jilin University(吉林大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuRA方法,通过层间蒸馏将ASR编码器的语音表示内化到LoRA适配的LLM中,实现紧耦合的语音-语言联合建模和高效并行端到端推理,在多个基准上优于级联系统和现有适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16156 2026-08-18 cs.AI 新提交 90%

TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents

TRCA:面向长 horizon 大语言模型智能体的逐步规则信用分配

Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长 horizon LLM 智能体稀疏最终结果优化导致的细粒度信用分配难题,提出无需学习评估器或成功锚点的 TRCA,在多基准上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09189 2026-08-11 cs.CL 新提交 90%

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

EmoS:用于评估和对齐口语语言模型中情商的基于理论的框架

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Ziyang Ma, Meng Ge, Xiaobao Wang, Longbiao Wang, Jianwu Dang

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);SLM(abstract_cn);分类 cs.CL

AI总结 本研究针对口语语言模型情商评估缺乏理论框架的问题,构建了EmoSBench基准,开发了基于SFT和GRPO优化的EmoS评估模型,其在EmoSBench上准确率达83.8%,接近人类水平。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09154 2026-08-11 cs.CL 新提交 90%

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

UNSPECIFIC:用于破解大语言模型指令遵循中复制粘贴捷径的通用约束合成方法

Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对LLM指令遵循中复制粘贴的捷径问题,提出UNSPECIFIC框架,通过合成共有的约束、强化易满足约束、在文章及其摘要上评估来破解该问题,构建基准并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08195 2026-08-11 cs.CR cs.AI 新提交 90%

Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification

面向黑盒大语言模型所有权验证的针对性反事实指纹技术

Yutong Wu, Xiaofan Bai, Shixin Li, Pingyi Hu, Ziqi Zhou, Zilong Wang, Xiaojing Ma, Songfeng Lu, Yuhong Li, Jin Xuan, Yi Wang, Dongmei Zhang, Bin Benjamin Zhu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对黑盒LLM所有权验证的挑战,提出TCF框架,将开放式生成对比转化为受限答案的反事实迁移,在四个LLM系列上平均AUC达0.9861,优于TRAP等现有方法。

Comments 37 pages, 18 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06069 2026-08-07 cs.CL 新提交 90%

Training-Free Token-Level Steering for LLM Personalized Co-Writing

面向LLM个性化协同写作的无训练令牌级引导

Wenhao Mao, Chengbin Hou, Weixiao Wang, Jialiang Zhu, Min Liu, Yibin Hao, Hairong Lv

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM个性化协同写作的需求,提出无训练框架SteerWrite,无需梯度更新即可适配专业领域,在多数据集、指标和模型上实现SOTA性能,大幅降低人工编辑工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26173 2026-07-30 cs.LG 新提交 90%

Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models

对齐、模型有机体与玩具模型中的共享SFT经验教训

Anton de la Fuente, Arthur Conmy

专题命中 指令微调 :SFT(title,title_cn);分类 cs.LG

AI总结 本研究探讨对齐训练、模型有机体与玩具模型间SFT经验的三类迁移,发现跨领域迁移SFT经验可推动各领域发展,建议研究者借鉴域外技术。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 90%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14371 2026-07-17 cs.LG econ.TH stat.ML 新提交 90%

Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion

监督微调与上下文学习:拥塞下大语言模型个性化的均衡分析

Fengzhuo Zhang, Zhuoran Yang, Dirk Bergemann

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型个性化中监督微调与上下文学习的选择问题,通过构建框架分析用户面临的统计 - 经济权衡,得出不同方法占优情况、资源消耗特性及平台策略等结论,实验与平台调研验证了相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04235 2026-07-07 cs.CL 新提交 90%

Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations

化腐朽为神奇:事后重新标记大语言模型智能体轨迹以实现成功示范

Zichao Li, Gang Wu, Zichao Wang, Ruiyi Zhang, Wanrong Zhu, Ryan A. Rossi, Vlad I Morariu, Jihyung Kil

机构 * Mila, McGill University(米拉,麦吉尔大学) Adobe Research(Adobe研究院)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大语言模型智能体监督瓶颈,利用智能体展开中隐含的成功目标,引入事后监督学习(HSL),通过辅助大语言模型重新标记轨迹及目标并微调,提出两种技术减轻数据次优性,实验证明其优势。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23394 2026-06-23 cs.CL 新提交 90%

Do LLM Embedding Spaces Recover Expert Structure?

LLM嵌入空间是否恢复了专家结构?

Yixuan Zhu, Zhenke Duan, Fanghen Li

机构 * Zhongnan University of Economics and Law(中南财经政法大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 研究LLM嵌入空间能否恢复心理健康领域的专家定义类别结构,通过对比预训练和微调Qwen3嵌入,发现对齐程度依赖于粒度级别且需控制混杂因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22082 2026-06-23 cs.SE cs.AI 新提交 90%

CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation

CodeTeam: 一个基于LLM的多智能体框架用于仓库级代码生成

Yifei Wang, Ruiyin Li, Peng Liang, Qiong Feng, Zengyang Li, Mojtaba Shahin, Arif Ali Khan

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) School of Computer Science, Central China Normal University(中央财经大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院) M3S Research Group, SEIS Unit, University of Oulu(奥卢大学M3S研究组,SEIS单元)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出CodeTeam框架,通过分离规划、决策和实现阶段,结合多智能体协作与依赖感知调度,解决仓库级代码生成中的长程规划与跨文件一致性问题,在SketchEval和NL2Repo-Bench上取得显著提升。

Comments 36 pages, 5 images, 9 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18257 2026-06-18 cs.HC cs.AI 新提交 90%

From Memorization to Creation: Evaluating the Cognitive Depth of LLM-Generated Educational Questions

从记忆到创造:评估LLM生成的教育问题的认知深度

Xiaolong Wang, Zhe Zhao, Song Lai, Chaoli Zhang, Zijie Geng, Yu Tong, Ye Wei, Qingsong Wen

机构 * City University of Hong Kong(香港城市大学) Zhejiang Normal University(浙江师范大学) Squirrel Ai Learning University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学)

专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 通过布鲁姆认知分类学评估六种LLM生成问题的认知层次,提出细粒度提示策略减少重复性并提升高阶认知比例,引入认知转移强度和类别漂移指标,揭示链式思维提示的可解释性。

Comments Accepted by KDD 2026

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17321 2026-06-17 cs.LG cs.CV 新提交 90%

ProCUA-SFT Technical Report

ProCUA-SFT 技术报告

Jaehun Jung, Ximing Lu, Brandon Cui, Muhammad Khalifa, Shaokun Zhang, Hao Zhang, Jin Xu, Amala Sanjay Deshmukh, Karan Sapra, Andrew Tao, Yejin Choi, Jan Kautz, Mingjie Liu, Yi Dong

机构 * NVIDIA(英伟达) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.LG

AI总结 提出 ProCUA-SFT 数据集,通过自动化管道从 2484 个应用组合的合成轨迹中蒸馏出 310 万步级 SFT 样本,微调 UI-TARS 7B 在 OSWorld 上达到 45.0% 的成功率,比基线提升 18.7 个百分点。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19480 2026-06-19 physics.comp-ph astro-ph.CO cond-mat.stat-mech gr-qc 新提交 90%

sft-wick: A formalism and package for Feynman-diagram expansion and evaluation in stochastic field theories

sft-wick: 随机场理论中费曼图展开与评估的形式化与软件包

Zheng Zhang

专题命中 指令微调 :SFT(title,title_cn)

AI总结 提出sft-wick开源Python包,通过路径积分形式化随机场动力学,自动枚举拓扑不同的费曼图并计算代数系数和数值积分,验证与Langevin模拟一致。

Comments 32 pages, 5 figures, 2 tables. Submitted to Computer Physics Communications. The sft-wick package is open source and available at https://github.com/StatFieldTheory/sft-wick

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15360 2026-08-18 cs.LG cs.AI 新提交 90%

SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning

SAPE:用于大语言模型微调参数效率的三明治适配器

Mohammad Aref Jafari-Raddani, Morteza Mohajjel Kafshdooz

机构 * Qom University of Technology(库姆理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。

Comments 16 pages, 4 figures, 10 tables, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10090 2026-08-12 cs.AI cs.LG 新提交 90%

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS:用于高覆盖率测试平台激励生成的互补专家

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对芯片设计中高覆盖率测试平台激励生成任务,提出CHORUS后训练框架,整合分阶段SFT与密集奖励RL得到的互补专家,构建4B模型,在CVDP-ECov上的Pass@1指标优于671B参数的DeepSeek-R1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27912 2026-07-31 cs.AI cs.CL 新提交 90%

IFHierBench: Hierarchical Instruction Following for Large Language Models

IFHierBench:面向大语言模型的分层指令遵循基准

Yuetian Mao, Chunyang Chen

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出分层指令遵循基准IFHierBench,评估发现现有大语言模型遵循嵌套约束的能力不足,为提升指令遵循能力的训练方法提供了研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20537 2026-07-24 cs.LG cs.AI 新提交 90%

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

可靠表格问答:可靠性标注需要多少监督?

Huei-Chung Hu, Hsin-Tai Wu, Koyo Kobayashi

机构 * DOCOMO Innovations, Inc.(都科摩创新公司) NTT DOCOMO, Inc.(日本电报电话公司都科摩)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出ReliableTableQA框架训练LLM标注表格问答结果统计可靠性,贡献分类法、数据管道及监督量研究。发现小的模式分层SFT集效果显著,GRPO在SFT不足时才有用,重新界定可靠性标注为数据效率问题,明确强化微调效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏