arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2608.20360 2026-08-24 cs.CL cs.LG 新提交 84%

TriPLU: Bypassing the Gate with Direct Trilinear Product FFNs in Tiny Language Models

TriPLU:在小型语言模型中通过直接三线性乘积前馈网络绕过门控机制

He Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 TriPLU替换小型语言模型的门控前馈网络分支为3阶乘积分支,在低计算场景下提升了TinyStories等数据集的验证损失,但对优化敏感且未确立通用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15509 2026-08-20 cs.CV cs.AI cs.LG 版本更新 84%

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

用于跨语言手写OCR的基于大语言模型驱动的自动化机器学习:使用GPT-5、GPT-4o和Claude十四行诗4的闭环神经架构搜索

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对跨语言手写OCR,提出用GPT-5等大语言模型驱动的自动化机器学习框架,能自主生成、训练等优化神经网络架构,经实验评估,该框架无需人工设计等就能发现高效准确模型,实现跨语言手写识别。

Comments 7 pages, 10 figures, and 2 tables. Published in the 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE), IEEE

Journal ref 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE), IEEE, 2025, Article No. 11273810

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13505 2026-08-14 cs.LG cs.CL cs.CV 新提交 84%

Intern-S2-Preview: Scientific Agentic Foundation Model

Intern-S2-Preview:科学智能体基础模型

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Intern-S2-Preview系列科学智能体基础模型,通过多阶段训练与架构优化,在多类基准上取得领先结果,相关模块可提升科学任务表现且无需修改主干模型。

Comments 35 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12630 2026-08-14 cs.CL cs.AI 新提交 84%

Novels generated by language models show compressed formal variation

语言模型生成的小说呈现出压缩的形式多样性

Mehdy Sedaghat Payam, Justin Quinn

机构 * University of Maryland(马里兰大学) University of West Bohemia(西波希米亚大学) Charles University(查理大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比不同模型生成及人类撰写的小说语料库,发现AI生成小说的形式多样性被压缩,句子结构等指标的变异性远低于人类小说,且存在方差与相关性过度封闭现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11788 2026-08-13 cs.CL cs.AI 新提交 84%

TELLME: Test-Enhanced Learning for Language Model Enrichment

TELLME:面向语言模型增强的测试增强学习

Minjun Kim, Inho Won, Hyeonseok Lim, MinKyu Kim, Junghun Yuk, Wooyoung Go, Jongyoul Park, Jungyeul Park, KyungTae Lim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University of Science and Technology(首尔科学技术大学) National Security Research Institute(国家安全研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TELLME方法,将测试增强学习(TEL)原理与持续预训练(CPT)结合,缓解大语言模型领域自适应中数据与成本问题,在金融领域表现优于现有方法,长期记忆保留提升显著。

Comments Findings of the Association for Computational Linguistics: EACL 2026

Journal ref Findings of the Association for Computational Linguistics: EACL 2026, pages 1655-1677

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02544 2026-08-11 cs.CL cs.AI 版本更新 84%

SimSD: Simple Speculative Decoding in Diffusion Language Models

SimSD:扩散语言模型中的简单推测解码

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai Yu, Kun Zhou, Jingbo Shang

机构 * University of California San Diego(加州大学圣地亚哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) University of California Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型无法直接使用标准推测解码的问题,提出SimSD算法,通过即插即用的掩码策略引入参考令牌并设计注意力掩码,实现单次前向传播验证多个草稿令牌,在保持并行解码优势的同时提升解码吞吐量。

Comments 13 pages, 4 figures, code available at https://github.com/airevo2/SimSD-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26828 2026-08-07 cs.LG cs.AI 版本更新 84%

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

基于成本校准前沿效用的预算感知大语言模型发现

Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Yiyan Qi, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型发现的成本问题,提出 CostAda 成本自适应控制器,通过成本校准前沿效用优化预算使用,在多基准测试中以更少预算达到或超越现有模型的质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07568 2026-08-07 cs.LG cs.AI 版本更新 84%

d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation

d3LLM:基于伪轨迹蒸馏的超快扩散大语言模型

Yu-Yang Qian, Junda Su, Lanxiang Hu, Peiyuan Zhang, Zhijie Deng, Peng Zhao, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 d3LLM通过伪轨迹蒸馏和熵基多块解码技术,在提升并行性的同时保持准确性,实现超快的扩散大语言模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 84%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00837 2026-08-05 cs.CL cs.LG 版本更新 84%

Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

剪枝BPE:针对字节对编码的训练后可见性剪枝与令牌重新分配

Kenny Shao

机构 * Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Pruned BPE方法,通过训练后可见性剪枝与令牌重新分配提升BPE词汇效率,在不增加模型可见词汇规模的情况下减少编码长度,取得了优于标准BPE的效果。

Comments 18 pages, 2 figures, 4 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27405 2026-08-05 cs.CL cs.AI 版本更新 84%

Benchmarking LLM Competence on Logical Inference over Probability Operators

基于概率算子的逻辑推理能力大语言模型基准测试

Nayera Hasan, Jack Greff, Alvin Grissom

机构 * Haverford College(哈维福德学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含14320个提示的概率算子推理基准,评估29个大语言模型,发现多数模型存在答案偏差,仅9个超随机水平,且各维度均有偏差。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 84%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04468 2026-08-05 cs.AI cs.CL 版本更新 84%

What Makes a Sale? Simulating End-to-End Seller--Buyer Retail Dynamics with LLM Agents

什么促成了一次销售?通过LLM代理重新思考端到端的卖家-买家零售动态

Jeonghwan Choi, Jibin Hwang, Gyeonghun Sun, Minjeong Ban, Taewon Yun, Hyeonjae Cheon, Hwanjun Song

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出RetailSim框架,通过统一环境建模零售流程,展现行为忠实度和经济规律,用于分析买家-卖家互动及销售策略评估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30363 2026-08-04 q-fin.CP cs.AI cs.LG q-fin.ST 版本更新 84%

Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market

利用非结构化数据增强制度转换检测:国债市场研究

Mingxuan Yi, Vidal Mehra, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, UK(布里斯托大学工程数学与技术学院) Propellant Digital B.V., Amsterdam, Netherlands(荷兰阿姆斯特丹Propellant Digital公司) School of Mathematics, Cardiff University, UK(卡迪夫大学数学学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 提出一种结合大语言模型推理与统计检验的文本增强型制度转换检测框架,在国债市场数据上实现F1=0.82,优于纯数据驱动方法。

Comments 9 pages, 4 figures. Selected for Long Oral presentation at the International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI 2026), Bremen, Germany, 15 August 2026 (non-archival). Code available at: https://github.com/mingxuan-yi/regime_shift

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21759 2026-08-04 cs.CL cs.LG 版本更新 84%

Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models

协调双边界:一种受算术强度启发的加速框架用于扩散语言模型

Linye Wei, Wenjue Chen, Pingzhi Tang, Xiaotian Guo, Le Ye, Runsheng Wang, Meng Li

机构 * Peking University(北京大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 ODB-dLLM通过协调双边界,利用算术强度差异优化扩散语言模型的推理速度,显著提升效率并减少准确性损失。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22688 2026-07-28 cs.AI cs.CL 新提交 84%

Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

协同控制:大语言模型智能体的控制与模型权重协同进化

Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练后智能体优化问题,提出协同控制框架,交替优化控制与模型参数。通过基于大语言模型的控制批评家分析失败轨迹并提出更新,再用改进控制生成的轨迹微调模型,案例研究显示该方法能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22629 2026-07-28 cs.AI cs.CL 新提交 84%

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

掩码蒸馏:将思维链内化到语言模型中

Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20757 2026-07-27 cs.LG cs.CL 版本更新 84%

GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

规范量化:从语言模型对称性中在线学习量化最优基

Miguel P. Bento, João F. Seabra

专题命中 效率与部署 :LLM(title);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究利用Transformer内部连续对称性,通过在损失中引入LogSumExp项破坏对称性,在线学习量化最优基,无需校准数据和量化模拟,训练开销小,在不同量化设置下降低了LLaMA - 2 7B模型的困惑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18357 2026-07-22 cs.PL cs.AI cs.LG 新提交 84%

Decode-Time Grammars: Constrained LLM Generation over a Refinement Order of Grammar Fragments

解码时语法:基于语法片段细化顺序的受限大语言模型生成

Shuoming Zhang, Ruiyuan Xu, Haofeng Li, Qiuchu Yu, Yangyu Zhang, Chunwei Xia, Xiaobing Feng, Chenxi Wang, Huimin Cui, Jiacheng Zhao

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院) University of Leeds(利兹大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在低资源编程表面生成代码的问题,提出解码时语法方法,通过运行时环境实例化语法片段,经特定策略和算子确保语法语义正确,实现中在多种语言和模型上消除幽灵引用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18308 2026-07-22 cs.LG cs.AI 新提交 84%

Agentic Calibration of Grey-Box Simulation Models: An LLM-Driven Alternative

灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法

David Gómez-Guillén, Mireia Diaz, Josep Lluis Arcos, Jesús Cerquides

机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) Autonomous University of Barcelona(巴塞罗那自治大学) Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。

Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18284 2026-07-22 cs.LG cs.AI 新提交 84%

Compressing What Matters: Neuron Importance Meets Data-Aware Low Rank Approximation for Language Model Compression

压缩关键内容:神经元重要性与数据感知低秩近似用于语言模型压缩

Athanasios Ntovas, Alexandros Doumanoglou, Petros Drakoulis, Dimitris Zarpalas

机构 * Information Technologies Institute (ITI), Centre for Research and Technology HELLAS (CERTH)(信息技术研究所(ITI),希腊研究与技术中心(CERTH))

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型压缩问题,结合神经元重要性和数据感知低秩近似方法,提出动态压缩率分配算法,实验表明该方法在高压缩率下性能与或优于现有技术。

Journal ref EEE Access, vol. 14, pp. 6106-6120, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17568 2026-07-21 cs.LG cs.AI 新提交 84%

CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning

CoCurve:用于无训练结构化大语言模型剪枝的跨模块协同剪枝曲率

Zhiren Gong, Zihao Zeng, Zijie Wang, Tiantong Wang, Chau Yuen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型结构化剪枝中独立评分单元不合理的问题,提出CoCurve方法,通过二阶泰勒展开得到Fisher矩阵计算协同剪枝曲率边,联合修剪注意力和FFN单元,仅用M次前向传播求解预算二次规划,无需标签、微调等完成剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17295 2026-07-17 cs.NI cs.CL cs.LG 84%

Structure-Aware NL-to-SQL for SFC Provisioning via AST-Masking Empowered Language Models

基于AST遮蔽的结构感知自然语言到SQL转换用于SFC配置

Xinyu Zhu, Parisa Fard Moshiri, Poonam Lohan, Burak Kantarci, Emil Janulewicz

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(奥克大学电气工程与计算机科学学院) Ciena(Ciena公司)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AST遮蔽方法,通过结构感知微调提升自然语言到SQL的转换精度,提高SFC配置的可解释性和效率。

Comments 6 pages, 3 figures, accepted to IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13511 2026-07-16 cs.LG cs.AI 新提交 84%

ExTernD: Expanded-Rank Ternary Decomposition Ternary LLM PTQ with Accuracy Approaching Any Quantization Level

ExTernD:扩展秩三元分解的三元大语言模型后训练量化,精度逼近任意量化级别

Chethan Reddy G. P

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究提出ExTernD方法,将大语言模型权重矩阵因式分解,扩展内部秩纠正量化误差,残差随秩单调递减可逼近bf16精度。该方法内存、计算和因子稀疏性可连续调整,在多个模型上匹配或接近Q4_K/Q5_K精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11475 2026-07-14 cs.LG cs.CL 新提交 84%

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

HyperSafe:微调语言模型推理时的安全恢复

Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey, Bang An, Bernard Ghanem, Yibo Yang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 84%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09084 2026-07-13 cs.NE cs.CL cs.ET cs.LG 84%

Language Modeling on a SpiNNaker 2 Neuromorphic Chip

在SpiNNaker 2神经形态芯片上的语言建模

Khaleelulla Khan Nazeer, Mark Schöne, Rishav Mukherji, Bernhard Vogginger, Christian Mayr, David Kappel, Anand Subramoney

机构 * Birla Institute of Technology(比拉理工学院) Centre for Tactile Internet (CeTI) with Human-in-the-Loop, Technische Universität Dresden, Germany(触觉互联网中心(CeTI)与人环路,德累斯顿技术大学,德国) Dept. of Computer Science, Royal Holloway, University of London, Egham, United Kingdom(计算机科学系,伦敦皇家霍洛威大学,埃格姆,英国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文首次在SpiNNaker 2神经形态芯片上实现基于EGRU架构的语言模型,展示了其在语言建模和手势识别任务中与LSTM相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06636 2026-07-09 cs.SE cs.AI cs.LG 新提交 84%

Specification Grounding Drives Test Effectiveness for LLM Code

规范基础驱动大语言模型代码测试有效性

Amin Haeri, Mahdi Ghelichi

机构 * TD Bank(TD银行)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型代码测试,固定测试器等因素,仅改变一条提示行来隔离规范基础对测试效果的影响。发现规范基础是测试有效性的主要驱动因素,能提高代码正确性、灵敏度和精度,降低误报率,在不同模型和供应商中都有此效果,在算法问题上无影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04969 2026-07-07 cs.LG cs.CL 新提交 84%

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

更智能而非更长时间训练:用于高效大语言模型训练的记忆引导数据复用

Jingwei Zuo, Cong Zeng, Ilyas Chahed, Maksim Velikanov, Dhia Eddine Rhaiem, Pasquale Balsebre, Abhay Kumar, Younes Belkada, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练范式,通过观察模型‘记忆窗口’信号,提出记忆引导数据复用范式,自适应决定数据复用时间和方式,为记忆感知训练计划奠定基础,助于用有限高质量数据更智能训练。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04574 2026-07-07 cs.LG cs.AI 新提交 84%

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 效率与部署 :post-training(title);LLM(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏