arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 56 篇

2608.20801 2026-08-24 cs.IR cs.AI cs.CL 新提交 92%

Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders

剖析关键要素:面向LLM推荐系统的大规模元数据驱动的上下文感知物品画像

Dojun Hwang, Seunghan Lee, Cheonyoung Park, Sara Yu, SeongKu Kang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM推荐系统中物品侧信息利用不足的问题,提出CAIRO框架,通过结构化元数据、轻量级画像器生成上下文特异性物品画像,提升了LLM重排序性能。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00489 2026-08-24 cs.SE 版本更新 90%

Does My README File Need To Be Updated? Exploring LLM-Based README Maintenance

我的 README 文件需要更新吗?探索基于 LLM 的 README 维护

Haoyu Gao, Hong Yi Lin, Christoph Treude, Gregory Gay, Mansooreh Zahedi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于 LLM 的轻量级方法,用于在人机协作流程中精准更新 README 文件,以解决文档过时问题,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15813 2026-08-24 cs.CL cs.AI 版本更新 90%

SCOPE: A Generative Approach for LLM Prompt Compression

SCOPE:一种用于大语言模型(LLM)提示压缩的生成式方法

Tinghui Zhang, Yifan Wang, Daisy Zhe Wang

机构 * University of Florida(佛罗里达大学) University of Hawaii - Manoa(夏威夷大学-曼诺亚)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI;language model(comments)

AI总结 针对LLM输入过长导致的高成本、延迟及超上下文限制问题,提出无需训练的SCOPE框架,通过分块重写实现提示压缩,在多数设置及高压缩率下均优于现有基线。

Comments Accepted at the Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21142 2026-08-24 cs.LG 新提交 90%

COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models

COEC:面向大语言模型结构化剪枝的校准正交等价补偿

Peiqi Yu, Nam Ling, Wei Wang, Wei Jiang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出无训练补偿框架COEC,将其应用于Llama-3等模型的结构化剪枝,可提升剪枝后模型的困惑度与零样本准确率,在高稀疏度下增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00663 2026-08-24 cs.AI cs.LG q-bio.BM 版本更新 90%

SEISMO: Explanation-Aware, Trajectory-Conditioned LLM Agents for Sample-Efficient Molecular Optimisation

SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率

Fabian P. Krüger, Andrea Hunklinger, Adrian Wolny, Tim J. Adler, Igor Tetko, Santiago David Villalba

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) TUM School of Computation, Information(TUM计算、信息学院) Technology, Department of Mathematics(技术学院,数学系) Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) Machine Learning Research(机器学习研究)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。

Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20988 2026-08-24 cs.LG cs.AI 新提交 90%

Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

面向大语言模型量化鲁棒性的雅可比引导噪声注入

Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

机构 * Amazon(亚马逊)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型量化时自注意力机制对离散化误差敏感的问题,提出雅可比引导噪声注入训练策略,在低比特量化下显著提升了模型在图像分类与语言建模任务中的性能。

Comments Accepted at AdaptFM: Resource-Adaptive Foundation Model Inference, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18586 2026-08-24 cs.DC 版本更新 89%

TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications

TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架

Zhuohang Bian, Feiyang Wu, Zhuoran Li, Teng Ma, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。

Comments 14 pages, 17 figures, 3 tables, 2 algorithms. Accepted at EuroSys '27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20975 2026-08-24 cs.AI 新提交 87%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20370 2026-08-24 cs.DC cs.MA 新提交 87%

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

使用XPerf对智能体AI工作负载的大语言模型服务系统进行基准测试

Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 研究人员提出XPerf基准测试框架,可对智能体AI工作负载的LLM服务系统进行负载测试,能减少工作负载变化、提供性能分析并助力服务调试,将在GitHub开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-08-24 cs.SD eess.AS 版本更新 87%

FlexiSLM: A Spoken Language Model with Dynamic and Controllable Frame Rates

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 效率与部署 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Accepted to EMNLP2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04750 2026-08-24 cs.AR cs.DC 版本更新 87%

DeepStack: Facilitating Co-Design Exploration of 3D DRAM-Stacked Accelerators for Distributed LLM Inference

DeepStack:可扩展且准确的分布式3D堆叠AI加速器设计空间探索

Zhiwen Mo, Guoyu Li, Hao Mark Chen, Yu Cheng, Zhengju Tang, Qianzhou Wang, Lei Wang, Shuang Liang, Lingxiao Ma, Xianqi Zhou, Yuxiao Guo, Wayne Luk, Jilong Xue, Hongxiang Fan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DeepStack通过高效模型和工具实现分布式3D堆叠AI系统的早期设计空间探索,利用双阶段网络抽象和计算通信重叠技术,提升性能模拟效率,并揭示批量大小对架构设计的根本影响。

Comments Update MICRO ver

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20390 2026-08-24 cs.CL cs.AI cs.CY 新提交 85%

Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations

Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训

M Waleed Kadous, Amr Elsayed, Abdullah Al Nahas, Ashraf Haress

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。

Comments 10 pages, 1 figure, 3 tables. Live system: this https URL (https://askansari.ai). Code: this https URL (https://github.com/ansari-project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20486 2026-08-24 eess.SP 新提交 85%

Wireless Physical-Layer Foundation Models: Architectures, Learning Paradigms, Applications, and Deployment

无线物理层基础模型:架构、学习范式、应用与部署

Mohammad Cheraghinia, Davide Buffelli, Liu Li, Mohammad Alhellani, Jaron Fontaine, Sattar Vakili, Mamoun Guenach, Eli De Poorter, Adnan Shahid

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述无线物理层基础模型(WPFMs)的架构、学习范式等,提出五维度分类体系,分析其在多领域的应用部署可行性,探讨模型压缩与挑战,为相关研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21019 2026-08-24 cs.CL cs.AI 新提交 84%

Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models

面向量化语言模型不确定性保留的目标感知校准数据选择

Zhen Yang, Sizai Hou, Kaiwen Zheng, Yaofang Liu, Liang He, Yixuan Chen, Kangning Cui

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong(香港城市大学) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) University of Oxford(牛津大学) Yale University(耶鲁大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对量化语言模型的不确定性保留问题,提出DPQ方案,通过选择与目标对齐的校准数据,在多模型多基准实验中验证其能根据部署需求保留不同类型的不确定性行为。

Comments 20 pages, 5 figures. Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20360 2026-08-24 cs.CL cs.LG 新提交 84%

TriPLU: Bypassing the Gate with Direct Trilinear Product FFNs in Tiny Language Models

TriPLU:在小型语言模型中通过直接三线性乘积前馈网络绕过门控机制

He Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 TriPLU替换小型语言模型的门控前馈网络分支为3阶乘积分支,在低计算场景下提升了TinyStories等数据集的验证损失,但对优化敏感且未确立通用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 83%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15508 2026-08-24 cs.LG cs.CL 版本更新 82%

STS: Efficient Sparse Attention with Speculative Token Sparsity

STS: 高效稀疏注意力与推测性标记稀疏性

Jiangnan Yu, Ceyu Xu, Yongji Wu, Yuan Xie

机构 * The Hong Kong University of Science and Technology(香港科技大学) UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21194 2026-08-24 cs.CV 新提交 82%

ES-VP: Energy-Shaped Dynamic Visual Prompting for Efficient Model Adaptation

ES-VP:用于高效模型适配的能量型动态视觉提示

Can Jin, Ying Li, Jingchen Sun, Hongwu Peng, Jiahui Zhao, Yang Zhou, Lei Li, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Zhejiang University(浙江大学) University at Buffalo, SUNY(纽约州立大学布法罗分校) Adobe Research(奥多比研究院) University of Connecticut(康涅狄格大学) Washington University(华盛顿大学)

专题命中 效率与部署 :prompting(title,abstract)

AI总结 本文提出ES-VP方法,以低秩初始化和能量引导动态适配生成图像特异性提示,参数效率更高、泛化性更好,在多架构多数据集上均优于现有SOTA视觉提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20916 2026-08-24 cs.CV 新提交 82%

Semantically Compatible Knowledge Distillation for Cross-Domain Object Detection with Vision Foundation Models

基于视觉基础模型的跨域目标检测的语义兼容知识蒸馏

Qifeng Zhang, Ting Xiang, Zeyuan Bai, Changjian Chen

机构 * National Supercomputing Center in Changsha, Hunan University(湖南大学长沙国家超级计算中心)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 该研究针对跨域目标检测中VFM的语义不兼容问题,提出SLE-T框架,通过适配DINOv2实现高效知识迁移,在DAOD基准上达到SOTA性能,且训练成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20494 2026-08-24 cs.NI cs.AI cs.MA 新提交 81%

Towards Traffic Modelling of Multi-Agent Systems: The Role of Coordination Topology

面向多智能体系统的流量建模:协调拓扑的作用

Davide Lamagna, Albert Cabellos, Alberto Rodriguez-Natal, Gábor Rétvári, Berta Serracanta

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对多智能体LLM系统,通过500次重复运行的多层测量框架,揭示了协调拓扑对LLM请求到达过程的关键影响,相关框架与分析流程已公开。

Comments 7 pages, 5 figures, 4 tables. Published at the ACM SIGCOMM Workshop on Networks for AI Computing (NAIC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20379 2026-08-24 cs.AI 新提交 81%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09044 2026-08-24 cs.CL 版本更新 81%

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

经验树:面向自我进化智能体的分层经验管理

Zihao Deng, Yining Zhu, Leiming Wang, Junbo Wang, Jingfei Lu

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30949 2026-08-24 cs.AI cs.AR 版本更新 81%

AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

AgRefactor:面向HLS兼容性与性能的自进化智能体工作流

Yang Zou, Zijian Ding, Yizhou Sun, Jason Cong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-24 cs.CV cs.LG 版本更新 79%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21289 2026-08-24 cs.HC 新提交 78%

Supporting The Many Lives of Personal Data with Rebite: LLM-Powered Goal-Directed Framing in Food Journaling

通过Rebite支持个人数据的多重生命周期:大语言模型驱动的食品记录中目标导向的框架构建

Weijun Li, Daniel A. Epstein

专题命中 效率与部署 :LLM(title);prompting(abstract)

AI总结 该研究针对个人信息系统难以适应用户变化目标的问题,提出目标导向的框架构建方法,实现为Rebite系统,经21名参与者一周测试,可优化用户对饮食目标的互动与反思。

Comments To appear at UIST 2026 (The 39th Annual ACM Symposium on User Interface Software and Technology), Detroit, MI, USA. 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21345 2026-08-24 cs.LG 新提交 77%

Asymmetric Capacity Allocation in Self-Refinement Pipelines

自精化流水线中的非对称容量分配

Zhuoyi Yang, Ian G. Harris, Salar Hashemitaheri, Cassie Huang, Yuangang Li, Hyunwoo Oh, Paul Dourish, Tony Givargis, Mohsen Imani, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of California Irvine(加州大学欧文分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究针对自精化流水线开展分阶段模型规模研究,发现生成、修订阶段需更大模型,批判阶段对规模不敏感,为多阶段语言模型系统的非对称容量分配提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08734 2026-08-24 cs.AI 版本更新 77%

The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs

等效性错觉:大语言模型量化效应的统计表征

Baha Rababah, Shahzeb Qamar, Lorenz Sparrenberg, Rafet Sifa, Murat Kantarcioglu, Cuneyt Gurcan Akcora, Carson K. Leung

机构 * University of Manitoba(曼尼托巴大学) Red River College Polytechnic(红河理工学院) University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究大语言模型量化效应,引入正确性一致性指标,发现适度量化下有行为差异,通过分析量化为结构算子及量化失真,揭示低比特宽度非线性断点等,促使超越传统指标评估行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20729 2026-08-24 cs.AI cs.CL 新提交 76%

Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol

校准大语言模型智能体中的准则修订:失败模式与基于轨迹锚定的协议

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛郭东先生网络科技有限公司)

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文针对大语言模型智能体的准则修订归因问题,分析CMB-0.1测试的失败模式,提出基于轨迹锚定的CMB-0.4协议,为准则修订测试提供更具区分度的方案。

Comments 18 pages, 8 tables, 1 figure. CMB-0.1 is an instrument-calibration study; CMB-0.4 is a prospective protocol, not an empirical result

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20953 2026-08-24 cs.CL cs.AI cs.LG cs.PF 新提交 75%

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

量化感知修复:恢复压缩4位大语言模型的实用方案

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

机构 * Multiverse Computing(多元宇宙计算公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对压缩4位大模型部署时性能下降问题,提出量化感知修复方案,直接从原始未压缩模型蒸馏4位学生模型,在多基准测试中表现优于量化感知训练,且部署便捷。

Comments Patent Application Number: 26382838.6 / P202602102EP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-08-24 cs.AI cs.CL 版本更新 73%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏