arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2607.01831 2026-07-03 cs.DC cs.LG 新提交 77%

Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

Lynx: 渐进式推测量化加速长上下文推理中的KV传输

Wenchen Han, Gingfung Matthew Yeung, Marco Barletta, William Toner, Amory Hoste, Adam Barker

机构 * University College London(伦敦大学学院) Huawei(华为)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对长上下文推理中KV缓存传输延迟问题,提出Lynx系统,通过将KV缓存分为高优先级Anchor流和低优先级Residual流,实现渐进式传输和推测解码,在降低首令牌延迟的同时保持高精度。

Comments 15 pages, 12 figures. This manuscript was originally submitted to SIGCOMM '26 in February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30697 2026-07-01 cs.OS cs.AI cs.CV 新提交 77%

LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

LUMOS:面向无障碍AI代理的语义操作系统层

Yogeswar Reddy Thota

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出LUMOS语义层,将操作系统无障碍元数据转化为机器可读蓝图,使AI代理通过结构化UI原语而非截图进行观察-行动循环,降低视觉依赖和成本。

Comments The LUMOS repository is available at https://github.com/thotayogeswarreddy/Lumos.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18394 2026-06-26 cs.CL 新提交 77%

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlow: 通过并行树草稿突破推测解码的缩放上限

Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Peng Zhao, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

机构 * UC San Diego(加州大学圣地亚哥分校) Zhejiang University(浙江大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Nanjing University(南京大学) StepFun(阶跃星辰)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出JetFlow框架,通过因果并行草稿头结合树推测解码,将更大草稿预算转化为更长接受前缀和更高端到端加速,在Qwen3模型上实现最高9.64倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24369 2026-06-25 cs.AI cs.DC cs.NI cs.PF 新提交 77%

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

加速面向视觉生成式大语言模型的解耦强化学习:基于扩散并行与训练器辅助生成

Sijie Wang, Zhengyu Qing, Zhiqiang Tan, Yiming Yin, Yeqing Zhang, Yaoyuan Wang, Qiang Wang, Xiaowen Chu, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析学域) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出解耦强化学习框架DigenRL,通过生成轴流水线、时间步并行和弹性训练器辅助生成,解决扩散生成式大语言模型中执行气泡问题,实现1.56-2.10倍吞吐提升。

Comments Withdrawn by the authors pending resolution of intellectual property and institutional disclosure requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24579 2026-06-24 cs.CL 新提交 77%

Cross-Lingual Exploration for Parametric Knowledge

跨语言探索参数化知识

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend

机构 * The Hebrew University of Jerusalem(海法大学) Google Research(谷歌研究) MIT, IBM-MIT Watson AI Lab(麻省理工学院与IBM-麻省理工 Watson人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究通过跨语言提示策略探索大型语言模型中的隐藏事实知识,发现跨语言探索能显著提升知识迁移和事实召回,比单语言扩展更高效,并改善跨语言一致性。

Comments 29 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21882 2026-06-23 cs.SD cs.AI 新提交 77%

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

基于有限前瞻的流式T5文本到语音合成

Muyang Du, Jason Roche, Junjie Lai

机构 * NVIDIAChina(英伟达中国) NVIDIAUSA(英伟达美国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出S5-TTS,一种基于T5的流式变体,通过编码器-解码器语言模型和单调对齐学习实现逐词增量语音合成,并引入前瞻因果掩码和交错多源蒸馏以在低延迟下保持质量。

Comments 6 pages, 1 figure, 4 tables, Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21130 2026-06-23 cs.AI 新提交 77%

Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers

面向超大规模数据中心AI工作负载激增的突发感知容量压力预警模型学习

Zihan Yu, Xianling Zeng, Zhiming Xue, Yalun Qi, Sichen Zhao

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对AI工作负载突发导致容量压力的问题,提出部署导向的突发感知预警框架,采用轻量级树模型实现高召回预测,支持主动干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17781 2026-06-17 cs.AR cs.AI 新提交 77%

MIVE: A Minimalist Integer Vector Engine for Softmax LayerNorm and RMSNorm Acceleration

MIVE:用于Softmax、LayerNorm和RMSNorm加速的极简整数向量引擎

Kosmas Alexandridis, Giorgos Dimitrakopoulos

机构 * Integrated Circuits Lab, Electrical and Computer Engineering, Democritus University of Thrace (DUTH), Greece(德摩克利特大学特拉克分校集成电路实验室,电气与计算机工程,德摩克利特大学特拉克分校(DUTH),希腊)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种可编程的极简整数向量引擎MIVE,通过统一数据通路执行Softmax、LayerNorm和RMSNorm三种操作,最大化硬件共享,提升面积和硬件效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17123 2026-06-17 cs.CR cs.AI 新提交 77%

LineageMark: Multi-user White-box Watermarking for Contribution Tracing in Model Derivation Chains

LineageMark:模型衍生链中用于贡献追踪的多用户白盒水印

Bingxue Zhang, Xiaofeng Xu, Feida Zhu

机构 * University of Shanghai for Science and Technology(上海科技大学) Singapore Management University(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LineageMark框架,通过投影法在模型参数中嵌入水印,支持多用户、多阶段衍生链中的贡献追踪,对重水印、微调等扰动具有鲁棒性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 77%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16035 2026-06-16 physics.ins-det cs.LG hep-ex nucl-ex physics.data-an 新提交 77%

GPT-Based Fast Simulation of CLAS12 Detector Hits via Conditional Autoregressive Generation

基于GPT的条件自回归生成实现CLAS12探测器击中快速模拟

Cole Granger, James Giroux, Richard Tyson, Maurizio Ungaro, Cristiano Fanelli

机构 * William & Mary, Department of Data Science(威廉玛丽学院数据科学系) William & Mary, Department of Physics(威廉玛丽学院物理系) University of Glasgow, School of Physics and Astronomy(格拉斯哥大学物理与天文学学院) Thomas Jefferson National Accelerator Facility(泰勒·杰弗里斯国家加速器设施)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GPT风格自回归Transformer作为CLAS12电磁量能器的快速替代模型,以入射动量条件生成探测器击中序列,在保持物理保真度下实现每秒700事件以上的推理速度。

Comments 19 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15161 2026-06-16 cs.CL 新提交 77%

Beyond Layer Importance in Layer-wise Sparsity: An Inter-Layer Perturbation-Absorption Perspective

超越逐层稀疏中的层重要性:层间扰动吸收视角

Tao Jing, Ningxin Wu, Chen Kang, Dong Yu, Changliang Li, Pengyuan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过受控扰动实验发现大语言模型中不同层对剪枝扰动的响应存在异质性,早期层放大扰动而中后期层吸收扰动,并基于此提出吸收感知校正方法,在70%稀疏度下降低困惑度7.13%并提升零样本准确率1.02%。

Comments 10 pages, 4 figures, 4 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14748 2026-06-16 cs.CV cs.AI 新提交 77%

Is My Vision-Language Data in Your AI? Membership Inference Test (MINT) Demo 2

我的视觉-语言数据在你的AI中吗?成员推断测试(MINT)演示2

Daniel DeAlcala, Gonzalo Mancera, Julian Fierrez, Aythami Morales, Ruben Tolosana, Ruben Vera-Rodriguez

机构 * Universidad Autonoma de Madrid(马德里自治大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出成员推断测试(MINT)框架,通过多种架构检测训练数据,在人脸识别和LLM上准确率达90%,并构建了多模态审计平台。

Comments IEEE Conf. on Computers, Software, and Applications (COMPSAC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14243 2026-06-15 cs.CL 新提交 77%

Decoupled Mixture-of-Experts for Parametric Knowledge Injection

解耦混合专家用于参数化知识注入

Baoqing Yue, Weihang Su, Qingyao Ai, Yichen Tang, Changyue Wang, Jiacheng Kang, Jingtao Zhan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出解耦混合专家(DMoE)架构,将外部知识转化为独立可更新的专家模块,通过轻量级不确定性感知路由器在基础模型知识不足时激活相关专家,实现参数级知识增强,在知识密集型基准上优于检索和适配器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12940 2026-06-12 cs.SD cs.LG 新提交 77%

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

自引导:通过解码器流形对齐增强神经编解码器

Xiang Li, Yixuan Zhou, Jingran Xie, Zhiyong Wu, Hui Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 提出自引导方法,通过轻量特征映射损失对齐解码器内部流形,在不改变推理过程下提升VQ-VAE神经语音编解码器重建质量,实现低比特率SOTA性能并支持4倍码本缩减。

Comments 20 pages, 9 figures, accepted to ICML 2026, demo website available at https://sgvqvae.github.io/sgvqvae-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12350 2026-06-11 cs.AI 新提交 77%

Nonslop: A Gamified Experiment in Human-AI Collaborative Writing

Nonslop: 人机协作写作中的游戏化实验

Maria Edwards, Julian Togelius

机构 * IEEE

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过游戏化写作实验,研究用户在AI建议下何时保持创意自主性,揭示效率与真实性之间的张力。

Comments Accepted at the 2026 IEEE Conference on Games (CoG 2026); to be published in the conference proceedings. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11217 2026-06-11 cs.CY cs.AI cs.HC 新提交 77%

Preregistration for Experiments with AI Agents

AI智能体实验的预注册

Michelle Vaccaro

机构 * MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对AI智能体实验中的方法论漏洞,提出将预注册实践扩展至该领域,并设计专用模板以提升研究可信度。

Comments Accepted at ICML 2026 as a Spotlight (Top 5%) Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09114 2026-06-09 cs.CL 新提交 77%

MAAM: Anchor-Preserving Compression and Contextual Calibration for Chinese Discriminatory Language Detection

MAAM:面向中文歧视性语言检测的锚点保留压缩与上下文校准

Yuxin Fu, Shijing Si

机构 * School of Economics and Finance, Shanghai International Studies University(上海外国语大学国际金融贸易学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出MAAM框架,通过保留歧视相关语义锚点并结合上下文先验校准,在轻量级模型上提升中文歧视性语言检测的准确性和校准性,同时构建首个中文LGBT歧视语料库ChLGBT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 77%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08755 2026-06-09 cs.CL 新提交 77%

Co-Evolving Skill Generation and Policy Optimization

共同进化技能生成与策略优化

Zhiwei Zhang, Yudi Lin, Nikki Lijing Kuang, Linlin Wu, Xiaomin Li, Songtao Liu, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanyang Technological University(南洋理工大学) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学) Harvard University(哈佛大学)

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract);language agent(abstract);分类 cs.CL

AI总结 提出在线强化学习框架,通过对比基线和技能增强轨迹的奖励差距估计技能边际效用,实现存储前验证,并利用该信号训练策略作为技能生成器,减少对专有模型的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08173 2026-06-09 cs.CR cs.LG cs.NI 新提交 77%

AI-Native Closed-Loop Security for 6G-Enabled Cyber-Physical Systems: From Edge Detection to Network-Wide Mitigation

面向6G赋能信息物理系统的AI原生闭环安全:从边缘检测到全网缓解

Bilal Hussain, Muhammad Bilal, Tan Li, Haris Pervaiz, Xiao Tang, Qinghe Du, Fawad Ahmad, Muhammad Azhar, Jun Zhang

机构 * Division of Science, Engineering, and Health Studies, School of Professional Education and Executive Development, The Hong Kong Polytechnic University(香港理工大学科学、工程与健康研究学院,专业教育与 executive 发展学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院) Department of Computer Science, The Hang Seng University of Hong Kong(香港恒生大学计算机科学系) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) Department of Applied Data Science, Hong Kong Shue Yan University(香港-Shue Yan大学应用数据科学系) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港理工大学电子与计算机工程系)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种AI原生闭环安全架构,在6G CPS中利用MEC进行边缘检测,通过SDN/NFV/O-RAN实现全网缓解,并形式化定义了切片级延迟约束,系统综述了128篇研究并归纳了五个开放问题。

Comments 30 pages, 12 figures, survey paper, submitted to IEEE Communications Surveys & Tutorials (IEEE COMST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20729 2026-08-24 cs.AI cs.CL 新提交 76%

Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol

校准大语言模型智能体中的准则修订:失败模式与基于轨迹锚定的协议

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛郭东先生网络科技有限公司)

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文针对大语言模型智能体的准则修订归因问题,分析CMB-0.1测试的失败模式,提出基于轨迹锚定的CMB-0.4协议,为准则修订测试提供更具区分度的方案。

Comments 18 pages, 8 tables, 1 figure. CMB-0.1 is an instrument-calibration study; CMB-0.4 is a prospective protocol, not an empirical result

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21624 2026-07-27 cs.AI cs.DC cs.LG 新提交 76%

FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs

FBLayout:为在移动GPU上高效微调大语言模型优化内存布局

Kahou Tam, Wei Niu, Yu Bao, Xiaomin Ouyang, Chengzhong Xu, Li Li

机构 * University of Macau(澳门大学) University of Georgia(佐治亚大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 研究针对移动GPU上Transformer模型微调内存低效问题,提出FBLayout框架,通过统一布局、索引转换及激活引导选择等方法,在多手机多模型测试中实现加速,提高缓存效率并减少内存占用,助力设备上大模型微调。

Comments 13 pages, 21 figures, Mobisys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15047 2026-07-17 cs.CV cs.AI cs.LG 新提交 76%

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

基于自适应焦点损失的视觉基础模型参数高效提示调优用于可解释的轻度认知障碍筛查

Javad Khoramdel, Farhad Hoseyni, Amirhossein Nikoofard

机构 * APAC Research Group, Faculty of Electrical Engineering, K. N. Toosi University of Technology(亚太研究小组,电气工程学院,伊朗德黑兰的KN Toosi科技大学)

专题命中 效率与部署 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究针对轻度认知障碍筛查中数据与诊断问题,提出用冻结DINOv2 - Small模型经特定提示令牌参数高效调优的框架,结合自适应焦点损失处理边界模糊性,在交叉验证中表现良好,优于ResViT基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07557 2026-07-09 cs.CL cs.LG 新提交 76%

PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

PALS:用于大语言模型剪枝的百分位数感知分层稀疏性

Yazdan Jamshidi, Alexey Shvets

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型剪枝中各层重要性差异被忽略的问题,提出PALS方法,基于激活幅度第99百分位数调整每层稀疏性,在LLaMA - 2 - 7B上效果显著,且成本低无需微调,还发现基于梯度的分配效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01480 2026-07-03 cs.AI cs.LG 新提交 76%

Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

程序记忆蒸馏:用于自我改进语言模型的在线反思

Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz

专题命中 效率与部署 :language model(title);分类 cs.AI、cs.LG

AI总结 提出程序记忆蒸馏(PMD),通过在线提取跨回合信号(轨迹、反思策略、行为模式)并蒸馏到策略权重中,使语言模型在推理时无需额外记忆,相比SDPO在SCIKNOWEVAL和LIVECODEBENCH上分别提升3.8-5.5%和7.9-13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32022 2026-07-01 cs.LG cs.CL 新提交 76%

SemRF: A Semantic Reference Frame for Residual-Stream Dynamics in Language Models

SemRF:语言模型中残差流语义参考框架

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(莫纳什大学) Technical University of Munich(慕尼黑工业大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title);分类 cs.CL、cs.LG

AI总结 提出语义参考框架(SemRF),通过锚点固定实现残差流语义坐标的稳定测量,并利用Voronoi迹定义最小作用路径,揭示层间计算与参数效率的关系。

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-08-27 cs.LG cs.AI cs.CL 新提交 75%

Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 效率与部署 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20953 2026-08-24 cs.CL cs.AI cs.LG cs.PF 新提交 75%

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

量化感知修复:恢复压缩4位大语言模型的实用方案

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

机构 * Multiverse Computing(多元宇宙计算公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对压缩4位大模型部署时性能下降问题,提出量化感知修复方案,直接从原始未压缩模型蒸馏4位学生模型,在多基准测试中表现优于量化感知训练,且部署便捷。

Comments Patent Application Number: 26382838.6 / P202602102EP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20210 2026-08-21 cs.IR cs.AI cs.CL cs.LG 新提交 75%

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M:专为CPU推理设计的卷积-注意力混合架构

Christos Koutsiaris

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出专为CPU推理设计的Daedalus-150M混合架构,在5项任务基准得分超预设线,击败多款更大数据训练的模型,解码速度随上下文长度增长优势显著。

Comments 8 pages, 2 figures, 10 tables. Code, weights and the measurement artefacts behind every number: https://github.com/unseen1980/daedalus

详情

展开后加载摘要…

URL PDF HTML 收藏