arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2606.11207 2026-06-11 cs.AI cs.CL 新提交 73%

From Explicit Elements to Implicit Intent: A Predefined Library for Auditable Behavioral Inference

从显式元素到隐式意图:用于可审计行为推断的预定义库

Liu hung ming

机构 * PARRAWA AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出SemantiClean框架,通过共享元素库从电商会话数据中提取结构化语义信号,驱动可插拔推断目标,优先保证可审计性和可复现性,而非单纯追求精度。

Comments 20 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10935 2026-06-10 cs.LG cs.AI 新提交 73%

CLP: Collocation-Length Prediction for Zero-Loss Adaptive Multi-Token Inference

CLP: 零损失自适应多令牌推理的搭配长度预测

Xuezhen Xie, Zhiqiang Zhou

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CLP方法,通过轻量级线性层预测可安全接受的额外令牌数,解决多令牌预测中头-主干竞争导致的输出退化问题,在Qwen2.5模型上实现零质量损失的1.14x-1.29x加速。

Comments 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10369 2026-06-10 cs.CL cs.LG 新提交 73%

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD: 面向非路由器教师指导MoE学生学习的路径对齐解压缩蒸馏

Xinyue Peng, Yi Qian, Jiaojiao Lin, Wenjian Shao, Yanming Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出路径对齐解压缩蒸馏(PADD)框架,通过四阶段两阶段流程将密集教师知识蒸馏到混合专家(MoE)学生中,同时学习高质量路由策略,在数学推理任务上显著优于基线。

Comments published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09886 2026-06-10 cs.LG cs.AI 新提交 73%

SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs

SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝

Yuhao Zhang

机构 * Beihang University(北航大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SHAPE框架,通过合作博弈论建模专家间协作,利用Shapley值识别高贡献专家,结合质量覆盖选择规则在剪枝预算下保留关键专家,实验表明在多种MoE模型上提升鲁棒性并降低显存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09012 2026-06-09 cs.LG cs.AI math.OC stat.ML 新提交 73%

Understanding Quantization-Aware Training: Gradients at Quantized Weights Bias to the Low-Loss Basin

理解量化感知训练:量化权重的梯度偏向低损失盆地

Hanyang Li, Jianhao Ma, Ying Cui

机构 * University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出统一几何框架解释后训练量化失败与量化感知训练恢复机制,揭示量化感知训练通过梯度感知谷壁使量化点返回低损失盆地。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07710 2026-06-09 cs.LG cs.AI 新提交 73%

WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing

WhiFlash: 通过令牌级跨范式路由加速推测解码

Young D. Kwon, Miles Williams, Rui Li, Alexandros Kouris, Stylianos I. Venieris

机构 * Samsung AI Center, Cambridge, UK(三星AI中心,剑桥,英国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出WhiFlash,首个统一自回归与扩散并行草稿的跨范式推测解码方法,通过细粒度路由和缓存优化实现高达69.6%的吞吐量提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07074 2026-06-08 cs.LG cs.AI 新提交 73%

SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating

SlimSearcher: 通过自适应奖励门控实现训练效率感知的Web代理

Zequn Xie, Junjie Wang, Dan Yang, Jie Feng, Yue Shen, Jian Wang, Jinjie Gu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出SlimSearcher框架,通过帕累托高效过滤和自适应奖励门控,在保持或提升准确率的同时将工具调用轮次减少17%-58%。

Comments 17 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06743 2026-06-08 cs.SD cs.AI cs.CL 新提交 73%

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

HybridCodec: 快速双流、语义增强的神经音频编解码器

Arjun Gangwar, S Umesh

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HybridCodec,一种结合语义蒸馏与双流架构的统一神经音频编解码器,实现强解耦、跨语言鲁棒性及3倍速度提升。

Comments 5 pages, 5 tables, 1 figure, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15962 2026-08-18 cs.CL cs.CV 新提交 72%

SEER: Long-Context Reasoning via Selective Visual-Text Compression

SEER:基于选择性视觉-文本压缩的长上下文推理

Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Cambridge(剑桥大学) University of Technology Sydney(悉尼科技大学) The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。

Comments COLM 2026, Third Conference on Language Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15075 2026-08-18 cs.CV 新提交 71%

SA-GEM: Scale-Adaptive and Geospatial Evidence-Modulated Token Pruning for Efficient Remote Sensing Large Vision-Language Models

SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝

Kexin Ma, Jing Xiao, Bowen Xing, Liang Liao, Chia-Wen Lin

专题命中 效率与部署 :language model(title)

AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11663 2026-08-13 cs.CV 新提交 71%

Zero-OVCD: Bridging Training-Free Foundation Models and Pseudo-Label Learning for Open-Vocabulary Change Detection

Zero-OVCD:连接无训练基础模型与伪标签学习的开放词汇变化检测方法

Daifeng Peng, Yuanke Peng, Haiyan Guan

机构 * School of Remote Sensing and Geomatics Engineering, Nanjing University of Information Science and Technology(南京信息工程大学遥感与测绘工程学院)

专题命中 效率与部署 :foundation model(title)

AI总结 本文提出Zero-OVCD框架,结合无训练基础模型推理与感知噪声的伪标签学习,在多个遥感变化检测数据集上显著提升了开放词汇变化检测性能,且无需目标域像素级标注。

Comments 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06188 2026-08-07 cs.DC cs.PF 新提交 71%

Routing LLM Inference to the Cleanest Grid in Real Time

实时将大语言模型推理路由至清洁电网

Aleks Bernhard, Arif Baran Yardimci

专题命中 效率与部署 :LLM(title)

AI总结 本研究提出基于边际运行排放率(MOER)信号的碳感知大语言模型推理路由方法,通过多区域GPU测试平台实时验证,可减少50.9%的GPU归因运行排放,优于轮询及静态年平均MOER策略。

Comments 18 pages, 4 figures. Live multi-region GPU validation plus a one-year historical marginal-emissions replay

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 71%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title)

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00110 2026-08-04 cs.CV 新提交 71%

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

蒸馏RGB可恢复的内容:面向仅RGB视觉-语言模型的特权3D证据

Yanbin Hu, Jin Cui, Jun Ye, Jiepeng Zhou, Jiangcheng Song, Boran Zhao, Pengju Ren

专题命中 效率与部署 :language model(title)

AI总结 本研究提出特权3D证据蒸馏框架,将训练时的3D证据转化为仅RGB视觉-语言模型的空间推理能力,使仅RGB学生模型在11项指标上均优于基线,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23080 2026-06-23 eess.AS cs.SD 新提交 71%

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

AudioCALM:面向通用音频生成的连续自回归语言建模

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(阿里云团队,阿里巴巴集团)

专题命中 效率与部署 :language model(title)

AI总结 提出AudioCALM框架,通过连续音频潜变量的自回归预测和不对称模态专家架构,统一语音、声音和音乐生成,在三个任务上达到或超越专用模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27343 2026-08-28 cs.CL 新提交 70%

Pair-Level Essay-Scale Republication and Reuse from Fragmented Historical Text Reuse: A Workflow Study on Eighteenth-Century Books and Newspapers

从碎片化的历史文本复用中恢复成对的散文级再发布与复用:一项关于18世纪书籍与报纸的工作流研究

Ke Shu, Kira Hinderks, Eetu Mäkelä, Mikko Tolonen

机构 * University of Helsinki(赫尔辛基大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对碎片化历史文本复用的成对证据整合难题,以18世纪休谟的散文为研究对象,提出分阶段规则工作流,在ECCO数据集上验证了方法的有效性,为历史文本复用的恢复提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26926 2026-08-28 cs.LG 新提交 70%

A Layer Importance Metric for Quantization Accounting for the Speed-Quality Trade-off in Autoregressive Models

考虑自回归模型中速度-质量权衡的层重要性度量

Artem Safronov

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 针对内存有限设备上的自回归小型语言模型,提出结合信息保留与吞吐量增益的复合层重要性度量,可调整速度-质量权衡,预测加速比误差约4%,性能优于部分同类方法。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26112 2026-08-28 cs.CL 新提交 70%

TreeGraft: Adaptive Multi-Drafter Grafting for Tree-Based Speculative Decoding

TreeGraft:面向基于树的推测解码的自适应多 Draft 嫁接方法

Jiaming Fan, Daming Cao, Canchen Huang, Jiale Fu, Jin Zhang, Junjie Gao, Kai Yang, Xiangzhong Luo, Xu Yang

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TreeGraft 是多 Draft 器框架,通过强弱 Draft 器协作及轻量调度器控制成本,在 10 组模型对和 6 个基准上,较最优单 Draft 器策略平均性能提升 15.1%,解决了树结构推测解码的速度与质量两难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25941 2026-08-27 cs.LG 新提交 70%

When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs

当剪枝遇上可解释性:在大语言模型中保留稀疏自编码器的鲁棒性

Suchit Gupte, Xueru Zhang, Mohammad Mahdi Khalili

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究探讨剪枝对大语言模型稀疏自编码器的影响,提出扰动能量理论,指出激活感知剪枝方法更鲁棒,发现中间层更敏感,提出分层稀疏策略并经多模型实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25583 2026-08-27 cs.CL 新提交 70%

GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning

GRIP:用于高效推理的粒度奖励引导参数插值

Lam So, Canhui Wu, Han Lin

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对推理模型与指令模型的准确性-效率不匹配问题,提出GRIP框架,通过优化同架构两模型模块的可学习插值比例,实现更优的准确性-效率权衡。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25575 2026-08-27 cs.CV cs.AI 新提交 70%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25115 2026-08-27 cs.CL cs.IR 新提交 70%

Less can be More: Relieving RAG Bottlenecks via Evidence Frontloading and Pressure-Adaptive Budgeting

少即是多:通过证据前置和压力自适应预算缓解RAG瓶颈

Weibin Cai, Reza Zafarani

机构 * Syracuse University(雪城大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对RAG系统瓶颈转移问题,提出无训练框架PACE,结合证据前置与压力自适应预算,在多跳问答数据集及模拟中提升了证据召回率并降低了重排序密集型负载的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25091 2026-08-27 cs.AI cs.CR 新提交 70%

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

自动策略,而非自动技能:面向物理世界的编译智能体技能

Zhonghao Zhan, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对恶意智能体技能造成物理伤害的问题,提出位于技能制品内部的类型化权限层Edge Skillguard,可高效拒绝借用权限请求,验证了其在多场景下的防护效果。

Comments Presented at the 1st Workshop on Agent Skills (Agent Skills '26), ACM CAIS 2026, San Jose, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 70%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22522 2026-08-25 cs.LG 新提交 70%

From Detrimental to Beneficial: Dynamic Influence-based Valuation and Editing

从有害到有益:基于动态影响力的评估与编辑

Adrian Nyakairu, Hongfu Liu

机构 * Brandeis University(布兰迪斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DIVE框架,通过在优化层面反转有害样本梯度方向,将有害数据转化为有益贡献,可提升分类性能、最大化数据效率并稳定优化,还能泛化到大语言模型微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21836 2026-08-25 cs.AI 新提交 70%

LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization

LLM4LLM:通过闭环智能体优化弥合内核基准与实际部署之间的差距

Hui Zeng, Pengfei Yang, Yanxin Chen, Fusong Ju, Xinran Wei

机构 * National Key Laboratory of Advanced Communication Networks(先进通信网络国家重点实验室) Xidian University(西安电子科技大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员提出LLM4LLM部署感知闭环优化框架,解决内核基准与实际部署的性能差距,在A100、H100的10个语言模型推理工作负载及KernelBench Level 2上实现显著加速。

Comments accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21693 2026-08-25 cs.LG 新提交 70%

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

对混合专家大型语言模型中的可组合压缩技术进行基准测试

Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

机构 * University of Virginia(弗吉尼亚大学) Sony AI(索尼人工智能)

专题命中 效率与部署 :LLM(summary_cn);分类 cs.LG

AI总结 本研究提出MoEXBench基准,系统评估混合专家LLM的可组合压缩技术,发现压缩方法间存在非平凡相互作用,为MoE模型部署提供实用的准确率-内存-延迟比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21610 2026-08-25 cs.AI 新提交 70%

Semantic Compression Trees: Multi-Resolution Knowledge Retrieval via Hierarchical Semantic Residuals

语义压缩树:通过分层语义残差实现多分辨率知识检索

Junaid Farooq

机构 * National Institute of Technology Srinagar(斯利那加国家理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对检索增强生成的扁平索引缺陷,提出语义压缩树(SCT)分层索引,在QASPER数据集上验证其性能,发现残差表示有效但自上而下路由表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21500 2026-08-25 cs.CR cs.AI 新提交 70%

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

SecOPD:通过策略内蒸馏缓解自适应提示注入攻击

Yibo Peng, Long Lian, David Wagner, Sizhe Chen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI智能体面临的自适应提示注入攻击,提出SecOPD方法,通过令牌级反馈优化防御微调,大幅降低攻击成功率,且安全性可泛化到工具调用等新领域。

Comments EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21375 2026-08-25 cs.AI 新提交 70%

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

SchemaRouter:面向高效异构智能体检索增强生成的字段感知工具路由

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SchemaRouter是轻量级字段感知工具路由层,通过模式图实现工具与字段的精准选择,在材料科学基准中,其效率、准确率、工具精确率等表现优于基线,还能提供来源与许可信息。

Comments 13 pages, 4 figures, 6 tables. Code, benchmark, and fixtures: https://github.com/JDeun/SchemaRouter_research

详情

展开后加载摘要…

URL PDF HTML 收藏