arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2606.08129 2026-06-09 cs.AI 新提交 89%

Cross-LLM Consistency in Inference: Evidence from Shared Interactions

推理中的跨LLM一致性:来自共享交互的证据

Siyu Lou, Yao Yan, Yuntian Chen, Quanshi Zhang

机构 * School of Computer Science Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ningbo Key Laboratory of Advanced Manufacturing Simulation Eastern Institute of Technology, Ningbo(宁波市先进制造仿真重点实验室,宁波东方理工大学) College of Computer and Information Science Chongqing Normal University(重庆师范大学计算机与信息科学学院) SymtrustAI.com Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,不同大型语言模型在相同提示下预测相同目标词时,常共享交互模式,且高级模型一致性更强,共享交互通常阶数更低、正负抵消更弱。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26140 2026-08-28 cs.CL cs.LG 新提交 88%

Affix Cache for Diffusion Large Language Models

扩散大语言模型的词缀缓存

Kaihua Liang, An Zhong, Xin Tan, Zafar Ayyub Qazi, Hong Xu, Jian Weng, Marco Canini

机构 * KAUST(阿卜杜拉国王科技大学) CUHK(香港中文大学) LUMS(拉合尔管理科学大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25761 2026-08-27 cs.CL cs.AI 新提交 88%

Beam Search, Self-Consistency, and the Limits of Inference-Time Scaling for Grammar-Constrained Text-to-SQL in Small Language Models

束搜索、自一致性以及小语言模型中语法约束下文本到SQL任务推理时间缩放的局限性

Ty Chermsirivatana, John MacCormick

机构 * Deep Network Understanding Lab(深度网络理解实验室) Dickinson College(狄金森学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对语法约束下的小语言模型文本到SQL任务,研究了模型规模与推理计算的权衡,发现受约束权衡表现不同,束搜索优于采样+投票,且增大模型规模比增加推理计算更有利。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14644 2026-08-18 cs.LG cs.CL 新提交 88%

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

DUET:基于同权重分歧的双教师在线策略蒸馏用于禁止合规性

Zihan Li, Feifei Li, Wenhui Que

专题命中 效率与部署 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对LLM部署中的动态禁止规则合规问题,提出DUET双教师在线策略蒸馏方法,构建工业基准,在Qwen模型上实现高合规性与效用保留,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14604 2026-08-18 cs.CL cs.AI 新提交 88%

Wiola 13M, a Gated Spiral Attention Architecture for Parameter Efficient Small Language Models

Wiola 13M:一种用于参数高效小型语言模型的门控螺旋注意力架构

Aryuemaan Kumar Chowdhury, Praveen Oosa, Vineesha Reddy

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对10M-100M参数小型语言模型未适配小规模Transformer的问题,提出含三个创新组件的Wiola 13M模型,验证其等价性并发布开源实现,提升长程区分与梯度流性能。

Comments 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22757 2026-07-28 cs.LG cs.AI 新提交 88%

Hierarchical Grading in Large Language Models

大语言模型中的分层分级

T. Shaska

机构 * Oakland University(奥克兰大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究提出分级大语言模型(GLLMs)框架,通过代数方法为变换器表示空间分级并传播加权标量作用,扩展相关理论到自回归语言模型。证明分层目标下分级与无分级的极小极大分离,最优分级可离线估计,训练后编译成标准变换器,兼具多种优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08991 2026-07-13 cs.LG cs.CL 新提交 88%

Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

大语言模型中用于激活稀疏化的灵敏度感知阈值处理和令牌路由

Bishmoy Paul, Youngmin Yi, Hoeseok Yang

机构 * Santa Clara University(圣塔克拉拉大学) Sogang University(西江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中如何在保留模型质量时减少计算,提出灵敏度感知阈值处理方法SATS及轻量级令牌路由框架,经实验评估,SATS在匹配稀疏度时优于基线,令牌路由有更好的质量-吞吐量权衡,改进方法可提升大语言模型权衡效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08027 2026-07-10 cs.CL cs.AI 新提交 88%

Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

通过幂变换和符号保留分数聚合与自适应特征保留对大语言模型进行结构化剪枝

Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

机构 * Chubu University(楚ubu大学) Panasonic Holdings Corporation(松下电器控股公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型结构化剪枝,改进自适应特征保留技术。结合幂变换、符号保留分数聚合及异常值去除方法,解决应用中出现的分布不匹配等问题。实验表明该方法能保持准确率,通过结构化剪枝加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07626 2026-07-09 cs.CL cs.AI 新提交 88%

Future Confidence Distillation in Large Language Models

大语言模型中的未来置信度蒸馏

Sahil Kale

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型置信度估计,通过比较解决问题前后的置信度,发现其在回答过程中演变。基于此引入未来置信度蒸馏,用解决问题后的置信度估计训练解决问题前隐藏表征的预测器,实现可靠且低成本的置信度估计。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 88%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22496 2026-06-23 cs.PF cs.AI cs.LG 新提交 88%

Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

通过物联网数据预处理实现边缘AI的云端级精度

Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Leino, Johanna Virkki

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22249 2026-06-23 cs.LG cs.AI 新提交 88%

On the Expressive Power of Weight Quantization in Large Language Models

大语言模型中权重量化的表达能力

Shao-Qun Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Intelligent Science and Technology(智能科学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析,证明1.58比特是权重量化的极限精度,并揭示量化比特数减少会导致表达能力多项式级退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19768 2026-07-23 cs.LG cs.AR 新提交 88%

AlphaRoute: Large Language Models as Semantic Optimizers for Multi-Objective Routing

AlphaRoute:将大语言模型用作多目标路由的语义优化器

Kabir Murjani, Mishri Bhavsar, Manish I. Patel, Jonti Talukdar

机构 * Institute of Technology, Nirma University(尼玛大学理工学院) Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)

AI总结 针对VLSI全局路由这一NP难组合优化问题,传统方法失效。AlphaRoute将拆线重布重构为动态优化系统,引入基于SHAP的溢出分解等技术,用大语言模型作语义策略优化器,在基准测试中大幅减少溢出,证明优越算法可克服Python实现的延迟。

Comments 7 pages, 5 figures. Accepted for publication in the IEEE International Conference on LLM-Aided Design, 2026, Stanford University, Stanford, CA, USA. Code available at https://github.com/Kcbir/AlphaRoute

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19350 2026-06-19 cs.CL 新提交 88%

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

基于因果归因的剪枝保留大型语言模型的推理性能

Amogh Sheth, Biruk Assefa, Yi Wen Huang, Andrew Lin, Yuhao Ge

机构 * Edison Academy Magnet School(爱迪生学院磁石学校) Massachusetts Institute of Technology(麻省理工学院) State University of New York College at Plattsburgh(纽约州立大学普拉茨堡学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 提出无需训练的因果归因剪枝(CAP)方法,通过测量注意力头对推理任务的因果影响进行细粒度剪枝,在20%稀疏度下相比Wanda在ARC-Challenge上准确率提升高达61%。

Comments Accepted at the ICLR 2026 Workshop on LLM Reasoning. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22613 2026-08-25 cs.AR 新提交 88%

NOVA: Technology-Architecture Co-Design of Near-Memory Processing for Attention-SSM-MoE Hybrid LLM Inference

NOVA:面向注意力-状态空间模型-混合专家混合大语言模型推理的近内存处理技术-架构协同设计

In-Jun Jung, Jaeha Min, Joo-Young Kim

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 NOVA是面向注意力-SSM-MoE混合LLM推理的近内存处理技术-架构协同设计方案,通过4F² VCT DRAM与两层NMP架构,在低面积开销下实现远超GPU的推理性能与能效。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13499 2026-08-14 cs.DC 新提交 88%

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving

OpScale:面向大语言模型服务的算子级资源配置与自动扩缩容

Xingqi Cui, Chieh-Jan Mike Liang, Ziang Tang, Jiarong Xing, Haoran Qiu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中粗粒度扩缩容的弊端,提出算子级编排框架OpScale,可在满足SLO的同时降低GPU用量、功耗,或在固定成本下提升吞吐量。

Comments 22 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 88%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 88%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 88%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26574 2026-08-28 cs.CL 新提交 88%

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

面向高效扩散大语言模型推理的依赖感知可撤销解码

Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔大学) Sungkyunkwan University(成均馆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 88%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 88%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16336 2026-08-18 cs.AR cs.DC cs.LG 新提交 88%

Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

超越二元优先级:面向大语言模型服务的多层级SLA调度

Anders Vestrum, Arya Raeesi, Hanna Roed

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究扩展Llumnix的优先级模型支持任意层级,在Vidur模拟器中对比多基线,发现四层优先级调度成本效益最优,10层时仍能维持收益且无尾部延迟崩溃。

Comments 13 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 88%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 88%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29082 2026-08-03 cs.CL 新提交 88%

Can Zero-Shot LLMs Predict Child Malnutrition? A Fairness and Temporal Robustness Study

零样本大型语言模型能否预测儿童营养不良?一项关于公平性与时序鲁棒性的研究

Muhammad Ashad Kabir, Md Ahshanul Haque

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯斯特大学计算、数学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究评估零样本LLM预测儿童营养不良的可行性,发现GPT-4o-mini零样本预测儿童发育迟缓性能接近随机森林基线,灵敏度更高、性别公平性好、时序稳定,但居住地和家庭财富维度存在公平性差异,需进一步研究。

Comments Accepted to AIME 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24801 2026-07-29 cs.IR cs.CL 新提交 88%

Influence of Prompt Engineering on Small Language Models for Guarded Query Routing

提示工程对用于安全查询路由的小型语言模型的影响

Richard Šléher, William Brach, Kristián Košťál, Lukas Galke Poech

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 研究安全查询路由问题,探究紧凑型开放权重小型语言模型在延迟约束下处理任务的能力。通过实验评估发现中等规模模型在低延迟下接近前沿,提示优化技术可提升模型表现,是安全查询路由的有用第一步,部分弱模型仍需其他调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25647 2026-07-29 cs.SE cs.AI cs.MA quant-ph 新提交 88%

KQFuzz: Knowledge-Guided Fuzzing for Quantum Libraries via Large Language Models

KQFuzz:通过大语言模型对量子库进行知识引导的模糊测试

Fuyuan Xia, Qixin Zhang, Chenhao Ying, Haojin Zhu, Shuai Wang, Yuan Luo, Pingchuan Ma, Yuxuan Du

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 针对量子库模糊测试灵活性和效率不足问题,提出KQFuzz,利用代码库知识结合适应度引导评估与两级变异,实现高质量测试生成。在三个量子库上测试效果显著优于其他方法,发现多个错误,推动量子计算领域发展。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering. 17 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23445 2026-07-28 cs.CV cs.CL 新提交 88%

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝

Yiming Zhong, Chang Nie, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。

Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏