arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2073 篇

2608.06135 2026-08-07 cs.LG 新提交 89%

LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm

突发工作负载分布下的大语言模型推理:对WAIT算法的改进

Anjali Gangadhar Katageria, Shobha Rani, Raghu Nandan Sengupta

机构 * Indian Institute of Technology Dharwad(印度达尔瓦德印度理工学院) Indian Institute of Technology Kanpur(印度坎普尔印度理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLM推理中突发工作负载的问题,改进了WAIT算法,通过在线估计请求强度提升了低到达率变化场景下的吞吐量,且延迟与现有基准相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28966 2026-08-03 cs.CL 新提交 89%

BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

BLADE:用于高效大语言模型推理的边界扩展与层自适应动态出口

Keshu Fu, Keqin Peng, Jun Bai, Shuhan Qin, Chen Li, Junzhu Liang, Yefei Chen, Jiaqi Li, Yuanxin Ouyang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BLADE是一种轻量级框架,通过构建多粒度检查点、学习紧凑探测层子集等,在保持接近基线准确率的同时,减少大语言模型的推理计算与生成令牌量,提升了LLM推理效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27457 2026-06-29 cs.PF cs.CL 新提交 89%

Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

聚类、路由、升级:成本感知的LLM服务级联框架

Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie, Alexandros Agapitos, Aleksandar Milenovic, Hongmeng Song, Yucheng Shi, Yue Pan, Patricia Buffini, John D. Kelleher

机构 * ADAPT Centre, Trinity College Dublin(ADAPT中心,都柏林信任学院) Huawei Research(华为研究)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出两阶段级联框架,通过聚类分配查询到最经济的模型,并利用质量估计升级低质量输出,在保持97-99%准确率的同时降低每输出token时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 89%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 89%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08129 2026-06-09 cs.AI 新提交 89%

Cross-LLM Consistency in Inference: Evidence from Shared Interactions

推理中的跨LLM一致性:来自共享交互的证据

Siyu Lou, Yao Yan, Yuntian Chen, Quanshi Zhang

机构 * School of Computer Science Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ningbo Key Laboratory of Advanced Manufacturing Simulation Eastern Institute of Technology, Ningbo(宁波市先进制造仿真重点实验室,宁波东方理工大学) College of Computer and Information Science Chongqing Normal University(重庆师范大学计算机与信息科学学院) SymtrustAI.com Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,不同大型语言模型在相同提示下预测相同目标词时,常共享交互模式,且高级模型一致性更强,共享交互通常阶数更低、正负抵消更弱。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14644 2026-08-18 cs.LG cs.CL 新提交 88%

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

DUET:基于同权重分歧的双教师在线策略蒸馏用于禁止合规性

Zihan Li, Feifei Li, Wenhui Que

专题命中 效率与部署 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对LLM部署中的动态禁止规则合规问题,提出DUET双教师在线策略蒸馏方法,构建工业基准,在Qwen模型上实现高合规性与效用保留,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14604 2026-08-18 cs.CL cs.AI 新提交 88%

Wiola 13M, a Gated Spiral Attention Architecture for Parameter Efficient Small Language Models

Wiola 13M:一种用于参数高效小型语言模型的门控螺旋注意力架构

Aryuemaan Kumar Chowdhury, Praveen Oosa, Vineesha Reddy

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对10M-100M参数小型语言模型未适配小规模Transformer的问题,提出含三个创新组件的Wiola 13M模型,验证其等价性并发布开源实现,提升长程区分与梯度流性能。

Comments 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22757 2026-07-28 cs.LG cs.AI 新提交 88%

Hierarchical Grading in Large Language Models

大语言模型中的分层分级

T. Shaska

机构 * Oakland University(奥克兰大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究提出分级大语言模型(GLLMs)框架,通过代数方法为变换器表示空间分级并传播加权标量作用,扩展相关理论到自回归语言模型。证明分层目标下分级与无分级的极小极大分离,最优分级可离线估计,训练后编译成标准变换器,兼具多种优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08991 2026-07-13 cs.LG cs.CL 新提交 88%

Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

大语言模型中用于激活稀疏化的灵敏度感知阈值处理和令牌路由

Bishmoy Paul, Youngmin Yi, Hoeseok Yang

机构 * Santa Clara University(圣塔克拉拉大学) Sogang University(西江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中如何在保留模型质量时减少计算,提出灵敏度感知阈值处理方法SATS及轻量级令牌路由框架,经实验评估,SATS在匹配稀疏度时优于基线,令牌路由有更好的质量-吞吐量权衡,改进方法可提升大语言模型权衡效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08027 2026-07-10 cs.CL cs.AI 新提交 88%

Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

通过幂变换和符号保留分数聚合与自适应特征保留对大语言模型进行结构化剪枝

Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

机构 * Chubu University(楚ubu大学) Panasonic Holdings Corporation(松下电器控股公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型结构化剪枝,改进自适应特征保留技术。结合幂变换、符号保留分数聚合及异常值去除方法,解决应用中出现的分布不匹配等问题。实验表明该方法能保持准确率,通过结构化剪枝加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07626 2026-07-09 cs.CL cs.AI 新提交 88%

Future Confidence Distillation in Large Language Models

大语言模型中的未来置信度蒸馏

Sahil Kale

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型置信度估计,通过比较解决问题前后的置信度,发现其在回答过程中演变。基于此引入未来置信度蒸馏,用解决问题后的置信度估计训练解决问题前隐藏表征的预测器,实现可靠且低成本的置信度估计。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 88%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22496 2026-06-23 cs.PF cs.AI cs.LG 新提交 88%

Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

通过物联网数据预处理实现边缘AI的云端级精度

Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Leino, Johanna Virkki

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22249 2026-06-23 cs.LG cs.AI 新提交 88%

On the Expressive Power of Weight Quantization in Large Language Models

大语言模型中权重量化的表达能力

Shao-Qun Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Intelligent Science and Technology(智能科学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析,证明1.58比特是权重量化的极限精度,并揭示量化比特数减少会导致表达能力多项式级退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19768 2026-07-23 cs.LG cs.AR 新提交 88%

AlphaRoute: Large Language Models as Semantic Optimizers for Multi-Objective Routing

AlphaRoute:将大语言模型用作多目标路由的语义优化器

Kabir Murjani, Mishri Bhavsar, Manish I. Patel, Jonti Talukdar

机构 * Institute of Technology, Nirma University(尼玛大学理工学院) Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)

AI总结 针对VLSI全局路由这一NP难组合优化问题,传统方法失效。AlphaRoute将拆线重布重构为动态优化系统,引入基于SHAP的溢出分解等技术,用大语言模型作语义策略优化器,在基准测试中大幅减少溢出,证明优越算法可克服Python实现的延迟。

Comments 7 pages, 5 figures. Accepted for publication in the IEEE International Conference on LLM-Aided Design, 2026, Stanford University, Stanford, CA, USA. Code available at https://github.com/Kcbir/AlphaRoute

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19350 2026-06-19 cs.CL 新提交 88%

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

基于因果归因的剪枝保留大型语言模型的推理性能

Amogh Sheth, Biruk Assefa, Yi Wen Huang, Andrew Lin, Yuhao Ge

机构 * Edison Academy Magnet School(爱迪生学院磁石学校) Massachusetts Institute of Technology(麻省理工学院) State University of New York College at Plattsburgh(纽约州立大学普拉茨堡学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 提出无需训练的因果归因剪枝(CAP)方法,通过测量注意力头对推理任务的因果影响进行细粒度剪枝,在20%稀疏度下相比Wanda在ARC-Challenge上准确率提升高达61%。

Comments Accepted at the ICLR 2026 Workshop on LLM Reasoning. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24637 2026-08-26 cs.AR 新提交 88%

Thermal Tuning Overhead in Wafer-Scale Optical Interconnects for LLM MoE Training: A Cross-Layer Analysis and Ferroelectric-Based Mitigation

面向大语言模型混合专家(MoE)训练的晶圆级光互连中的热调谐开销:跨层分析与基于铁电材料的缓解方案

Seongwon Yoon, Pin-Jun Chen, Shimeng Yu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对LLM MoE训练的晶圆级光互连,通过跨层分析发现热波动会引发调谐停滞,采用铁电电光调谐机制消除停滞,使三款MoE模型获2.7-3.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22613 2026-08-25 cs.AR 新提交 88%

NOVA: Technology-Architecture Co-Design of Near-Memory Processing for Attention-SSM-MoE Hybrid LLM Inference

NOVA:面向注意力-状态空间模型-混合专家混合大语言模型推理的近内存处理技术-架构协同设计

In-Jun Jung, Jaeha Min, Joo-Young Kim

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 NOVA是面向注意力-SSM-MoE混合LLM推理的近内存处理技术-架构协同设计方案,通过4F² VCT DRAM与两层NMP架构,在低面积开销下实现远超GPU的推理性能与能效。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13499 2026-08-14 cs.DC 新提交 88%

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving

OpScale:面向大语言模型服务的算子级资源配置与自动扩缩容

Xingqi Cui, Chieh-Jan Mike Liang, Ziang Tang, Jiarong Xing, Haoran Qiu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中粗粒度扩缩容的弊端,提出算子级编排框架OpScale,可在满足SLO的同时降低GPU用量、功耗,或在固定成本下提升吞吐量。

Comments 22 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 88%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 88%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 88%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 88%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 88%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16336 2026-08-18 cs.AR cs.DC cs.LG 新提交 88%

Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

超越二元优先级:面向大语言模型服务的多层级SLA调度

Anders Vestrum, Arya Raeesi, Hanna Roed

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究扩展Llumnix的优先级模型支持任意层级,在Vidur模拟器中对比多基线,发现四层优先级调度成本效益最优,10层时仍能维持收益且无尾部延迟崩溃。

Comments 13 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 88%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 88%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29082 2026-08-03 cs.CL 新提交 88%

Can Zero-Shot LLMs Predict Child Malnutrition? A Fairness and Temporal Robustness Study

零样本大型语言模型能否预测儿童营养不良?一项关于公平性与时序鲁棒性的研究

Muhammad Ashad Kabir, Md Ahshanul Haque

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯斯特大学计算、数学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究评估零样本LLM预测儿童营养不良的可行性,发现GPT-4o-mini零样本预测儿童发育迟缓性能接近随机森林基线,灵敏度更高、性别公平性好、时序稳定,但居住地和家庭财富维度存在公平性差异,需进一步研究。

Comments Accepted to AIME 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏