arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22456 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22456 篇

2608.15614 2026-08-18 cs.CV cs.AI 新提交 83%

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01785 2026-08-17 cs.CL cs.SE 版本更新 83%

Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding

CodeOCR: 关于视觉语言模型在代码理解中的有效性

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, Xiaodong Gu

机构 * Shanghai Jiao Tong University China Hohai University China Singapore Management University Singapore Imperial College London United Kingdom East China Normal University \& Shanghai Innovation Institute China Chongqing University China Shanghai Jiao Tong University Hohai University Singapore Management University Imperial College London East China Normal University \& Shanghai Innovation Institute Chongqing University

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。

Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 83%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 83%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08528 2026-08-11 cs.LG 新提交 83%

Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing

面向企业大语言模型代码助手的任务到模型优化:一种成本最优路由的数据驱动框架

Srinivasan Manoharan, Junhua Zhao, Fangbo Tu, Haifeng Wu, Jian Wan, Maliah Rajan M, Ashwin Hegde, Mithun Sasidharan, Kalyan Chakravarthi Podamekala

机构 * PayPal(贝宝(PayPal))

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究针对企业LLM代码助手的推理成本问题,提出T2MO数据驱动框架,通过任务分级与两级路由机制实现成本最优,可降低端到端成本并支持从静态策略到智能路由器的过渡。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03610 2026-08-11 cs.CL cs.SD eess.AS 版本更新 83%

Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

面向多语言大语言模型的ASR的语言专业化多教师在线策略蒸馏

Yuan Xie, Jiaqi Song, Xianliang Wang, Ming Lei, Jie Gao, Jie Wu

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 针对多语言ASR的跨语言优化冲突问题,提出LS-MOPD方法,通过语言专业化教师与多语言学生的在线策略蒸馏,在多语言基准测试中实现了优于RL基线及最优教师的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30716 2026-08-11 cs.CV cs.AI 版本更新 83%

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

用于病例级病理学概要报告生成的简单令牌高效视觉语言模型

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, Canada(计算机科学与软件工程系(CSSE),康科迪亚大学,蒙特利尔,加拿大) Axe Cancer, Centre de recherche du CHUM, Université de Montréal, Montreal, Canada(Axe癌症,CHUM研究中心,蒙特利尔大学,蒙特利尔,加拿大) Institut de recherche en immunologie et cancérologie (IRIC), Université de Montréal(免疫学与癌症研究所(IRIC),蒙特利尔大学) Mila - Quebec AI Institute, Montreal, Canada(魁北克AI研究所(Mila),蒙特利尔,加拿大)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出一种简单令牌高效的视觉语言模型,通过5倍放大率的512×512补丁和两阶段监督训练,在有限GPU内存下实现病例级多WSI病理报告生成,显著降低序列长度并提升效率。

Comments DeLTA 2026 Conference Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06763 2026-08-10 cs.LG cs.DC 新提交 83%

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

CubicQuant:用于1-8比特权重的高吞吐量大语言模型推理的参数化非均匀码本

Xuetian Gao

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 研究针对LLM推理的权重量化问题,提出CubicQuant参数化非均匀标量格式,其在不同分布下的重构误差优于现有方案,且具备高效GPU执行潜力。

Comments 23 pages, 1 figure. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交 83%

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03311 2026-08-05 cs.SE cs.AI 新提交 83%

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

评估用于企业自动化的大语言模型权衡:来自生产级企业平台中工作流生成的经验教训

Xavier Wrenn, Radoslav Raykov, Aleksandar Angelov, Hirokuni Kitahara, Yuji Watanabe, Anca Sailer

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过在生产级企业平台评估6种大语言模型的工作流生成能力,发现分段式流水线可提升结构成功率,使小型模型达生产可行性,为云工程提供模型无关的自动化方案。

Comments 10 pages, 3 figures, 5 tables. Accepted at the 14th IEEE International Conference on Cloud Engineering (IC2E 2026), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01718 2026-08-04 cs.AI 新提交 83%

LaCache: Robust Semantic Caching for LLM Serving

LaCache:面向大语言模型服务的鲁棒语义缓存

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 LaCache是一种新型语义缓存方案,通过检查查询及其前k个解码标记的缓存命中,可抵御缓存碰撞攻击,提升响应相关性,经多种大语言模型及基准验证了其安全性与效率优势。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08404 2026-08-04 cs.CL 版本更新 83%

TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration

TEAM: 时空一致性引导的专家激活用于MoE扩散语言模型加速

Linye Wei, Zixiang Luo, Pingzhi Tang, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits(集成电路学院) Yuanpei College(元培学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 针对MoE扩散语言模型中专家激活过多导致推理开销大的问题,提出TEAM框架,利用路由决策的时空一致性,通过保守激活和激进推测解码实现加速,最高提速2.2倍且性能损失极小。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23125 2026-08-03 cs.LG 版本更新 83%

Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

基于有噪学生策略性自蒸馏的自增强视觉语言模型

Shuai Wang, Daoan Zhang, Zhe Tang, Hao Cheng, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Inc.(字节跳动公司) Zhejiang University of Technology(浙江工业大学) Hong Kong Baptist University(香港浸会大学)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型无外部监督难以改进的问题,提出NOPD自蒸馏方法,利用干净与损坏输入预测差异产生自监督信号,在多视觉推理任务中有效,能提升多个模型在多个基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12055 2026-07-31 cs.CV cs.LG 版本更新 83%

Continual Learning with Vision-Language Models via Semantic-Geometry Preservation

通过语义-几何保持实现视觉-语言模型的持续学习

Chiyuan He, Zihuan Qiu, Fanman Meng, Runtong Zhang, Linfeng Xu, Qingbo Wu, Hongliang Li

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。

Comments Accepted by IEEE TCSVT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05950 2026-07-31 cs.CV cs.AI 版本更新 83%

Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models

基于能量驱动的自适应视觉令牌修剪以提高视觉语言模型的效率

Jialuo He, Huangxun Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 E-AdaPrune通过能量驱动的自适应修剪方法,提高视觉语言模型的效率,实现令牌预算的动态分配,减少冗余并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02184 2026-07-30 cs.DL cs.LG 版本更新 83%

The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

幽灵搭档:相关的大语言模型姓名先验及其对网络和学术出版的困扰

Michał Brzozowski, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现大语言模型生成虚构专家姓名时会产生相关性强的角色组合,这些组合具有模型家族特异性,并在Zenodo等平台造成大量幽灵作者记录,影响学术出版。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02092 2026-07-30 cs.CR cs.AI 版本更新 83%

FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing

FPEdit:通过局部参数编辑实现鲁棒的大语言模型指纹技术

Shida Wang, Chaohu Liu, Yubo Wang, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FPEdit通过局部参数编辑注入语义连贯自然语言指纹,解决现有指纹技术的局限,实现高指纹保留率、抗检测性与模型效用保留,大幅降低资源需求,用于大语言模型来源验证。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25157 2026-07-29 cs.AI 新提交 83%

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Stevens Institute of Technology(史蒂文斯理工学院) University of Notre Dame(圣母大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24392 2026-07-28 cs.CR cs.LG 新提交 83%

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡

Tong Zhang, Zexin Li, Simin Chen, Yun Peng

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20469 2026-07-24 cs.AI 新提交 83%

DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions

DecodeShare:追踪大语言模型解码时刻决策的共享子空间

Zishan Shao, Lixun Zhang, Kangning Cui, Yixiao Wang, Ting Jiang, Hancheng Ye, Qinsi Wang, Zhixu Du, Yuzhe Fu, Fan Yang, Danyang Zhuo, Yiran Chen, Hai Helen Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型解码时任务通用结构,提出DecodeShare协议识别共享子空间并测试其因果作用,实验显示干扰该子空间对决策性能影响大,且其对激活引导有实际意义,能分离组件功能、提供可靠信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16292 2026-07-21 cs.CR cs.LG 83%

In-Context Probing for Membership Inference in Fine-Tuned Language Models

上下文探查用于微调语言模型中的成员推断

Zhexi Lu, Hongliang Chi, Nathalie Baracaldo, Swanand Ravindra Kadhe, Yuseok Jeon, Lei Yu

机构 * Korea University, Seoul, South Korea(韩国大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出ICP-MIA框架,通过上下文探查技术有效检测微调语言模型中的成员身份,提升隐私保护能力。

Journal ref Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18974 2026-07-17 cs.NI cs.CL 83%

Intent2QoS: Language Model-Driven Automation of Traffic Shaping Configurations

Intent2QoS: 基于语言模型的流量整形配置自动化

Sudipta Acharya, Burak Kantarci

机构 * University of Ottawa(渥太华大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出Intent2QoS框架,通过语言模型将业务意图转化为可部署的Linux流量控制配置,显著提升流量整形效率与准确性。

Comments 6 page, 4 figures, Accepted to IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 83%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 效率与部署 :LLM(title,abstract);SFT(abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08930 2026-07-13 cs.LG 新提交 83%

BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving

BlockServe:用于高吞吐量扩散语言模型服务的块粒度连续批处理

Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Shanghao Li, Zihe Song, Philip S. Yu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对扩散大语言模型服务的收敛异质性问题,提出BlockServe框架,集成块粒度调度、混合状态执行及计算感知准入控制器,在五个基准测试中实现高吞吐量,确立块粒度调度为高吞吐量离线dLLM推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 83%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04985 2026-07-09 cs.LG 版本更新 83%

FPTQuant: Function-Preserving Transforms for LLM Quantization

FPTQuant:用于大语言模型量化的函数保持变换

Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02521 2026-07-07 cs.DC cs.LG cs.PL 新提交 83%

Tile-Level Activation Overlap for Efficient LLM Inference

用于高效大语言模型推理的瓦片级激活重叠

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对现代大语言模型中SwiGLU中间张量物化成本高的问题,提出基于CUTLASS的SM90内核,通过瓦片级融合SwiGLU与GeMM,提升推理速度,验证手工设计的必要性且数值表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08791 2026-07-07 cs.DC cs.AI 版本更新 83%

Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

Prima.cpp:在异构和低资源家用集群上进行快速30 - 70B语言模型推理

Zonghang Li, Tao Li, Wenjiao Feng, Rongxing Xiao, Jianshu She, Hong Huang, Mohsen Guizani, Hongfang Yu, Qirong Ho, Wei Xiang, Xue Liu

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术研究所) UESTC(电子科技大学) City University of Hong Kong(香港城市大学) La Trobe University(拉筹伯大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在消费者家用集群上运行30 - 70B语言模型的挑战,提出分布式推理系统Prima.cpp,引入流水线环并行等方法,实现低内存压力下快速推理,相比其他方案有优势。

Comments 38 pages, 21 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 83%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏