arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2407.18003 2024-11-21 cs.CL 86%

Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption

Luohe Shi, Hongyi Zhang, Yao Yao, Zuchao Li, Hai Zhao

专题命中 效率与部署 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL

Comments Published on the First Conference on Language Modeling (COLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00889 2024-11-05 cs.LG cs.SY eess.SY 86%

MESS+: Energy-Optimal Inferencing in Language Model Zoos with Service Level Guarantees

Ryan Zhang, Herbert Woisetschläger, Shiqiang Wang, Hans Arno Jacobsen

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments Accepted at the 2024 Workshop on Adaptive Foundation Models in conjunction with NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07044 2023-12-13 eess.SY cs.LG cs.SY 86%

Large Foundation Models for Power Systems

Chenghao Huang, Siyang Li, Ruohong Liu, Hao Wang, Yize Chen

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Code available at https://github.com/chennnnnyize/LLM_PowerSystems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 86%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16026 2026-08-18 cs.CR 新提交 86%

SkillWatermark: An Embedded Skill Watermark of Progressive Privacy Inference via Benign Prompts

SkillWatermark:通过良性提示实现渐进式隐私推理的嵌入式技能水印

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出SkillWatermark,通过良性提示插入技能水印在LLM智能体多轮对话流量中编码私密信息,经实验验证水印效果良好且能通过安全审计,揭示了流量模式可被利用的新型攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15738 2026-08-18 cs.CY 新提交 86%

An AI-Based Adaptive Learning Platform for Multilingual and Low-Resource Educational Contexts: A Case Study on Nigeria

面向多语言与低资源教育场景的基于AI的自适应学习平台:以尼日利亚为例

Everistus Ugochukwu Nwogo, Isibor Kennedy Ihianle, Pedro Machado, Jordan J. Bird, Ahmad Lotfi, Ahmad Abdulnasir Shuaib, Isaac Ibukun Akinwumi, Jonathan Oluranti

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源多语言教育场景,构建了整合微调LLM的PAL自适应学习平台,经多级量化优化与多维度评估,实现了语义鲁棒性、文化相关性与计算效率的平衡,为低资源语言教育AI系统提供了可部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15181 2026-08-18 cs.MA 新提交 86%

Insurance as AI Risk Infrastructure: A Generative-Agent Simulation of AI Adoption

作为AI风险基础设施的保险:AI采纳的生成智能体模拟

Yixuan Yuan, Dedai Wei, Chudong Qian, Jielin Feng, Ziyue Lin, Yuheng Zhao, He Cao, Erasmo Purificato, Xinwu Ye

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出将保险作为AI风险基础设施,开发LLM驱动的基于智能体的社会模拟系统,验证其可降低企业财务风险,加速AI工具采纳并提升企业偿付能力与总体资本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-08-18 cs.CV cs.RO 版本更新 86%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19310 2026-08-18 eess.SY cs.SY 版本更新 86%

Can Carbon-Aware Data Center Workload Allocation Reduce Power System Emissions? The Role of Contract Reshuffling

具有超大规模计算中心和模块化数据中心的电力市场模型

Yihsu Chen, Abel Souza, Fargol Nematkhah, Andrew L. Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种电力市场模型,允许超大规模计算中心将LLM推理任务迁移到地理分布的模块化数据中心,以优化能源利用和减少排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11249 2026-08-13 cs.CL cs.AI cs.IT cs.LG math.IT 新提交 86%

Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

扩散到压缩:利用扩散语言模型进行无损压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对无损文本压缩的吞吐量瓶颈,首次引入扩散语言模型(DLM)替代自回归LLM,设计策略解决算法挑战,在enwik8数据集上推进了无损文本压缩的现有技术水平。

Comments 18 pages, 11 figures, 2 tables. Main paper: 9 pages (7 pages text + 2 pages references). Includes 9 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08932 2026-08-12 cs.AR 版本更新 86%

From Indiscriminate to Targeted: Functionally Critical Signal-Driven Assertion Generation using LLMs for Efficient RTL Verification

从盲目到定向:通过功能关键信号驱动的LLM断言生成实现高效的RTL验证

Yonghao Wang, Hongqin Lyu, Boling Chen, Jiaxin Zhou, MinYang Bao, Wenchao Ding, Feng Gu, Zhiteng Chao, Jianan Mu, Kan Shi, Tiancheng Wang, Huawei Li

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 本文提出AgileAssert框架,通过构建RTL语义图并识别关键信号,指导LLM生成定向断言,提升验证效率,减少断言数量并提高覆盖率。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07215 2026-08-12 cs.SE cs.PL 版本更新 86%

The CodeInverter Suite: Structure- and Data-Aware Binary Decompilation with Efficient LLMs

CodeInverter工具套件:基于结构与数据感知及高效大语言模型的二进制反编译技术

Peipei Liu, Jian Sun, Rongkang Sun, Li Chen, Zhaoteng Yan, Xiaoling Zhang, Dawei Wang, Dapeng Sun, Peizheng Zhang, Dan Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有LLM反编译方法在结构重构、数据恢复等方面的不足,本文提出含CIW、CID、CIMs的CodeInverter套件,经实验验证可显著提升反编译性能,CIM-6.7B达最优效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08097 2026-08-11 cs.DC 新提交 86%

OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching

OasisKV:通过前瞻稀疏预取将解码中KV缓存扩展至HBM之外

Can Xiao, Sukmin Cho, Junbong We, Zhixiong Niu, Jianyi Cheng, Yiren Zhao, Youngjin Kwon, Yongqiang Xiong, Rui Ma, Junyi Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM推理中HBM容量受限问题,提出以内存为中心的OasisKV系统,通过前瞻稀疏预取技术解耦KV缓存存储与HBM,在精度损失极小的情况下显著提升推理吞吐量并降低内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12756 2026-08-10 cs.CV 版本更新 86%

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

专题命中 效率与部署 :language model(title,abstract);large language model(title)

AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13105 2026-08-07 cs.AR 版本更新 86%

Knowledge-Driven Hybrid SSD Management Enhanced by Fine-Tuned LLMs

微调大语言模型(LLMs)增强的知识驱动混合固态硬盘(SSD)管理

Qian Wei, Yi Li, Zehao Chen, Tianren Zhou, Zhaoyan Shen, Dongxiao Yu, Bingzhe Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出LLM-hybridSSD框架,将混合SSD管理转化为参数调优问题,结合LLM与强化学习优化,使吞吐量平均提升58.92%、写放大降低28.56%。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 86%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 效率与部署 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04169 2026-08-06 cs.AR cs.ET 新提交 86%

On Design Principles for Efficient Heterogeneous DRAM-PIM-GPU Systems

高效异构DRAM-PIM-GPU系统的设计原则

Corey Lammie, Hadjer Benmeziane, William Andrew Simon, Irem Boybat

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对异构DRAM-PIM-GPU系统,通过系统评估OPT、Mamba2系列模型,揭示了三项设计原则,为内存加速LLM系统架构设计提供了指导。

Comments Accepted at 2026 IEEE International System-on-Chip Conference (SOCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23200 2026-08-06 cs.CE 版本更新 86%

Large Language Models, Encoder Architectures and Hybrid Approaches for Patent Classification

大型语言模型在专利分类中的应用:优势、权衡与长尾效应

Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 本文比较了基于编码器和LLMs在专利分类中的表现,发现编码器在常见类别表现更好,而LLMs在罕见类别表现更优,两者互补,且编码器更高效。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03033 2026-08-05 cs.AR eess.SP 新提交 86%

Interpolation of Non-Linear Functions for LLMs using Partial Reconfiguration in FPGAs

基于FPGA部分重配置的LLM非线性函数插值

Roger Morales-Monge, Nazareth Jimenez-Chacon, Jose Gabriel Villalobos-Alvarado, Luis G. Leon-Vega, Jorge Castro-Godinez

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 该研究针对FPGA上LLM非线性函数实现成本高的问题,提出基于部分重配置的PWL插值框架,通过动态加载模块实现面积节省,验证了分段策略的权衡效果。

Comments Submitted to ICECS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-04 cs.CR 版本更新 86%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27697 2026-07-31 cs.HC 新提交 86%

DP-LENS: A Density-Aware Polyfocal Lens with Topology-Driven Auto-Routing for Occlusion Management in Immersive 3D Analytics

DP-LENS:一种用于沉浸式3D分析中遮挡管理的密度感知多焦点透镜,带有拓扑驱动自动路由功能

Nieyu Cao, Xian Wang, Lik-Hang Lee

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对沉浸式3D分析中数据遮挡导致的高认知负荷问题,提出带拓扑驱动自动路由的DP-LENS系统,结合LLM语音交互,经用户验证可降低负荷、提升效率,为相关系统设计提供启示。

Comments Accepted to IEEE International Symposium on Mixed and Augmented Reality (ISMAR) 2026, to appear in IEEE Transactions on Visualization and Computer Graphics (TVCG). 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交 86%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18244 2026-07-22 cs.NI cs.IT math.IT 新提交 86%

Accelerating Heterogeneous Agent Collaboration in Dynamic Edge Networks

加速动态边缘网络中的异构智能体协作

Tianji He, Yulin Shao, Fen Hou

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究在动态边缘网络中加速异构智能体协作的问题,提出PRADA框架,通过将PRM作为离线教师,结合轻量级策略和拉格朗日调度器解决资源竞争,大幅降低延迟并保留LLM准确性,还揭示阈值效应,为资源配置提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05782 2026-07-20 cs.SE 版本更新 86%

When Models Meet Users: An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face

对Hugging Face上通用大语言模型和多模态大语言模型感知的实证研究

Yujian Liu, Xiao Yu, Jacky Keung, Xing Hu, Xin Xia, Xiaoxue Ma

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析Hugging Face上662条讨论帖,揭示用户对LLM的主要关注点,包括访问障碍、生成质量及部署复杂性,并提出改进LLM生态系统的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08993 2026-07-13 cs.AR 新提交 86%

StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration

StreamDQ:用于可扩展人工智能推理加速的定制HBM中的近内存权重反量化

Minki Jeong, Daegun Yoon, Soohong Ahn, Seungyong Lee, Nameun Kang, Hyeonseok Ju, Ieryung Park, Joonseop Sim, Youngpyo Joo, Hoshik Kim

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型内存和计算需求增长,提出StreamDQ架构,将反量化块集成到HBM基础芯片,通过内存端反量化减少GPU开销,实现高吞吐量推理,在混合精度GEMM和端到端LLM推理中均有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09159 2026-07-08 cs.IR 版本更新 86%

LLMs Meet Isolation Kernel: Lightweight, Learning-free Binary Embeddings for Fast Retrieval

LLMs 与隔离内核:轻量、无学习的二进制嵌入用于快速检索

Zhibo Zhang, Yang Xu, Kai Ming Ting, Cam-Tu Nguyen

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出无学习的隔离内核嵌入(IKE),将LLM嵌入转换为二进制嵌入,实现低内存和快速检索,实验显示其检索速度提升16.7倍,内存使用降低16倍,同时保持相似精度。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26150 2026-07-01 cs.DC cs.AR cs.ET 新提交 86%

Hot AI in Cold Space: Thermal-Crosstalk-Aware Scheduling for Sustainable Orbital AI Clusters

寒冷太空中的热AI:面向可持续轨道AI集群的热串扰感知调度

Shuyi Chen, Zhengchang Hua, Nikos Tziritas, Georgios Theodoropoulos

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对轨道数据中心高密度集群中的热串扰问题,提出热感知异构性论点,并设计热负载均衡(TLB)框架,通过动态迁移LLM工作负载至最冷单元,缓解热瓶颈并延长硬件寿命。

Comments Accepted at HotCarbon'26, camera ready version. Code: https://github.com/Sukiiichan/sdc-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13692 2026-07-01 cs.OS cs.MA 版本更新 86%

ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System

ThunderAgent: 一个简单、快速且程序感知的智能推理系统

Hao Kang, Ziyang Li, Weili Xu, Xinyu Yang, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出ThunderAgent系统,通过LLM程序抽象统一管理KV缓存和工具资源,实现程序感知调度,在编码、路由和科学发现任务中吞吐量提升1.5-3.9倍,磁盘内存节省高达4.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24083 2026-06-24 cs.CL cs.AI cs.LG 新提交 86%

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

机构 * Independent(独立研究者) Adobe Research(Adobe研究院)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道评估协议CAVEWOMAN,发现输出压缩降低API模型成本(1.4-2.4倍),输入压缩反而增加成本(~1.15倍)并导致准确率下降和文本偏离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17358 2026-06-24 cs.CR 新提交 86%

OTRO: Oblivious Tokenization Path with Square-Root ORAM

OTRO: 具有平方根ORAM的遗忘标记化路径

Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM机密计算中标记器访问模式泄露问题,提出OTRO,利用平方根ORAM实现高效遗忘查找,通过实例池、轮换填充和分块KV缓存感知标记化降低开销,在TDX环境中将TTFT开销限制在4.5%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏