arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2505.08585 2026-01-21 cs.CV 50%

A Large-scale Benchmark on Geological Fault Delineation Models: Domain Shift, Training Dynamics, Generalizability, Evaluation and Inferential Behavior

地质断层界定模型的大规模基准测试:领域偏移、训练动态、泛化能力、评估与推断行为

Jorge Quesada, Chen Zhou, Prithwijit Chowdhury, Mohammad Alotaibi, Ahmad Mustafa, Yusufjon Kumakov, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Georgia Institute of Technology(佐治亚理工学院) Information Technology University(信息技术大学) Tashkent State Technical University(塔什克恩技术大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出首个大规模地质断层界定模型基准测试,分析领域偏移、训练动态和泛化能力,揭示模型在不同数据集下的表现差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12486 2026-01-21 cs.HC 50%

A Multimodal Assistive System for Product Localization and Retrieval for People who are Blind or have Low Vision

一种多模态辅助系统,用于帮助盲人或低视力者进行产品定位与检索

Ligao Ruan, Giles Hamilton-Fletcher, Mahya Beheshti, Todd E Hudson, Maurizio Porfiri, John-Ross Rizzo

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种多模态辅助系统,通过目标检测与视觉-语言模型结合,帮助盲人或低视力者自主完成产品定位与检索,提升其自主性和控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12468 2026-01-21 cs.CV 50%

DCAC: Dynamic Class-Aware Cache Creates Stronger Out-of-Distribution Detectors

DCAC: 动态类感知缓存创建更强的分布外检测器

Yanqi Wu, Qichao Chen, Runhe Lai, Xinhua Lu, Jia-Xin Zhuang, Zhilin Zhao, Wei-Shi Zheng, Ruixuan Wang

专题命中 评测与基准 :language model(abstract)

AI总结 DCAC通过动态类感知缓存提升分布外检测性能,减少误报率

Comments 9 pages, 9 figures, Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12346 2026-01-21 cs.CV 50%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 评测与基准 :LLM(abstract)

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 50%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10672 2026-01-21 cs.RO cs.CV 50%

Vision Language Action Models in Robotic Manipulation: A Systematic Review

视觉语言动作模型在机器人操作中的应用:系统综述

Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud, Jan Rosell, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。

Comments submitted to annual review in control

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11990 2026-01-21 cs.CV 50%

DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset

DAOS: 一种基于驾驶员行为与物体协同的多模态舱内行为监测数据集

Yiming Li, Chen Cai, Tianyi Liu, Dan Lin, Wenqian Wang, Wenfei Liang, Bingbing Li, Kim-Hui Yap

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) College of Computer Science and Technology, Harbin Engineering University(哈尔滨工程大学计算机科学与技术学院) Singapore University of Technology and Design (SUTD), Singapore(新加坡科技设计大学) Continental Automotive Singapore Pte. Ltd.

专题命中 评测与基准 :prompting(abstract)

AI总结 DAOS数据集通过多模态数据和动作-物体关系网络提升驾驶员行为识别的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11769 2026-01-21 cs.CV 50%

From Pixels to Purchase: Building and Evaluating a Taxonomy-Decoupled Visual Search Engine for Home Goods E-commerce

从像素到购买:构建和评估一个去分类的视觉搜索引擎用于家居商品电商

Cheng Lyu, Jingyue Zhang, Ryan Maunu, Mengwei Li, Vinny DeGenova, Yuanli Pei

机构 * Wayfair

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出了一种去分类的视觉搜索引擎,通过无分类区域提案和统一嵌入提升搜索灵活性,并引入LLM-as-a-Judge框架实现零样本评估,从而提高家居电商的检索质量和客户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 50%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 评测与基准 :language model(abstract)

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11525 2026-01-21 cs.HC 50%

PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries

PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库

Yi Zhao, Zhen Yang, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang

专题命中 评测与基准 :language model(abstract)

AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。

Comments 30 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11523 2026-01-21 cs.HC cs.CY 50%

MetaScoreLens: Evaluating User Feedback Across Digital Entertainment Systems

MetaScoreLens: 在数字娱乐系统中评估用户反馈

Christian Ellington, Paramahansa Pramanik, Haley K. Robinson

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究通过比较四个游戏平台的用户评分,发现PC游戏获得最积极反馈,而Nintendo游戏评分最低,揭示平台对玩家评价的影响。

Comments 46 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 80 篇

2601.11579 2026-01-21 cs.CL cs.AI 90%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 效率与部署 :language model(title,abstract);large language model(title);SFT(abstract);preference optimization(abstract)

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13443 2026-01-21 cs.AI 89%

Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models

显式认知分配:一种用于受控和可审计的大语言模型推理的原则

Héctor Manuel Manzanilla-Granados, Zaira Navarrete-Cazales, Miriam Pescador-Rojas, Tonahtiu Ramírez-Romero

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出显式认知分配原则,通过认知通用代理架构实现结构化推理,提升大语言模型在高责任场景下的可追溯性和可审计性。

Comments Preprint. This version corresponds to the initial public release of the CUA architecture and associated evaluation metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14051 2026-01-21 cs.CL cs.AI cs.LG 89%

Kakugo: Distillation of Low-Resource Languages into Small Language Models

Kakugo:通过低资源语言名称训练通用小型语言模型的蒸馏方法

Peter Devine, Mardhiyah Sanni, Farid Adilazuarda, Julieta Gil Loizaga, Barry Haddow

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Kakugo通过仅使用语言名称作为输入,利用大型教师模型生成合成数据,有效训练小型语言模型以处理低资源语言,从而在多种NLP任务中提升性能,成本低于50美元每种语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24624 2026-01-21 cs.CR 89%

PRIVMARK: Private Large Language Models Watermarking with MPC

PRIVMARK: 基于MPC的私有大语言模型水印技术

Thomas Fargues, Ye Dong, Tianwei Zhang, Jin-Song Dong

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PRIVMARK通过MPC技术实现大语言模型的隐私保护水印,无需暴露模型权重,有效抵御攻击并保持性能。

Comments 8 pages, 4 figures, under peer-review

Journal ref ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03160 2026-01-21 cs.SE 89%

Assessing Small Language Models for Code Generation: An Empirical Study with Benchmarks

评估小型语言模型用于代码生成:基于基准的实证研究

Md Mahade Hasan, Muhammad Waseem, Kai-Kristian Kemell, Jussi Rasku, Juha Ala-Rantala, Pekka Abrahamsson

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本研究评估了多种小型语言模型在代码生成中的性能,发现紧凑模型在效率与性能间取得平衡,但进一步提升需转向更大模型。

Comments 17 pages, 10 Tables, 57 figures. Includes benchmarks and multilingual evaluation. Submitted to the Journal of Systems and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG 88%

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 86%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11663 2026-01-21 cs.LG cs.AI 86%

Activation Sensitivity as a Unifying Principle for Post-Training Quantization

激活敏感性作为后训练量化方法的统一原则

Bruce Changlong Xu

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活敏感性作为后训练量化的统一原则,通过理论框架解释AWQ和GPTQ等方法,并揭示其与经典剪枝技术的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15439 2026-01-21 cs.LG cs.SE 85%

Combating Toxic Language: A Review of LLM-Based Strategies for Software Engineering

对抗有毒语言:基于大语言模型的软件工程策略综述

Hao Zhuo, Yicheng Yang, Kewen Peng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了基于大语言模型的软件工程中对抗有毒语言的策略,评估了检测、预处理和缓解方法,并通过实验验证了LLM重写在减少毒性中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11676 2026-01-21 cs.DC cs.AI cs.NI 85%

HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network

HALO:语义感知的分布式LLM推理在失真边缘网络中

Peirong Zheng, Wenchao Xu, Haozhao Wang, Jinyu Chen, Xuemin Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Division of Integrative Systems and Design, The Hong Kong University of Science and Technology(香港理工大学系统与设计学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HALO通过语义感知预测和负载平衡调度,提升失真边缘网络中LLM推理的效率与性能。

Comments Accepted by IEEE International Conference on Computer Communications (INFOCOM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14904 2026-01-21 cs.CL cs.AI 85%

Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training

通过魔法令牌引导的协同训练实现LLM中的高效可切换安全控制

Jianfeng Si, Lin Sun, Zhewen Tan, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(北京奇元科技)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出通过魔法令牌引导的协同训练框架,实现LLM内容安全的高效可切换控制,提升安全性能并降低训练与部署成本。

Comments 15 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11546 2026-01-21 cs.DB 85%

RelServe: Fast LLM Inference Serving on Relational Data

RelServe: 在关系数据上实现快速大语言模型推理服务

Xin Zhang, Shihong Gao, Yanyan Shen, Haoyang Li, Lei Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RelServe通过动态优先级更新和自适应批处理优化,显著提升了关系数据查询的LLM推理效率,降低了延迟。

Comments Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12904 2026-01-21 cs.CL cs.AI 84%

From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation

从前缀缓存到融合RAG缓存:加速检索增强生成中的LLM推理

Jiahao Wang, Weiyu Xie, Mingxing Zhang, Boxing Zhang, Jianwei Dong, Yuening Zhu, Chen Lin, Jinqi Tang, Yaochen Han, Zhiyuan Ai, Xianglin Chen, Yongwei Wu, Congfeng Jiang

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FusionRAG通过优化RAG的预处理和重处理阶段,在保持生成质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12785 2026-01-21 cs.LG cs.AI 84%

Distilling Time Series Foundation Models for Efficient Forecasting

压缩时间序列基础模型以实现高效预测

Yuqi Li, Kuiye Ding, Chuanguang Yang, Szu-Yu Chen, Yingli Tian

机构 * The City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) Stevens Institute of Technology, USA(史蒂文斯理工学院)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 DistilTS是一种专为时间序列基础模型设计的蒸馏框架,通过时间跨度加权目标和时间对齐策略,在减少参数量的同时保持预测性能。

Comments Accepted by ICASSP-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12376 2026-01-21 cs.CL 83%

LR-DWM: Efficient Watermarking for Diffusion Language Models

LR-DWM: 用于扩散语言模型的高效水印技术

Ofek Raban, Ethan Fetaya, Gal Chechik

机构 * Bar-Ilan University(巴伊兰大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 LR-DWM是一种用于扩散语言模型的高效水印技术,通过利用左右邻居信息偏移生成令牌,实现低开销的高可检测性水印方案。

Comments Submitted to ACL Rolling Review (ARR). 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15907 2026-01-21 cs.DC 82%

Decentralized LLM Inference over Edge Networks with Energy Harvesting

基于边缘网络的分布式大语言模型推理与能量收集

Aria Khoshsirat, Giovanni Perin, Michele Rossi

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于能量收集的边缘网络中分布式大语言模型推理方法,利用半马尔可夫模型优化调度算法以提高能效和网络吞吐量。

Journal ref Proceedings of IEEE Global Communications Conference (GLOBECOM), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12272 2026-01-21 cs.CV 82%

AgenticPruner: MAC-Constrained Neural Network Compression via LLM-Driven Strategy Search

AgenticPruner: 通过LLM驱动的策略搜索实现MAC约束的神经网络压缩

Shahrzad Esmat, Mahdi Banisharif, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 AgenticPruner通过LLM驱动策略搜索实现MAC约束的神经网络压缩,通过三个专门代理协调优化,提升收敛成功率并实现精确的MAC预算控制。

Comments 38 pages, 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12988 2026-01-21 cs.LG 81%

PaperGuide: Making Small Language-Model Paper-Reading Agents More Efficient

PaperGuide: 使小型语言模型论文阅读代理更加高效

Zijian Wang, Tiancheng Huang, Hanqi Li, Da Ma, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, SJTU AI Institute, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、人工智能关键实验室、SJTU人工智能研究所、上海交通大学、上海,中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 PaperCompass通过分离高层规划与细粒度执行,提升小型语言模型在论文阅读任务中的效率,实现高效且可靠的训练过程。

Comments 35 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02751 2026-01-21 cs.LG cs.AI 81%

SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference

SmallKV: 小模型辅助补偿KV缓存压缩以实现高效大语言模型推理

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Hai Zhao, Xiaoming Fu

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen(计算机科学研究所,哥廷根大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 SmallKV通过小模型辅助补偿KV缓存压缩,提升大语言模型在资源受限环境下的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏