arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2601.03211 2026-01-07 cs.IR cs.AI cs.CL 91%

Fine-tuning Small Language Models as Efficient Enterprise Search Relevance Labelers

微调小型语言模型作为高效的企业搜索相关性标注器

Yue Kang, Zhuoyi Huang, Benji Schussheim, Diana Licon, Dina Atia, Shixing Cao, Jacob Danovitch, Kunho Kim, Billy Norcilien, Jonah Karpman, Mahmound Sayed, Mike Taylor, Tao Sun, Pavel Metrikov, Vipul Agarwal, Chris Quirk, Ye-Yi Wang, Nick Craswell, Irene Shaffer, Tianwei Chen, Sulaiman Vesal, Soundar Srinivasan

机构 * Microsoft(微软)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过微调小型语言模型实现高效企业搜索相关性标注,利用合成数据生成提升标注质量和吞吐量,比大型模型更高效且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13023 2025-11-18 cs.LG cs.AI 91%

SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment

Jiacheng Wang, Yejun Zeng, Jinyang Guo, Yuqing Ma, Aishan Liu, Xianglong Liu

机构 * SKLCCSE School of Artificial Intelligence(人工智能学院) Beihang University(北航) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12403 2025-11-11 cs.CL cs.AI 91%

FedCoT: Federated Chain-of-Thought Distillation for Large Language Models

Tao Fan, Weijing Chen, Yan Kang, Guoqiang Ma, Hanlin Gu, Yuanfeng Song, Lixin Fan, Qiang Yang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) WeBank Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13890 2025-11-06 cs.CL cs.AI 91%

A Survey on Collaborating Small and Large Language Models for Performance, Cost-effectiveness, Cloud-edge Privacy, and Trustworthiness

Fali Wang, Jihai Chen, Shuhua Yang, Ali Al-Lawati, Linli Tang, Hui Liu, Suhang Wang

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments 24 pages, 19 figures-under review; more detailed than v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03847 2025-10-07 cs.AI cs.LG 91%

Small Language Models for Agentic Systems: A Survey of Architectures, Capabilities, and Deployment Trade offs

Raghav Sharma, Manan Mehta

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07460 2025-05-13 cs.AI cs.CL 91%

A Survey on Collaborative Mechanisms Between Large and Small Language Models

Yi Chen, JiaHao Zhao, HaoHao Han

机构 * Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17890 2025-04-22 cs.IR cs.CL cs.LG 91%

SLMRec: Distilling Large Language Models into Small for Sequential Recommendation

Wujiang Xu, Qitian Wu, Zujie Liang, Jiaojiao Han, Xuying Ning, Yunxiao Shi, Wenfang Lin, Yongfeng Zhang

机构 * Rutgers University(新泽西罗格斯大学) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院Broad研究所) Ant Group(蚂蚁集团) Dian Diagnostics Group Co.(迪安诊断集团) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Technology Sydney(悉尼技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00641 2025-02-12 cs.CL cs.AI 91%

Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance

Borui Xu, Yao Chen, Zeyi Wen, Weiguo Liu, Bingsheng He

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14698 2024-11-25 cs.CL cs.AI 91%

Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation

Xunyu Zhu, Jian Li, Can Ma, Weiping Wang

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12247 2024-06-11 cs.CL cs.AI cs.CY 91%

Bad Actor, Good Advisor: Exploring the Role of Large Language Models in Fake News Detection

Beizhe Hu, Qiang Sheng, Juan Cao, Yuhui Shi, Yang Li, Danding Wang, Peng Qi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments 16 pages, 5 figures, and 9 tables. To appear at AAAI 2024

Journal ref AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06395 2024-06-04 cs.CL cs.LG 91%

MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Shengding Hu, Yuge Tu, Xu Han, Chaoqun He, Ganqu Cui, Xiang Long, Zhi Zheng, Yewei Fang, Yuxiang Huang, Weilin Zhao, Xinrong Zhang, Zheng Leng Thai, Kaihuo Zhang, Chongyi Wang, Yuan Yao, Chenyang Zhao, Jie Zhou, Jie Cai, Zhongwu Zhai, Ning Ding, Chao Jia, Guoyang Zeng, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments revise according to peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07804 2023-08-03 cs.CL cs.LG 91%

Improving Small Language Models on PubMedQA via Generative Data Augmentation

Zhen Guo, Peiqi Wang, Yanwei Wang, Shangdi Yu

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09894 2026-08-21 cs.SE cs.MA 91%

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

确定性与LLM控制的编译流程在COBOL到Python现代化中的对比

Naing Oo Lwin, Rajesh Kumar

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过实验对比确定性和LLM控制的编译流程,发现确定性方法在准确性、鲁棒性和效率上更优,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18741 2026-08-18 cs.DC 版本更新 91%

ReMP: Low-Downtime Runtime Model-Parallelism Reconfiguration for LLM Serving

ReMP:面向LLM服务的低停机时间运行时模型并行重配置

Haipeng Yuan, Kaining Zheng, Yongshu Bai, Yuchen Zhang, Yunquan Zhang, Baodong Wu, Xiang Gao, Daning Cheng

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出ReMP框架,通过解耦拓扑与运行时状态、二维KV缓存迁移等技术,实现LLM推理服务中模型并行拓扑的在线动态调整,将重配置停机时间从分钟级降至1-7秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19606 2026-08-18 cs.PF cs.DC 版本更新 91%

RAPID-LLM: Resilience-Aware Performance analysis of Infrastructure for Distributed LLM Training and Inference

RAPID-LLM:面向分布式大语言模型训练和推理的容错性能分析框架

George Karfakis, Lime Yao, Binglu Chen, Faraz Tahmasebi, Saptarshi Mitra, Tianyue Pan, Hyoukjun Kwon, Puneet Gupta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 RAPID-LLM通过统一性能建模框架,实现对分布式大语言模型训练和推理的容错性能分析,准确预测延迟和训练时间,并评估GPU设计变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14376 2026-08-17 cs.OS cs.PF 新提交 91%

CoRun: Padding is Simple and Efficient for Deterministic LLM Inference

CoRun:填充对于确定性大语言模型(LLM)推理而言简单且高效

Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 CoRun利用LLM内核的位置不变性,通过独立预填充和固定形状批量解码的调度系统,在保证确定性推理的同时提升了LLM的吞吐量并降低了延迟。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新 91%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05639 2026-08-13 cs.AR 版本更新 91%

TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference

TokenStack:一种异构HBM-PIM架构和运行时,用于高效的LLM推理

Zhuoran Li, Zhuohang Bian, Zihao Huang, Yibo Zhao, Xueqi Li, Guangyu Sun, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TokenStack通过异构HBM-PIM架构优化KV缓存,提升LLM推理效率,实现1.62倍吞吐量和1.70倍服务能力提升,同时降低能耗30-47%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09321 2026-08-13 cs.CR 版本更新 91%

SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails

SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'

Zhiyi Mou, Jingyuan Yang, Zeheng Qian, Wangze Ni, Tianfang Xiao, Ning Liu, Chen Zhang, Zhan Qin, Kui Ren

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10314 2026-08-12 cs.SE physics.comp-ph 新提交 91%

Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation

我们撰写理论的方式会改变大语言模型(LLM)据此构建的程序吗?一项针对LLM理论转程序翻译中渲染器格式的前瞻性随机研究

Andre Panossian

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究通过前瞻性随机实验发现,LLM理论转程序翻译中渲染器格式未产生预测的行为几何,为该领域规范格式效应设定了边界并提供了可审计研究工具。

Comments 112 pages, 2 figures; includes supplementary material and five reproducibility annexes. Data: https://doi.org/10.5281/zenodo.21876518. Software: https://doi.org/10.5281/zenodo.21879576

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02329 2026-08-12 cs.DC 版本更新 91%

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference

驯服请求不平衡:面向解聚LLM推理的SLO感知调度

Qipeng Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 91%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01250 2026-08-04 eess.SY cs.SY 新提交 91%

Smoothing the Ramp, Not the Peak: Scheduling-Induced Power Dynamics of LLM Inference and Their Grid-Scale Consequences

平滑斜坡而非峰值:LLM推理的调度诱导功率动态及其电网级后果

Pan Li, Yize Chen, Xia Miao, Dai Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究揭示LLM分块预填充调度可降低功率斜坡速率,随系统饱和度提升效益增大,经转化为电网调节备用采购问题后,可减少电网快速斜坡备用容量,为运营商提供无成本需求侧塑形工具。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28884 2026-08-03 cs.CR 新提交 91%

Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference

Hollow-LLM攻击:LLM推理零知识验证中的计算上微不足道的权重

Chen Gong, Beijie Liu, Mengyuan Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出Hollow-LLM攻击,利用LLM零知识验证的工作量缺口,通过嵌入幽灵权重使不诚实提供者以小模型成本生成有效证明,需额外措施绑定正确性与计算工作。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09695 2026-07-30 cs.SE 版本更新 91%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新 91%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12198 2026-07-16 cs.IR 版本更新 91%

LLM-Based User Personas for Recommendations at Scale

基于LLM的用户画像用于大规模推荐

Haoting Wang, Haokai Lu, Zheyun Feng, Jenny Huang, Yifat Amir, Gregory Hinkson, Ben Most, Zelong Zhao, Yixin Kelly Cui, Rein Zhang, Fabio Soldo, Yu Xia, Nihar Bhupalam, Minmin Chen, Konstantina Christakopoulou, Lichan Hong, Ed H. Chi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出实时生成LLM用户兴趣画像的框架,通过知识蒸馏、异步推理和语义聚类优化,平衡利用-探索权衡,提升大规模视频推荐效果。

Comments Accepted by 2026 RecSys Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01313 2026-07-03 cs.LG cs.AI cs.CL cs.CR 新提交 91%

Black-Box Inference of LLM Architectural Properties with Restrictive API Access

受限API访问下LLM架构属性的黑盒推断

Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学) Pittsburgh Supercomputing Center(匹兹堡超级计算中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27492 2026-06-29 cs.MA 新提交 91%

QueenBee Planner: Skill-Evolving Communication Topologies for Token-Efficient LLM Multi-Agent Systems

QueenBee Planner:面向Token高效LLM多智能体系统的技能演化通信拓扑

Congjia Tian, Yuhang Yao, Jiaming Cui

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QueenBee Planner框架,将智能体间通信拓扑视为可检索和自改进的设计技能,通过外部LLM规划器学习生成时间通信DAG,并利用执行轨迹蒸馏出设计规则,在固定工人池下实现通信结构的自我演化,降低消息数、模型调用和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25353 2026-06-25 cs.AR 新提交 91%

Cache-Resident LLM Inference in GB-Scale Last-Level Caches

GB级末级缓存中的缓存驻留LLM推理

Wanning Zhang, Tongzhou Gu, Marco Canini, Ceyu Xu, Jian Weng

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种缓存驻留执行模型,通过权重-注意力解耦架构和子算子依赖同步,在具有GB级末级缓存的CPU上实现LLM推理加速,TPOT提升2.04-13.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏