arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2412.09807 2024-12-31 cs.CL 85%

LLM Distillation for Efficient Few-Shot Multiple Choice Question Answering

Patrick Sutanto, Joan Santoso, Esther Irawati Setiawan, Aji Prasetya Wibawa

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18695 2024-12-30 cs.RO cs.DC cs.LG 85%

TimelyLLM: Segmented LLM Serving System for Time-sensitive Robotic Applications

Neiwen Ling, Guojun Chen, Lin Zhong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10945 2024-12-30 cs.CV cs.AI 85%

HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models

Kazi Hasan Ibn Arif, JinYi Yoon, Dimitrios S. Nikolopoulos, Hans Vandierendonck, Deepu John, Bo Ji

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

Comments Accepted in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17846 2024-12-25 cs.CL 85%

Enhancing Knowledge Distillation for LLMs with Response-Priming Prompting

Vijay Goyal, Mustafa Khan, Aprameya Tirupati, Harveer Saini, Michael Lam, Kevin Zhu

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to SoCal NLP Symposium 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11672 2024-12-17 cs.AI cs.HC 85%

LLM-DaaS: LLM-driven Drone-as-a-Service Operations from Text User Requests

Lillian Wassim, Kamal Mohamed, Ali Hamdi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05858 2024-12-17 cs.AI 85%

Fast On-device LLM Inference with NPUs

Daliang Xu, Hao Zhang, Liming Yang, Ruiqi Liu, Gang Huang, Mengwei Xu, Xuanzhe Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06223 2024-12-16 cs.SD cs.CL eess.AS 85%

Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16283 2024-12-16 cs.DC cs.LG 85%

Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services

Jiachen Liu, Jae-Won Chung, Zhiyu Wu, Fan Lai, Myungjin Lee, Mosharaf Chowdhury

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 16 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05276 2024-12-10 cs.LG 85%

GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching

Sajal Regmi, Chetan Phakami Pun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11232 2024-12-10 cs.SE cs.AI 85%

SLEGO: A Collaborative Data Analytics System with LLM Recommender for Diverse Users

Siu Lung Ng, Hirad Baradaran Rezaei, Fethi Rabhi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09439 2024-12-09 cs.IR cs.AI 85%

Towards Boosting LLMs-driven Relevance Modeling with Progressive Retrieved Behavior-augmented Prompting

Zeyuan Chen, Haiyan Wu, Kaixin Wu, Wei Chen, Mingjie Zhong, Jia Xu, Zhongyi Liu, Wei Zhang

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted By COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02532 2024-12-03 cs.CL 85%

SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices

Ruslan Svirschevski, Avner May, Zhuoming Chen, Beidi Chen, Zhihao Jia, Max Ryabinin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05499 2024-12-02 cs.DC cs.AI 85%

LLMServingSim: A HW/SW Co-Simulation Infrastructure for LLM Inference Serving at Scale

Jaehong Cho, Minsu Kim, Hyunmin Choi, Guseul Heo, Jongse Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 15 pages, 11 figures

Journal ref IISWC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17309 2024-12-01 cs.AR cs.AI cs.DC cs.ET 85%

PIM-AI: A Novel Architecture for High-Efficiency LLM Inference

Cristobal Ortega, Yann Falevoz, Renaud Ayrignac

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15399 2024-11-26 cs.PF cs.DC cs.LG 85%

Less is More: Optimizing Function Calling for LLM Execution on Edge Devices

Varatheepan Paramanayakam, Andreas Karatzas, Iraklis Anagnostopoulos, Dimitrios Stamoulis

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at DATE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14164 2024-11-22 cs.CV cs.AI 85%

FoPru: Focal Pruning for Efficient Large Vision-Language Models

Lei Jiang, Weizhe Huang, Tongxuan Liu, Yuting Zeng, Jing Li, Lechao Cheng, Xiaohua Xu

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11560 2024-11-19 cs.DC cs.AI 85%

Topology-aware Preemptive Scheduling for Co-located LLM Workloads

Ping Zhang, Lei Su, Jinjie Yang, Xin Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 17 Pages, 11 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16758 2024-11-12 cs.CL 85%

Towards Fast Multilingual LLM Inference: Speculative Decoding and Specialized Drafters

Euiin Yi, Taehyeon Kim, Hongseok Jeung, Du-Seong Chang, Se-Young Yun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16442 2024-11-12 cs.LG cs.DC 85%

Fast and Efficient 2-bit LLM Inference on GPU: 2/4/16-bit in a Weight Matrix with Asynchronous Dequantization

Jinhao Li, Jiaming Xu, Shiyao Li, Shan Huang, Jun Liu, Yaoxiu Lian, Guohao Dai

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05045 2024-11-11 cs.CL 85%

Performance-Guided LLM Knowledge Distillation for Efficient Text Classification at Scale

Flavio Di Palo, Prateek Singhi, Bilal Fadlallah

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04319 2024-11-08 cs.DB cs.LG 85%

Towards Optimizing SQL Generation via LLM Routing

Mohammadhossein Malekpour, Nour Shaheen, Foutse Khomh, Amine Mhedhbi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Table Representation Learning Workshop at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13006 2024-11-05 cs.LG cs.SI 85%

LLM Chain Ensembles for Scalable and Accurate Data Annotation

David Farr, Nico Manzonelli, Iain Cruickshank, Kate Starbird, Jevin West

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08217 2024-11-05 cs.LG cs.SI 85%

RED-CT: A Systems Design Methodology for Using LLM-labeled Data to Train and Deploy Edge Classifiers for Computational Social Science

David Farr, Nico Manzonelli, Iain Cruickshank, Jevin West

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02214 2024-11-05 cs.LG 85%

SLTrain: a sparse plus low-rank approach for parameter and memory efficient pretraining

Andi Han, Jiaxiang Li, Wei Huang, Mingyi Hong, Akiko Takeda, Pratik Jawanpuria, Bamdev Mishra

专题命中 效率与部署 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14556 2024-11-04 cs.DB cs.AI 85%

RACOON: An LLM-based Framework for Retrieval-Augmented Column Type Annotation with a Knowledge Graph

Lindsey Linxi Wei, Guorui Xiao, Magdalena Balazinska

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22315 2024-10-30 cs.CL cs.CV 85%

Natural Language Inference Improves Compositionality in Vision-Language Models

Paola Cascante-Bonilla, Yu Hou, Yang Trista Cao, Hal Daumé, Rachel Rudinger

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Project page: https://cece-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15518 2024-10-30 cs.LG 85%

Eagle: Efficient Training-Free Router for Multi-LLM Inference

Zesen Zhao, Shuowei Jin, Z. Morley Mao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20488 2024-10-29 cs.CL 85%

FIRP: Faster LLM inference via future intermediate representation prediction

Pengfei Wu, Jiahao Liu, Zhuocheng Gong, Qifan Wang, Jinpeng Li, Jingang Wang, Xunliang Cai, Dongyan Zhao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Journal ref NLPCC2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14740 2024-10-24 cs.LG cs.DC 85%

Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching

Jie Peng, Zhang Cao, Huaizhi Qu, Zhengyu Zhang, Chang Guo, Yanyong Zhang, Zhichao Cao, Tianlong Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12568 2024-10-22 cs.RO cs.AI 85%

Robust RL with LLM-Driven Data Synthesis and Policy Adaptation for Autonomous Driving

Sihao Wu, Jiaxu Liu, Xiangyu Yin, Guangliang Cheng, Xingyu Zhao, Meng Fang, Xinping Yi, Xiaowei Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏