arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2507.03865 2025-08-19 cs.CL cs.AI cs.LG 85%

OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference

Seungjun Shin, Jaehoon Oh, Dokwan Oh

机构 * Samsung Advanced Institute of Technology, Korea(三星先进技术研究所,韩国)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 (final version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09173 2025-08-14 cs.NI 85%

Camel: Energy-Aware LLM Inference on Resource-Constrained Devices

Hao Xu, Long Peng, Shezheng Song, Xiaodong Liu, Ma Jun, Shasha Li, Jie Yu, Xiaoguang Mao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09149 2025-08-14 cs.NI cs.DC 85%

Semantic-Aware LLM Orchestration for Proactive Resource Management in Predictive Digital Twin Vehicular Networks

Seyed Hossein Ahmadpanah

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08457 2025-08-13 cs.AR cs.ET 85%

Architecting Long-Context LLM Acceleration with Packing-Prefetch Scheduler and Ultra-Large Capacity On-Chip Memories

Ming-Yen Lee, Faaiq Waqar, Hanchen Yang, Muhammed Ahosan Ul Karim, Harsono Simka, Shimeng Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 7 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10323 2025-08-13 cs.CR cs.SE 85%

ELFuzz: Efficient Input Generation via LLM-driven Synthesis Over Fuzzer Space

Chuyang Chen, Brendan Dolan-Gavitt, Zhiqiang Lin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by USENIX Security'25 Cycle 2

Journal ref The 34th USENIX Security Symposium, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06978 2025-08-12 cs.AR 85%

SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency

Kwanhee Kyung, Sungmin Yun, Jung Ho Ahn

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 4 pages, 6 figures, accepted at IEEE Computer Architecture Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06554 2025-08-12 cs.RO 85%

AquaChat++: LLM-Assisted Multi-ROV Inspection for Aquaculture Net Pens with Integrated Battery Management and Thruster Fault Tolerance

Abdelhaleem Saad, Waseem Akram, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05855 2025-08-12 cs.RO cs.CV 85%

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control

Junjie Wen, Yichen Zhu, Jinming Li, Zhibin Tang, Chaomin Shen, Feifei Feng

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);prompting(abstract)

Comments The webpage is at https://dex-vla.github.io/. DexVLA is accepted by CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24320 2025-08-11 cs.CV 85%

Can Test-Time Scaling Improve World Foundation Model?

Wenyan Cong, Hanqing Zhu, Peihao Wang, Bangya Liu, Dejia Xu, Kevin Wang, David Z. Pan, Yan Wang, Zhiwen Fan, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Texas A&M University(德克萨斯阿姆斯特朗大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

Comments Accepted by COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03464 2025-08-06 cs.CE 85%

Learning to Incentivize: LLM-Empowered Contract for AIGC Offloading in Teleoperation

Zijun Zhan, Yaxian Dong, Daniel Mawunyo Doe, Yuqing Hu, Shuai Li, Shaohua Cao, Zhu Han

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01989 2025-08-05 cs.DC 85%

Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving

Chao Wang, Pengfei Zuo, Zhangyu Chen, Yunkai Liang, Zhou Yu, Ming-Chang Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 17 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01558 2025-08-05 cs.CV 85%

EvoVLMA: Evolutionary Vision-Language Model Adaptation

Kun Ding, Ying Wang, Shiming Xiang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments This paper has been accepted by ACM Multimedia 2025 (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01279 2025-08-05 cs.HC 85%

ViseGPT: Towards Better Alignment of LLM-generated Data Wrangling Scripts and User Prompts

Jiajun Zhu, Xinyu Cheng, Zhongsu Luo, Yunfan Zhou, Xinhuan Shu, Di Weng, Yingcai Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at Annual ACM Symposium on User Interface Software and Technology (UIST'25), September 28-October 1, 2025, Busan, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07052 2025-07-31 cs.CL cs.AI cs.LG 85%

Towards the Law of Capacity Gap in Distilling Language Models

Chen Zhang, Qiuchi Li, Dawei Song, Zheyu Ye, Yan Gao, Yan Hu

机构 * Beijing Institute of Technology(北京理工大学) University of Copenhagen(哥本哈根大学) The Open University(开放大学) Xiaohongshu(小红书)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 32 pages, 10 figures, 15 tables, accepted to ACL 2025. Code and checkpoints are available at https://github.com/GeneZC/MiniMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18181 2025-07-29 eess.AS cs.SD 85%

SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding

Linye Wei, Shuzhang Zhong, Songqiang Xu, Runsheng Wang, Ru Huang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京) School of Integrated Circuits, Peking University, Beijing, China(集成电路学院,北京大学,北京) School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京) Institute of Electronic Design Automation, Peking University, Wuxi, China(电子设计自动化研究院,北京大学,无锡) Beijing Advanced Innovation Center for Integrated Circuits, Beijing, China(北京集成电路先进创新中心,北京)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by Design Automation Conference (DAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18007 2025-07-25 cs.DC 85%

Cloud Native System for LLM Inference Serving

Minxian Xu, Junhan Liao, Jingfeng Wu, Yiyuan He, Kejiang Ye, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18006 2025-07-25 cs.DC 85%

Unlock the Potential of Fine-grained LLM Serving via Dynamic Module Scaling

Jingfeng Wu, Yiyuan He, Minxian Xu, Xitong Gao, Kejiang Ye, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17962 2025-07-25 cs.CR 85%

TimelyHLS: LLM-Based Timing-Aware and Architecture-Specific FPGA HLS Optimization

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09971 2025-07-22 cs.RO 85%

Advancing Object Goal Navigation Through LLM-enhanced Object Affinities Transfer

Mengying Lin, Shugao Liu, Dingxi Zhang, Yaran Chen, Zhaoran Wang, Haoran Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Georgia Institute of Technology(佐治亚理工学院) ETH Zurich(苏黎世联邦理工学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) McCormick School of Engineering, Northwestern University(西北大学工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13348 2025-07-18 cs.CV cs.AI cs.CL cs.LG 85%

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Senqiao Yang, Junyi Li, Xin Lai, Bei Yu, Hengshuang Zhao, Jiaya Jia

机构 * CUHK(香港中文大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code and models are available at https://github.com/dvlab-research/VisionThink

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05102 2025-07-17 cs.SE 85%

You Can REST Now: Automated REST API Documentation and Testing via LLM-Assisted Request Mutations

Alix Decrop, Xavier Devroey, Mike Papadakis, Pierre-Yves Schobbens, Gilles Perrouin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11417 2025-07-16 cs.DC 85%

Quantifying the Energy Consumption and Carbon Emissions of LLM Inference via Simulations

Miray Özcan, Philipp Wiesner, Philipp Weiß, Odej Kao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Presented at the Workshop on Performance and Energy Efficiency in Concurrent and Distributed Systems (PECS) at Euro-PAR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11042 2025-07-16 cs.IR 85%

Aligned Query Expansion: Efficient Query Expansion for Information Retrieval through LLM Alignment

Adam Yang, Gustavo Penha, Enrico Palumbo, Hugues Bouchard

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10150 2025-07-15 cs.DC 85%

Past-Future Scheduler for LLM Serving under SLA Guarantees

Ruihao Gong, Shihao Bai, Siyu Wu, Yunqian Fan, Zaijun Wang, Xiuhong Li, Hailong Yang, Xianglong Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted to ASPLOS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07400 2025-07-11 cs.DC cs.MA 85%

KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows

Zaifeng Pan, Ajjkumar Patel, Zhengding Hu, Yipeng Shen, Yue Guan, Wan-Lu Li, Lianhui Qin, Yida Wang, Yufei Ding

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07045 2025-07-10 cs.SE cs.SI 85%

5C Prompt Contracts: A Minimalist, Creative-Friendly, Token-Efficient Design Framework for Individual and SME LLM Usage

Ugur Ari

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 5 pages, 5 tables. Includes comparative experimental results across OpenAI, Anthropic, DeepSeek, and Gemini LLMs

URL PDF HTML 收藏
2507.04820 2025-07-08 cs.IR 85%

Harnessing Pairwise Ranking Prompting Through Sample-Efficient Ranking Distillation

Junru Wu, Le Yan, Zhen Qin, Honglei Zhuang, Paul Suganthan G. C., Tianqi Liu, Zhe Dong, Xuanhui Wang, Harrie Oosterhuis

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract)

Comments ReNeuIR 2025 (at SIGIR 2025) - 4th Workshop on Reaching Efficiency in Neural Information Retrieval, July 17, 2025, Padua, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20187 2025-07-03 cs.OS cs.CR 85%

Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU

He Sun, Li Li, Mingjun Xiao, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00797 2025-07-02 cs.AR 85%

VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator

Zhican Wang, Hongxiang Fan, Haroon Waris, Gang Wang, Zhenyu Li, Jianfei Jiang, Yanan Sun, Guanghui He

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments DAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00715 2025-07-02 cs.IR 85%

EARN: Efficient Inference Acceleration for LLM-based Generative Recommendation by Register Tokens

Chaoqun Yang, Xinyu Lin, Wenjie Wang, Yongqi Li, Teng Sun, Xianjing Han, Tat-Seng Chua

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏