arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-21 至 2025-10-21 共收录 356 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 58 篇

2505.19504 2025-10-21 cs.LG cs.AI cs.CL 87%

DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation

Pingzhi Li, Zhen Tan, Mohan Zhang, Huaizhi Qu, Huan Liu, Tianlong Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code is available at https://github.com/unites-lab/doge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16293 2025-10-21 cs.LG cs.AI cs.DC 86%

Robust LLM Training Infrastructure at ByteDance

Borui Wan, Gaohong Liu, Zuquan Song, Jun Wang, Yun Zhang, Guangming Sheng, Shuguang Wang, Houmin Wei, Chenyuan Wang, Weiqiang Lou, Xi Yang, Mofan Zhang, Kaihua Jiang, Cheng Ren, Xiaoyun Zhi, Menghan Yu, Zhe Nan, Zhuolin Zheng, Baoquan Zhong, Qinlong Wang, Huan Yu, Jinxin Chi, Wang Zhang, Yuhan Li, Zixian Du, Sida Zhao, Yongqiang Zhang, Jingzhe Tang, Zherui Liu, Chuan Wu, Yanghua Peng, Haibin Lin, Wencong Xiao, Xin Liu, Liang Xiang

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16040 2025-10-21 cs.AR cs.AI 85%

Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing

Tianhua Xia, Sai Qian Zhang

机构 * Tandon School of Engineering(工程学院) New York University(纽约大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17393 2025-10-21 q-fin.PM 85%

3S-Trader: A Multi-LLM Framework for Adaptive Stock Scoring, Strategy, and Selection in Portfolio Optimization

Kefan Chen, Hussain Ahmad, Diksha Goel, Claudia Szabo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16418 2025-10-21 cs.DC 85%

FourierCompress: Layer-Aware Spectral Activation Compression for Efficient and Accurate Collaborative LLM Inference

Jian Ma, Xinchen Lyu, Jun Jiang, Longhao Zou, Chenshan Ren, Qimei Cui, Xiaofeng Tao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16415 2025-10-21 cs.DC 85%

MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization

Rizhen Hu, Yutong He, Ran Yan, Mou Sun, Binghang Yuan, Kun Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06807 2025-10-21 cs.CR 85%

MPCache: MPC-Friendly KV Cache Eviction for Efficient Private LLM Inference

Wenxuan Zeng, Ye Dong, Jinjin Zhou, Jin Tan, Lei Wang, Tao Wei, Runsheng Wang, Meng Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16805 2025-10-21 cs.LG cs.AI 84%

Mixed-Precision Quantization for Language Models: Techniques and Prospects

Mariam Rakka, Marios Fournarakis, Olga Krestinskaya, Jinane Bazzi, Khaled N. Salama, Fadi Kurdahi, Ahmed M. Eltawil, Mohammed E. Fouda

机构 * University of California Irvine(加州大学 Irvine 分校) Wayve AI King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) RAIN AI

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

Comments 46 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16290 2025-10-21 cs.CV cs.CL 83%

Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models

Yue Zheng, Xiufang Shi, Jiming Chen, Yuanchao Shu

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17802 2025-10-21 cs.LG cs.AI math.OC 82%

Unbiased Gradient Low-Rank Projection

Rui Pan, Yang Luo, Yuxing Liu, Yang You, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16716 2025-10-21 cs.CR cs.LG 81%

DistilLock: Safeguarding LLMs from Unauthorized Knowledge Distillation on the Edge

Asmita Mohanty, Gezheng Kang, Lei Gao, Murali Annavaram

机构 * University of Southern California(南加州大学) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11302 2025-10-21 cs.CV cs.AI cs.LG 81%

When Does Supervised Training Pay Off? The Hidden Economics of Object Detection in the Era of Vision-Language Models

Samer Al-Hamadani

机构 * Automated Manufacturing Department(自动化制造部门) Al-Khwarizmi College of Engineering(阿尔·卡瓦尔米工程学院) University of Baghdad(巴格达大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 30 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15945 2025-10-21 cs.LG cs.AI 81%

BEACON: Bayesian Optimal Stopping for Efficient LLM Sampling

Guangya Wan, Zixin Stephen Xu, Sasa Zorc, Manel Baucells, Mengxuan Hu, Hao Wang, Sheng Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

Comments Under review on ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14458 2025-10-21 cs.DC cs.AI cs.LG 81%

Improving training time and GPU utilization in geo-distributed language model training

Palak, Tella Rajashekhar Reddy, Bhaskar Kataria, Rohan Gandhi, Karan Tandon, Debopam Bhattacherjee, Venkata N. Padmanabhan

机构 * Microsoft Research India(微软印度研究院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16968 2025-10-21 cs.LG cs.AI cs.CL 80%

Leave It to the Experts: Detecting Knowledge Distillation via MoE Expert Signatures

Pingzhi Li, Morris Yu-Chao Huang, Zhen Tan, Qingquan Song, Jie Peng, Kai Zou, Yu Cheng, Kaidi Xu, Tianlong Chen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code is at https://github.com/unites-lab/shadow-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17197 2025-10-21 cs.CV cs.AI 79%

ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models

Pu Zhang, Yuwei Li, Xingyuan Xian, Guoming Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16292 2025-10-21 cs.LG 79%

QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models

Yutong Wang, Haiyu Wang, Sai Qian Zhang

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

Comments Accepted as Spotlight paper by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17358 2025-10-21 cs.LG cs.AI 79%

Localist LLMs with Recruitment Learning

Joachim Diederich

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16718 2025-10-21 cs.SD cs.CL cs.LG 79%

U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation

Xusheng Yang, Long Zhou, Wenfu Wang, Kai Hu, Shulin Feng, Chenxing Li, Meng Yu, Dong Yu, Yuexian Zou

机构 * Peking University(北京大学) Tencent AI Lab(腾讯AI实验室) Tencent Hunyuan(腾讯文生)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16552 2025-10-21 cs.LG cs.AI 79%

LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs

Ang Li, Yifei Wang, Zhihang Yuan, Stefanie Jegelka, Yisen Wang

机构 * MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16276 2025-10-21 cs.AI cs.LG 79%

What Limits Agentic Systems Efficiency?

Song Bian, Minghao Yan, Anand Jayarajan, Gennady Pekhimenko, Shivaram Venkataraman

机构 * UW-Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16045 2025-10-21 cs.LG cs.AI 79%

AMS-QUANT: Adaptive Mantissa Sharing for Floating-point Quantization

Mengtao Lv, Ruiqi Zhu, Xinyu Wang, Yun Li

机构 * Huawei Inc.(华为公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15992 2025-10-21 cs.LG cs.AI 79%

Stratos: An End-to-End Distillation Pipeline for Customized LLMs under Distributed Cloud Environments

Ziming Dai, Tuo Zhang, Fei Gao, Xingyi Cai, Xiaofei Wang, Cheng Zhang, Wenyu Wang, Chengjie Zang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17555 2025-10-21 cs.CL 77%

Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation

Collin Zhang, Fei Huang, Chenhan Yuan, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Cornell University(康奈尔大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17364 2025-10-21 cs.CV cs.LG 77%

Recurrent Attention-based Token Selection for Efficient Streaming Video-LLMs

Vaggelis Dorovatas, Soroush Seifi, Gunshi Gupta, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司) Archimedes RU, Athena RC(阿奇米德 RU、阿泰纳 RC) University of Oxford(牛津大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16885 2025-10-21 cs.LG 77%

UniGTE: Unified Graph-Text Encoding for Zero-Shot Generalization across Graph Tasks and Domains

Duo Wang, Yuan Zuo, Guangyue Lu, Junjie Wu

机构 * MIIT Key Laboratory of Data Intelligence and Management, Beihang University(信息科技部数据智能与管理重点实验室,北京航空航天大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21668 2025-10-21 cs.CR cs.IR cs.LG 77%

Traceback of Poisoning Attacks to Retrieval-Augmented Generation

Baolei Zhang, Haoran Xin, Minghong Fang, Zhuqing Liu, Biao Yi, Tong Li, Zheli Liu

机构 * CCS\&CS, DISSec, Nankai University(计算机科学与技术系、信息安全与保密系、南开大学) University of Louisville(路易斯维尔大学) University of North Texas(北德克萨斯大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by The Web Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03702 2025-10-21 cs.DC 75%

Hierarchical Prediction-based Management for LMaaS Systems

Zhihan Jiang, Yujie Huang, Guangba Yu, Junjie Huang, Jiazhen Gu, Michael R. Lyu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12468 2025-10-21 cs.CL cs.AI cs.IR cs.LG 75%

Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation

Dongwon Jung, Qin Liu, Tenghao Huang, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16851 2025-10-21 cs.CL cs.AI cs.NE 73%

Neuronal Group Communication for Efficient Neural representation

Zhengqi Pei, Qingming Huang, Shuhui Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏