arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-29 至 2025-07-29 共收录 49 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2408.08554 2025-07-29 cs.LG 92%

ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models

Chao Zeng, Songwei Liu, Yusheng Xie, Hong Liu, Xiaojian Wang, Miao Wei, Shu Yang, Fangmin Chen, Xing Mei

机构 * Project Leader(项目负责人)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20786 2025-07-29 cs.CL 89%

Automating Thematic Review of Prevention of Future Deaths Reports: Replicating the ONS Child Suicide Study using Large Language Models

Sam Osian, Arpan Dutta, Sahil Bhandari, Iain E. Buchan, Dan W. Joyce

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20749 2025-07-29 cs.CL cs.CV 89%

Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Helmholtz Munich, Munich Center for Machine Learning, Germany(海德堡慕尼黑,慕尼黑机器学习中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL

Comments Accepted at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06003 2025-07-29 cs.AR cs.LG 87%

LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference

Zhiwen Mo, Lei Wang, Jianyu Wei, Zhichen Zeng, Shijie Cao, Lingxiao Ma, Naifeng Jing, Ting Cao, Jilong Xue, Fan Yang, Mao Yang

机构 * Imperial College London(帝国理工学院伦敦分校) Microsoft Research London, UK(微软研究院伦敦, UK) Peking University(北京大学) Microsoft Research Beijing, China(微软研究院北京, China) University of Science(科学大学) University of Washington(华盛顿大学) Microsoft Research Seattle, USA(微软研究院西雅图, USA) Shanghai Jiao Tong University Shanghai, China(上海交通大学上海, China) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Conference Version (ISCA'25). Fixed a typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20169 2025-07-29 cs.SD eess.AS 86%

Self-Improvement for Audio Large Language Model using Unlabeled Speech

Shaowen Wang, Xinyuan Chen, Yao Xu

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

Comments To appear in Interspeech 2025. 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14066 2025-07-29 cs.AI cs.PF 85%

TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput

Xiaoxuan Liu, Jongseok Park, Langxiang Hu, Woosuk Kwon, Zhuohan Li, Chen Zhang, Kuntai Du, Xiangxi Mo, Kaichao You, Alvin Cheung, Zhijie Deng, Ion Stoica, Hao Zhang

机构 * UC Berkeley(伯克利大学) UCSD(圣地亚哥大学) Tsinghua University(清华大学) University of Chicago(芝加哥大学) SJTU(上海交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19608 2025-07-29 cs.AI eess.SP 85%

DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference

Jiawen Qi, Chang Gao, Zhaochun Ren, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿先进计算机科学研究所(LIACS)、莱顿大学) Department of Microelectronics, Delft University of Technology(电子系、代尔夫特理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18181 2025-07-29 eess.AS cs.SD 85%

SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding

Linye Wei, Shuzhang Zhong, Songqiang Xu, Runsheng Wang, Ru Huang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京) School of Integrated Circuits, Peking University, Beijing, China(集成电路学院,北京大学,北京) School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京) Institute of Electronic Design Automation, Peking University, Wuxi, China(电子设计自动化研究院,北京大学,无锡) Beijing Advanced Innovation Center for Integrated Circuits, Beijing, China(北京集成电路先进创新中心,北京)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by Design Automation Conference (DAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17560 2025-07-29 cs.LG 84%

GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference

Chao Zeng, Songwei Liu, Shu Yang, Fangmin Chen, Lean Fu, Xing Mei

机构 * ByteDance Inc(字节跳动公司)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02528 2025-07-29 cs.CL 83%

Scalable MatMul-free Language Modeling

Rui-Jie Zhu, Yu Zhang, Steven Abreu, Ethan Sifferman, Tyler Sheaves, Yiqiao Wang, Dustin Richmond, Sumit Bam Shrestha, Peng Zhou, Jason K. Eshraghian

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Soochow University(苏州大学) University of Groningen(格罗宁根大学) LuxiTech(LuxiTech公司) Intel Labs(英特尔实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09720 2025-07-29 cs.LG cs.AI cs.IT math.IT 82%

NestQuant: Nested Lattice Quantization for Matrix Products and LLMs

Semyon Savkin, Eitan Porat, Or Ordentlich, Yury Polyanskiy

机构 * MIT(麻省理工学院) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 23 pages; Accepted at the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20842 2025-07-29 cs.CV 82%

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models

Yuchen Liu, Yaoming Wang, Bowen Shi, Xiaopeng Zhang, Wenrui Dai, Chenglin Li, Hongkai Xiong, Qi Tian

专题命中 效率与部署 :language model(title,abstract);LLM(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19845 2025-07-29 cs.DC 82%

MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training

Bohan Zhao, Guang Yang, Shuo Chen, Ruitao Liu, Tingrui Zhang, Yongchao He, Wei Xu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19823 2025-07-29 cs.CL cs.AI cs.LG 80%

HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs

Dongquan Yang, Yifan Yang, Xiaotian Yu, Xianbiao Qi, Rong Xiao

机构 * Intellifusion Inc.(智融科技公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20491 2025-07-29 cs.CL cs.AI cs.SC 79%

Speaking in Words, Thinking in Logic: A Dual-Process Framework in QA Systems

Tuan Bui, Trong Le, Phat Thai, Sang Nguyen, Minh Hua, Ngan Pham, Thang Bui, Tho Quan

机构 * Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 3 figures. Accepted at the International Joint Conference on Neural Networks (IJCNN) 2025, Workshop on Trustworthiness and Reliability in Neuro-Symbolic AI. https://2025.ijcnn.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16802 2025-07-29 cs.CL cs.LG 79%

Agentar-Fin-R1: Enhancing Financial Intelligence through Domain Expertise, Training Efficiency, and Advanced Reasoning

Yanjun Zheng, Xiyang Du, Longfei Liao, Xiaoke Zhao, Zhaowen Zhou, Jingze Song, Bo Zhang, Jiawei Liu, Xiang Qi, Zhe Li, Zhiqiang Zhang, Wei Wang, Peng Zhang

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19526 2025-07-29 cs.LG cs.AI 79%

Quantizing Text-attributed Graphs for Semantic-Structural Integration

Jianyuan Bo, Hao Wu, Yuan Fang

机构 * Singapore Management University(新加坡国立管理大学) Beijing Normal University(北京师范大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at KDD'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13710 2025-07-29 cs.DB cs.LG 77%

SoftPipe: A Soft-Guided Reinforcement Learning Framework for Automated Data Preparation

Jing Chang, Chang Liu, Jinbin Huang, Shuyuan Zheng, Rui Mao, Jianbin Qin

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Information Science and Technology, Osaka University(大阪大学信息科学与技术研究生院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20677 2025-07-29 cs.CL 77%

Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA

Qingyun Jin, Xiaohui Song, Feng Zhou, Zengchang Qin

机构 * Beihang University(北航大学) OPPO AI Center(OPPO人工智能中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20400 2025-07-29 math.OC 75%

Beyond Value Functions: Single-Loop Bilevel Optimization under Flatness Conditions

Liuyuan Jiang, Quan Xiao, Lisha Chen, Tianyi Chen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20059 2025-07-29 cs.CL cs.AI cs.LG 75%

RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation

Ran Xu, Yuchen Zhuang, Yue Yu, Haoyu Wang, Wenqi Shi, Carl Yang

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) SUNY Albany(纽约州立大学阿尔巴尼分校) UT Southwestern Medical Center(德克萨斯大学西南医学中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in Progress. Code will be published at: https://github.com/ritaranx/RAG_in_the_Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18071 2025-07-29 cs.LG cs.AI cs.CL 75%

Group Sequence Policy Optimization

Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, Junyang Lin

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20526 2025-07-29 cs.AI cs.CL cs.CY 73%

Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition

Andy Zou, Maxwell Lin, Eliot Jones, Micha Nowak, Mateusz Dziemian, Nick Winter, Alexander Grattan, Valent Nathanael, Ayla Croft, Xander Davies, Jai Patel, Robert Kirk, Nate Burnikell, Yarin Gal, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20110 2025-07-29 cs.CV cs.AI cs.LG 73%

NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding

Shiyu Liu, Lianlei Shan

机构 * School of Electrical and Electronic Engineering(电气与电子工程学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Technology(计算机科学与技术学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments **14 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20967 2025-07-29 cs.LG 70%

PROVCREATOR: Synthesizing Complex Heterogenous Graphs with Node and Edge Attributes

Tianhao Wang, Simon Klancher, Kunal Mukherjee, Josh Wiedemeier, Feng Chen, Murat Kantarcioglu, Kangkook Jee

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20578 2025-07-29 cs.IR cs.AI 70%

Beyond Interactions: Node-Level Graph Generation for Knowledge-Free Augmentation in Recommender Systems

Zhaoyan Wang, Hyunjun Ahn, In-Young Ko

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19783 2025-07-29 cs.AI 70%

SAGE: Strategy-Adaptive Generation Engine for Query Rewriting

Teng Wang, Hailei Gong, Changwang Zhang, Jun Wang

机构 * OPPO Research Institution(OPPO研究院) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02263 2025-07-29 cs.DC cs.LG 70%

MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism

Ruidong Zhu, Ziheng Jiang, Chao Jin, Peng Wu, Cesar A. Stuardo, Dongyang Wang, Xinlei Zhang, Huaping Zhou, Haoran Wei, Yang Cheng, Jianzhe Xiao, Xinyi Zhang, Lingjun Liu, Haibin Lin, Li-Wen Chang, Jianxi Ye, Xiao Yu, Xuanzhe Liu, Xin Jin, Xin Liu

机构 * Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19699 2025-07-29 cs.CL 70%

Towards Inclusive NLP: Assessing Compressed Multilingual Transformers across Diverse Language Benchmarks

Maitha Alshehhi, Ahmed Sharshar, Mohsen Guizani

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in the 3rd International Workshop on Generalizing from Limited Resources in the Open World. Workshop at International Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19565 2025-07-29 q-bio.QM cs.CV cs.LG 70%

Review of Deep Learning Applications to Structural Proteomics Enabled by Cryogenic Electron Microscopy and Tomography

Brady K. Zhou, Jason J. Hu, Jane K. J. Lee, Z. Hong Zhou, Demetri Terzopoulos

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏