arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2511.22955 2025-12-01 cs.LG 90%

Experts are all you need: A Composable Framework for Large Language Model Inference

专家足矣:一种用于大语言模型推理的可组合框架

Shrihari Sridharan, Sourjya Roy, Anand Raghunathan, Kaushik Roy

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 Comp-LLM通过可组合的推理框架实现跨专家协作,提升大语言模型的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 90%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SFT(abstract);preference optimization(abstract)

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01695 2025-12-01 cs.LG eess.SP 89%

Collaborative Large Language Model Inference via Resource-Aware Parallel Speculative Decoding

通过资源感知的并行推测解码实现协作式大语言模型推理

Jungyeon Koh, Hyun Jong Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种统一框架,通过多智能体深度强化学习优化用户关联和资源分配,实现高效的并行推测解码,减少端到端延迟28%以上,提升移动边缘计算中大语言模型服务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04275 2025-12-01 cs.DC 89%

DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models

DistTrain: 通过解耦训练解决多模态大语言模型中的模型与数据异质性

Zili Zhang, Yinmin Zhong, Yimin Jiang, Hanpeng Hu, Jianjian Sun, Zheng Ge, Yibo Zhu, Daxin Jiang, Xin Jin

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 DistTrain通过解耦模型编排和数据预处理,提升多模态大语言模型的训练效率和资源利用率。

Comments SIGCOMM 2025 (https://dl.acm.org/doi/10.1145/3718958.3750472)

Journal ref SIGCOMM'25: Proceedings of the ACM SIGCOMM 2025 Conference Pages 24-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22788 2025-12-01 cs.CR cs.CL 89%

PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration

PRISM:通过语义草图协作实现隐私感知的自适应云-边LLM推理

Junfei Zhan, Haoxun Shen, Zheng Lin, Tengjiao He

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 PRISM通过语义草图协作实现隐私感知的自适应云-边LLM推理,动态平衡隐私与推理质量,降低能耗和延迟,提升输出质量。

Comments Accepted to AAAI 2026. This is the arXiv preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21736 2025-12-01 cs.CL cs.AI 88%

R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization

R2Q: 向通过残差细化量化实现稳健的2位大语言模型

Jiayi Chen, Jieqi Shi, Jing Huo, Chen Wu

机构 * Nanjing University(南京大学) Microsoft AI(微软人工智能)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 R2Q通过残差细化量化方法,在极端压缩下提升2位大语言模型的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 88%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09936 2025-12-01 cs.LG cs.AI cs.CL 87%

KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference

KeepKV: 实现高效的大型语言模型推理中的周期性无损KV缓存压缩

Yuxuan Tian, Zihan Wang, Yebo Peng, Aomufei Yuan, Zhiming Wang, Bairen Yi, Xin Liu, Yong Cui, Tong Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KeepKV通过自适应KV缓存合并方法,在严格内存限制下实现高效LLM推理,实现无损压缩并提升生成质量。

Comments 14 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21721 2025-12-01 cs.CL cs.CY cs.LG 86%

PeerCoPilot: A Language Model-Powered Assistant for Behavioral Health Organizations

PeerCoPilot: 一种基于语言模型的助手法师,用于行为健康组织

Gao Mo, Naveen Raman, Megan Chai, Cindy Peng, Shannon Pagdon, Nev Jones, Hong Shen, Peggy Swarbrick, Fei Fang

机构 * Behavioral Health Organizations(心理健康组织)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 PeerCoPilot是一种基于语言模型的助手,帮助行为健康组织的同伴提供者制定健康计划和目标,提高服务质量和效率。

Comments Accepted at IAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20576 2025-12-01 cs.DB cs.CL 85%

OmniRouter: Budget and Performance Controllable Multi-LLM Routing

OmniRouter: 可预算和性能控制的多LLM路由

Kai Mei, Wujiang Xu, Minghao Guo, Shuhang Lin, Yongfeng Zhang

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OmniRouter通过受约束优化方法实现多LLM路由,平衡成本与性能,提升响应准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19657 2025-12-01 cs.LG 85%

LLMEasyQuant: Scalable Quantization for Parallel and Distributed LLM Inference

LLMEasyQuant: 用于并行和分布式LLM推理的可扩展量化

Dong Liu, Yanxuan Yu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLMEasyQuant通过模块化和系统感知的量化框架,实现高效低比特LLM推理,支持多种量化方法并优化多GPU和分布式环境下的性能。

Comments Accepted as International Conference of Computational Optimization 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22933 2025-12-01 eess.SP 85%

RAG-Empowered LLM-Driven Dynamic Radio Resource Management in Open 6G RAN

基于RAG的LLM驱动的开放6G RAN动态无线电资源管理

Onur Salan, Burak Çırağ, Onur Sever, İbrahim Hökelek, Ali Görçin, Hakan Ali Çırpan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于RAG的LLM驱动的O-RAN动态资源管理框架,通过双代理机制实现网络切片的自适应控制,提升计算效率和SLA合规性。

Comments Submitted to possible IEEE conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22118 2025-12-01 cs.SE 85%

Statistical Independence Aware Caching for LLM Workflows

面向LLM工作流的统计独立性感知缓存

Yihan Dai, Dimitrios Stamatios Bouras, Haoxiang Jia, Sergey Mechtaev

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Mnimi通过封装统计约束在LLM引用类型中,提升代码修复工作流的可重复性、调试效率和统计正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22880 2025-12-01 cs.DC cs.AI cs.LG 84%

Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems

在分布式大语言模型推理系统中服务异构LoRA适配器

Shashwat Jaiswal, Shrikara Arun, Anjaly Parayil, Ankur Mallick, Spyros Mastorakis, Alind Khare, Chloi Alverti, Renee St Amant, Chetan Bansal, Victor Rühle, Josep Torrellas

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) National Technical University of Athens(雅典国家技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LoRAServe通过动态适配器放置和路由框架,有效解决异构LoRA适配器在分布式大语言模型推理中的性能偏斜问题,提升吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22891 2025-12-01 cs.AI cs.CL cs.LG 82%

ORION: Teaching Language Models to Reason Efficiently in the Language of Thought

ORION:教语言模型以高效的方式在思维语言中推理

Kumar Tanmay, Kriti Aggarwal, Paul Pu Liang, Subhabrata Mukherjee

机构 * Harvard University(哈佛大学) Hippocratic AI(希波克拉底AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :language model(title);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ORION通过SLPO优化实现高效压缩推理,提升推理效率和准确性,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21862 2025-12-01 cs.DC 82%

OOCO: Latency-disaggregated Architecture for Online-Offline Co-locate LLM Serving

OOCO:用于在线-离线协同LLM服务的延迟分解架构

Siyu Wu, Zihan Tang, Yuting Zeng, Hui Chen, Guiguang Ding, Tongxuan Liu, Ke Zhang, Hailong Yang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 OOCO提出一种延迟分解架构,通过分离集群资源为严格和宽松延迟池,解决在线-离线协同LLM服务中的负载不平衡问题,提升离线吞吐量3倍并保持在线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22217 2025-12-01 cs.NI 80%

Optimizing NetGPT via Routing-Based Synergy and Reinforcement Learning

通过基于路由的协同与强化学习优化NetGPT

Yuxuan Chen, Rongpeng Li, Xianfu Chen, Celimuge Wu, Chenghui Peng, Zhifeng Zhao, Honggang Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 NetGPT通过云边协同与强化学习优化,实现动态路由与边缘自改进,提升复杂请求处理效率与成本控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01457 2025-12-01 cs.LG cs.AI cs.CL 80%

Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback

超越内省:通过外部主义行为反馈强化思维

Diji Yang, Linda Zeng, Kezhen Chen, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DRR框架,通过外部主义行为反馈提升LLM推理质量,无需修改基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20172 2025-12-01 cs.DC cs.AI 79%

Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management

Beluga:基于CXL的内存架构用于可扩展和高效的LLM KVCache管理

Xinjun Yang, Qingda Hu, Junru Li, Feifei Li, Yicong Zhu, Yuqi Zhou, Qiuru Lin, Jian Dai, Yang Kong, Jiayu Zhang, Guoqiang Xu, Qiang Liu

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 Beluga通过CXL交换机实现GPU与CPU共享大规模内存池,显著提升LLM推断中的KVCache管理效率。

Comments 13 pages, accepted by SIGMOD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23473 2025-12-01 cs.LG cs.CL 79%

ThetaEvolve: Test-time Learning on Open Problems

ThetaEvolve:开放问题的测试时间学习

Yiping Wang, Shao-Rong Su, Zhiyuan Zeng, Eva Xu, Liliang Ren, Xinyu Yang, Zeyi Huang, Xuehai He, Luyao Ma, Baolin Peng, Hao Cheng, Pengcheng He, Weizhu Chen, Shuohang Wang, Simon Shaolei Du, Yelong Shen

机构 * Microsoft(微软公司) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 ThetaEvolve通过测试时间强化学习提升开放问题求解能力,实现开源模型在数学优化问题上的新突破。

Comments 30 pages, link: https://github.com/ypwang61/ThetaEvolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23404 2025-12-01 cs.LG cs.AI 79%

LFM2 Technical Report

LFM2 技术报告

Alexander Amini, Anna Banaszak, Harold Benoit, Arthur Böök, Tarek Dakhran, Song Duong, Alfred Eng, Fernando Fernandes, Marc Härkönen, Anne Harrington, Ramin Hasani, Saniya Karwa, Yuri Khrustalev, Maxime Labonne, Mathias Lechner, Valentine Lechner, Simon Lee, Zetian Li, Noel Loo, Jacob Marks, Edoardo Mosca, Samuel J. Paech, Paul Pak, Rom N. Parnichkun, Alex Quach, Ryan Rogers, Daniela Rus, Nayan Saxena, Bettina Schlager, Tim Seyde, Jimmy T. H. Smith, Aditya Tadimeti, Neehal Tumma

机构 * Liquid AI

专题命中 效率与部署 :foundation model(abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 LFM2 是一种高效部署且具备强大任务能力的液体基础模型家族,通过紧凑的混合主干和优化训练流程,在多种基准测试中表现出色,支持多模态和检索变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22749 2025-12-01 cs.LG cs.AI 79%

VeriDispatcher: Multi-Model Dispatching through Pre-Inference Difficulty Prediction for RTL Generation Optimization

VeriDispatcher: 通过预推理难度预测实现多模型调度以优化RTL生成

Zeng Wang, Weihua Xiao, Minghao Shao, Raghu Vamshi Hemadri, Ozgur Sinanoglu, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎赫尔分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VeriDispatcher通过预推理难度预测调度多个LLM,提高RTL生成的准确性和降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11477 2025-12-01 cs.CL cs.AI 79%

How Can We Effectively Expand the Vocabulary of LLMs with 0.01GB of Target Language Text?

如何用0.01GB的目标语言文本有效扩展LLM的词汇?

Atsuki Yamaguchi, Aline Villavicencio, Nikolaos Aletras

机构 * University of Sheffield, United Kingdom(英国谢菲尔德大学) University of Exeter, United Kingdom(英国埃克塞特大学) The Alan Turing Institute, United Kingdom(英国艾伦·图灵研究所) Federal University of Rio Grande do Norte, Brazil(巴西里奥格兰德杜纳伊联邦大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种在低资源条件下通过少量目标语言文本扩展LLM词汇的方法,以提升推理速度并保持下游任务性能。

Comments Accepted to Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21699 2025-12-01 cs.CL cs.AI 79%

Cacheback: Speculative Decoding With Nothing But Cache

Cacheback: 基于缓存的推测解码

Zhiyao Ma, In Gim, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Cacheback是一种基于缓存的推测解码方法,通过利用语言局部性加速LLM推理,具有简洁设计和高效性能。

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pp. 31067-31072. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08174 2025-12-01 cs.CV 78%

OBSeg: Accurate and Fast Instance Segmentation Framework Using Segmentation Foundation Models with Oriented Bounding Box Prompts

OBSeg: 基于定向边界框提示的准确且快速的实例分割框架

Zhen Zhou, Junfeng Fan, Yunkai Ma, Sihan Zhao, Fengshui Jing, Min Tan

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 OBSeg通过引入定向边界框提示,提升了实例分割的准确性和速度,同时优化了轻量级基础模型的性能。

Journal ref Machine Intelligence Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23122 2025-12-01 cs.AI 77%

Evolutionary Discovery of Heuristic Policies for Traffic Signal Control

进化发现交通信号控制的启发式策略

Ruibing Wang, Shuhan Guo, Zeen Li, Zhen Wang, Quanming Yao

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安) Tsinghua University, Beijing, China(清华大学,北京)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的交通信号控制策略进化方法,通过结构化状态抽象和信用分配反馈模块,生成针对特定交通环境的高效启发式策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03408 2025-12-01 cs.CL 77%

Efficient Reasoning via Thought-Training and Thought-Free Inference

通过思维训练和无思维推理实现高效推理

Canhui Wu, Qiong Cao, Chao Xue, Wei Xi, Xiaodong He

机构 * Xi’an Jiaotong University(西安交通大学) JD Future Academy(京东未来学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 3TF通过训练混合模型实现高效推理,使模型能在无显式推理生成的情况下进行高质量推理。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 75%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22594 2025-12-01 cs.CV cs.AI 74%

HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models

HarmoCLIP:在对比视觉语言模型中协调全局和区域表示

Haoxi Zeng, Haoxuan Li, Yi Bin, Pengpeng Zeng, Xing Xu, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 HarmoCLIP通过引入细粒度语义监督和区域-语言对齐策略,协调CLIP中全局与区域表示,提升检索和边界框分类性能,实现平衡高效的全局-局部权衡解决方案。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16607 2025-12-01 cs.DB cs.AI cs.CL cs.PL 73%

MCTS-SQL: Light-Weight LLMs can Master the Text-to-SQL through Monte Carlo Tree Search

MCTS-SQL: 轻量级大语言模型可通过蒙特卡洛树搜索掌握文本到SQL

Shuozhi Yuan, Limin Chen, Miaomiao Yuan, Zhao Jin

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MCTS-SQL通过蒙特卡洛树搜索引导轻量级大语言模型高效生成SQL查询,实验证明其在文本到SQL任务中优于现有方法。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏