arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 244 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 43 篇

2512.23029 2025-12-30 cs.DC cs.AI 85%

Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware

私有LLM服务器的可行性和性能:基于Qwen3-30B在消费级硬件上的基准分析

Alex Khalil, Guillaume Heilles, Maria Parraga, Simon Heilles

机构 * UCLouvain(列日大学) Universidad Espíritu Santo(圣灵大学) DENEM Labs(DENEM实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文基于Qwen3-30B在消费级硬件上评估私有LLM服务器的可行性和性能,证明其在成本和隐私方面对SMBs的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI 85%

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22925 2025-12-30 cs.DC 85%

Argus: Token Aware Distributed LLM Inference Optimization

Argus:基于令牌的分布式大语言模型推理优化

Panlong Wu, Yifei Zhong, Danyang Chen, Ting Wang, Fangxin Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Argus是一种基于令牌的分布式大语言模型推理优化框架,通过长度感知语义模块和Lyapunov引导卸载优化模块,实现高效的任务卸载和动态异构环境下的高效率推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12018 2025-12-30 cs.CL cs.AI cs.LG 85%

Atom of Thoughts for Markov LLM Test-Time Scaling

思想原子用于马尔可夫LLM测试时间扩展

Fengwei Teng, Quan Shi, Zhaoyang Yu, Jiayi Zhang, Yuyu Luo, Chenglin Wu, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom(DeepWisdom公司) Renmin University of China(中国人民大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思想原子(\our),通过马尔可夫链结构与树搜索等技术结合,实现高效推理,提升LLM测试时间扩展性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23145 2025-12-30 cs.CL cs.AI 84%

Reservoir Computing inspired Matrix Multiplication-free Language Model

受回声计算启发的无矩阵乘法语言模型

Takumi Shiratsuchi, Yuichiro Tanaka, Hakaru Tamukoh

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, Japan(九州工学技术大学生命科学与系统工程研究生院) Research Center for Neuromorphic AI Hardware, Kyushu Institute of Technology, Japan(九州工学技术大学神经形态人工智能硬件研究中心)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种受回声计算启发的无矩阵乘法语言模型,通过共享权重和优化内存访问,有效降低计算成本并提升效率。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22737 2025-12-30 cs.CL 83%

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

WeDLM:弥合扩散语言模型与标准因果注意力以实现快速推理

Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 WeDLM通过使用标准因果注意力实现高效并行解码,显著提升推理速度,优于优化的AR引擎。

Comments 23 pages, 8 figures, project page: https://wedlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22238 2025-12-30 cs.LG cs.AI cs.CV 81%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22195 2025-12-30 cs.DC cs.AI cs.LG 81%

MatKV: Trading Compute for Flash Storage in LLM Inference

MatKV: 用闪存存储替代计算以提升大语言模型推理效率

Kun-Woo Shin, Jay H. Park, Moonwook Oh, Yohan Jo, Jaeyoung Do, Sang-Won Lee

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 MatKV通过预先计算并存储键值向量以提升RAG推理效率,减少能耗和时间,同时保持问答准确性。

Comments Accepted for publication in ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21580 2025-12-30 cs.CL 79%

Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM

Gamayun的多语言 mastery 之路:一种 1.5B 参数 LLM 的高效训练

Alexander Podolskiy, Semen Molokov, Timofey Gerasin, Maksim Titov, Alexey Rukhovich, Artem Khrapov, Kirill Morozov, Evgeny Tetin, Constantine Korikov, Pavel Efimov, Polina Lazukova, Yuliya Skripkar, Nikita Okhotnikov, Irina Piontkovskaya, Meng Xiaojun, Zou Xueyi, Zhang Zhenhe

机构 * Gamayun Team(Gamayun团队)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL

AI总结 Gamayun 通过两阶段预训练策略,在资源受限环境下高效训练出 1.5B 参数多语言模型,支持 12 种语言,尤其在俄语上取得先进成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15545 2025-12-30 cs.CL cs.AI 79%

TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs

TokenTiming: 一种适用于通用推测解码模型对的动态对齐方法

Sibo Xiao, Jinyuan Fu, Zhongle Xie, Lidan Shou

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TokenTiming通过动态对齐方法实现通用推测解码,无需重新训练即可处理不同词汇模型,提升LLM推理效率1.57倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22125 2025-12-30 cs.DC cs.AI 77%

GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems

GPU-Virt-Bench: 一种全面的软件GPU虚拟化系统基准测试框架

Jithin VG, Ditto PS

机构 * Bud Ecosystem Inc(Bud生态系统公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GPU-Virt-Bench是一种用于评估软件GPU虚拟化系统性能的全面基准测试框架,通过56项指标评估隔离质量、LLM性能等关键因素,为多租户环境下的GPU资源部署提供决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14973 2025-12-30 cs.CL cs.AI cs.LG 75%

Attention Is All You Need for KV Cache in Diffusion LLMs

注意力是扩散大语言模型中KV缓存的所有需求

Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Elastic-Cache方法,通过适应性缓存更新提升扩散LLM的解码效率和生成质量。

Comments Code at: https://github.com/VILA-Lab/Elastic-Cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18516 2025-12-30 eess.AS 75%

Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection

Distinctive Feature Codec: 一种适应性高效的抑郁症检测语音表示

Xiangyu Zhang, Fuming Fang, Peng Gao, Bin Qin, Beena Ahmed, Julien Epps

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Distinctive Feature Codec通过动态分割信号生成可变长度标记,提升抑郁症检测的语音表示效率和时间动态性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23310 2025-12-30 cs.LG cs.AI cs.DC cs.ET cs.NI 73%

Splitwise: Collaborative Edge-Cloud Inference for LLMs via Lyapunov-Assisted DRL

Splitwise: 通过Lyapunov辅助深度强化学习实现LLM的协作边缘-云推断

Abolfazl Younesi, Abbas Shabrang Maryan, Elyas Oustad, Zahra Najafabadi Samani, Mohsen Ansari, Thomas Fahringer

机构 * University of Innsbruck(因斯布鲁克大学) Sharif University of Technology(谢赫·巴赫尔·卡什·大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Splitwise通过Lyapunov辅助深度强化学习实现LLM在边缘和云环境中的细粒度自适应划分,减少延迟和能耗,提高鲁棒性。

Comments 11 pages, 9 figures. Accepted by ACM for presentation at UCC '25 (18th International Conference on Utility and Cloud Computing), December 1-4, 2025, France. Proceedings publication pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22733 2025-12-30 cs.LG cs.AI 73%

FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents

FoldAct: 长时间 horizon 搜索代理的高效且稳定的上下文折叠

Jiaqi Shao, Yufeng Miao, Wei Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Duke Kunshan University(杜克大学昆山学院) Microsoft AI(微软人工智能)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FoldAct通过分离损失计算、全上下文一致性损失和选择性段训练,解决长时间 horizon 搜索代理中上下文折叠的非平稳观察问题,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22562 2025-12-30 cs.CL cs.AI 73%

Learning When Not to Attend Globally

学习何时不进行全局关注

Xuan Luo, Kailai Zhang, Xifeng Yan

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,加州大学圣巴巴拉分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AHA通过动态切换全关注与局部滑动窗口关注,实现高效推理,减少93%的完全关注操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22129 2025-12-30 cs.MA cs.AI cs.LG 73%

ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling

ReCollab:基于检索增强的LLM用于协作即兴队友建模

Conor Wallace, Umer Siddique, Yongcan Cao

机构 * Department of Electrical and Computer Engineering, University of Texas at San Antonio(电子与计算机工程系,德克萨斯大学圣安东尼奥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ReCollab通过检索增强生成技术提升即兴团队合作中队友行为建模的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22886 2025-12-30 cs.LG stat.ML 70%

Theory and Algorithms for Learning with Multi-Class Abstention and Multi-Expert Deferral

多类回避与多专家延迟学习的理论与算法

Anqi Mao

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出多专家延迟和回避学习的理论框架与算法,通过设计替代损失函数和一致性保证,提升分类和回归任务的性能与效率。

Comments Ph.D. Dissertation, New York University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16531 2025-12-30 cs.AI 70%

Scaling Laws for Energy Efficiency of Local LLMs

本地大语言模型和视觉-语言模型的扩展定律

Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, Román Orús

机构 * Multiverse Computing Donostia International Physics Center Ikerbasque Foundation for Science Multiverse Computing, Centre for Social Innovation

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13797 2025-12-30 cs.CL 70%

Breadcrumbs Reasoning: Memory-Efficient Reasoning with Compression Beacons

痕迹推理:通过压缩信标实现的内存高效推理

Giovanni Monea, Yair Feldman, Shankar Padmanabhan, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出通过压缩信标实现内存高效推理,利用联合蒸馏和强化学习框架优化缓存压缩,提升大语言模型在长上下文推理中的内存与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22200 2025-12-30 cs.LG 70%

Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents

情感启发学习信号(EILS):一种适应性自主代理的稳态框架

Dhruv Tiwari

机构 * Department of Computer Science(计算机科学系) Lovely Professional University(洛丽专业大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EILS通过引入生物启发的情感信号,提升智能体在非平稳环境中的适应性和样本效率。

Comments 7 pages, 3 figures. arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20663 2025-12-30 cs.MA cs.AI cs.SY eess.SY 70%

MTTR-A: Measuring Cognitive Recovery Latency in Multi-Agent Systems

MTTR-A:多智能体系统中认知恢复延迟的测量

Barak Or

机构 * Office of the CEO, MetaOr Artificial Intelligence(MetaOr人工智能首席执行官办公室) Google–Reichman Tech School, Reichman University(Reichman大学Google–Reichman技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MTTR-A指标,用于测量多智能体系统中认知恢复延迟,通过理论分析和实验验证建立了运行时认知可靠性的量化基础。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09156 2025-12-30 math.ST stat.TH 67%

Zero-Order Sharpness-Aware Minimization

零阶锐度感知最小化

Yao Fu, Yihang Jin, Chunxia Zhang, Junmin Liu, Guang Dai, Haishan Ye

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ZOSA通过结合零阶优化与锐度感知最小化,提升提示调优效率和泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14376 2025-12-30 cs.LG cs.AI 62%

Tiled Flash Linear Attention: More Efficient Linear RNN and xLSTM Kernels

分块式Flash线性注意力:更高效的线性RNN和xLSTM内核

Maximilian Beck, Korbinian Pöppel, Phillip Lippe, Sepp Hochreiter

机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT人工智能实验室、机器学习研究所、JKU林茨) NXAI GmbH(NXAI公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 TFLA通过引入序列并行化提升线性RNN和xLSTM内核效率,实现更高算术强度和更优长上下文序列建模性能。

Comments Accepted at NeurIPS 2025. Code available at: https://github.com/NX-AI/mlstm_kernels

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17515 2025-12-30 eess.IV cs.LG 57%

Resource-efficient medical image classification for edge devices

边缘设备上的资源高效医疗图像分类

Mahsa Lavaei, Zahra Abadi, Salar Beigzad, Alireza Maleki

机构 * ECE University of Tehran(电子工程系,伊朗德黑兰大学) ECE Tehran University(电子工程系,伊朗德黑兰大学) Engineering University of St. Thomas, Minnesota(工程系,圣托马斯大学(明尼苏达)) Technology Management University of Tehran(技术管理,伊朗德黑兰大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本研究提出了一种通过模型量化技术实现边缘设备上高效医疗图像分类的方法,有效降低计算和内存需求,同时保持诊断精度。

Comments Conference paper published in ICAMIDA 2025 (IEEE)

Journal ref Proc. Int. Conf. Appl. Mach. Intelligence and Data Analytics (ICAMIDA), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11585 2025-12-30 cs.LG cs.DC 57%

Parameter-Efficient and Personalized Federated Training of Generative Models at the Edge

边缘设备上的参数高效和个性化生成模型联邦训练

Kabir Khan, Manju Sarkar, Anita Kar, Suresh Ghosh

机构 * Department of Computer Science, San Francisco State University(计算机科学系,圣弗朗西斯科州立大学) Department of Communication Systems, University of Lakhimpur(通信系统系,拉贾斯坦邦大学) Department of Embedded Systems, Manipur University(嵌入式系统系,曼尼普尔大学) Department of Chemical Engineering, Lakshadweep University(化学工程系,拉克沙德韦普大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 FedGen-Edge通过解耦预训练骨干和轻量级适配器,在边缘设备上实现参数高效和个性化生成模型的联邦训练,降低通信开销并提升收敛速度。

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22398 2025-12-30 cs.AI 57%

Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings

轻量级推理时个性化方法用于冻结的知识图谱嵌入

Ozan Oguztuzun, Cerag Oguztuzun

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 GatedBias通过轻量级推理时个性化方法,实现对冻结知识图谱嵌入的个体用户适应,提升对齐度并保持群体性能,同时验证因果响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 50%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23454 2025-12-30 cs.CV 50%

Automated river gauge plate reading using a hybrid object detection and generative AI framework in the Limpopo River Basin

利用混合目标检测和生成式AI框架实现利比里河盆地的自动水位计读数

Kayathri Vigneswaran, Hugo Retief, Jai Clifford Holmes, Mariangel Garcia Andarcia, Hansaka Tennakoon

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出结合目标检测和生成式AI的混合框架,用于自动读取河流水位计,提升水文监测的精度和效率。

Comments 11 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04678 2025-12-30 cs.CV 50%

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成

Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) SIAS-ZJU SJTU(上海交通大学)

专题命中 效率与部署 :language model(abstract)

AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏