arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 47 篇

2504.17685 2025-12-23 cs.CL cs.AI 93%

Ensemble Bayesian Inference: Leveraging Small Language Models to Achieve LLM-level Accuracy in Profile Matching Tasks

集成贝叶斯推断:利用小语言模型在资料匹配任务中实现LLM级别的准确性

Haru-Tada Sato, Fuka Matsuzaki, Jun-ichiro Takahashi

专题命中 效率与部署 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文提出集成贝叶斯推断方法,通过结合多个小型语言模型的判断,实现与大语言模型相当的资料匹配任务准确性。

Comments 13 pages, 2 figures

Journal ref Adv. Artif. Intell. Mach. Learn., 2025, 5 (3 ):4154-4173

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19069 2025-12-23 cs.AI 89%

Can abstract concepts from LLM improve SLM performance?

能否从LLM中提取的抽象概念提升SLM性能?

Siddharth Tandon

机构 * Google AI, Global Services Delivery(谷歌人工智能,全球服务交付)

专题命中 效率与部署 :SLM(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出通过从大型语言模型中提取抽象概念来提升小型语言模型的性能,通过实验验证了概念的可转移性,并引入了动态调整引导强度的推理时缩放技术,提升了多个任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18371 2025-12-23 eess.AS cs.SD 89%

Phoneme-based speech recognition driven by large language models and sampling marginalization

基于大语言模型和采样边际化的音素语音识别

Te Ma, Nanjie Li, Hao Huang, Zhijian Ou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出SKM策略,通过随机采样替代束搜索,提升语音识别模型的训练效率和识别性能。

Comments Published at NCMMSC 2025, in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11496 2025-12-23 cs.CV cs.AI 86%

AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model

AndesVL 技术报告:一种高效的移动端多模态大语言模型

Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, Xin Li, Ruichen Wang, Zhihao Li, Qi Qi, Long Cheng, Dongze Hao, Quanlong Zheng, Yanhao Zhang, Haobo Ji, Jian Ma, Zhitong Zheng, Zhenyi Lin, Haolin Deng, Xin Zou, Xiaojie Yin, Ruilin Wang, Liankai Cai, Haijing Liu, Yuqing Qiu, Ke Chen, Zixian Li, Chi Xie, Huafei Li, Chenxing Li, Chuangchuang Wang, Kai Tang, Zhiguang Zhu, Kai Tang, Wenmei Gao, Rui Wang, Jun Wu, Chao Liu, Qin Xie, Chen Chen, Haonan Lu

机构 * AndesVL Team(AndesVL团队) OPPO AI Center(OPPO人工智能中心)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。

Comments Tech report of OPPO AndesVL Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17910 2025-12-23 cs.DC cs.AI cs.LG 86%

Efficient Multi-Adapter LLM Serving via Cross-Model KV-Cache Reuse with Activated LoRA

高效多适配器LLM服务通过跨模型KV缓存重用与激活LoRA

Allison Li, Kristjan Greenewald, Thomas Parnell, Navid Azizan

机构 * mit(麻省理工学院) ibm(国际商业机器公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效LLM服务引擎,通过激活LoRA实现跨模型KV缓存重用,显著降低推理延迟和时间到第一个token,提升多适配器任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 85%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19004 2025-12-23 cs.CL cs.AI cs.LG 85%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 85%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18608 2025-12-23 cs.CL 83%

A Comparative Study of Light-weight Language Models for PII Masking and their Deployment for Real Conversational Texts

轻量语言模型在PII遮蔽中的比较研究及其在真实对话文本中的部署

Prabigya Acharya, Liza Shrestha

机构 * IOE, Pulchowk Campus(理工学院,普尔乔克校区)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文比较了轻量级语言模型在PII遮蔽中的性能,发现Mistral在F1和召回率上表现更优,但T5在实时对话中更高效且可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16963 2025-12-23 cs.LG 83%

Compression is Routing: Reconstruction Error as an Intrinsic Signal for Modular Language Models

压缩即路由:重构误差作为模块化语言模型的内在信号

Zhongpan Tang

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出'压缩即路由'架构,通过端到端Transformer自编码器实现序列压缩,利用重构误差作为内在信号,提升领域辨别能力并简化路由机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18546 2025-12-23 cs.CL 83%

LLMs on Drugs: Language Models Are Few-Shot Consumers

Alexander Doudkin

机构 * HFBK Hamburg(汉堡应用技术大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments 8 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19305 2025-12-23 cs.CL 81%

CienaLLM: Generative Climate-Impact Extraction from News Articles with Autoregressive LLMs

CienaLLM: 从新闻文章中生成气候影响信息的自回归大语言模型

Javier Vela-Tambo, Jorge Gracia, Fernando Dominguez-Castro

机构 * Worcester Polytechnic Institute(沃斯特理工学院) Aragon Institute of Engineering Research(阿拉贡工程研究院) Pyrenean Institute of Ecology (IPE-CSIC)(比利牛斯生态研究院(IPE-CSIC))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CienaLLM通过自回归大语言模型实现大规模新闻文章中气候影响信息的提取,提供高精度且高效的零样本信息提取方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03695 2025-12-23 cs.LG cs.AI 81%

Hierarchical Federated Foundation Models over Wireless Networks for Multi-Modal Multi-Task Intelligence: Integration of Edge Learning with D2D/P2P-Enabled Fog Learning Architectures

无线网络上的分层联邦基础模型用于多模态多任务智能:整合边缘学习与D2D/P2P-enabled雾学习架构

Payam Abdisarabshali, Fardis Nadimi, Kasra Borazjani, Naji Khosravan, Minghui Liwang, Wei Ni, Dusit Niyato, Michael Langberg, Seyyedali Hosseinalipour

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层联邦基础模型,整合边缘学习与D2D/P2P-enabled雾学习架构,解决多模态多任务智能中的异构性问题。

Comments 7 pages, 2 figures, 1 table

Journal ref IEEE Communications Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19125 2025-12-23 cs.CL cs.LG 81%

SAP: Syntactic Attention Pruning for Transformer-based Language Models

SAP:基于Transformer语言模型的句法注意力剪枝

Tzu-Yun Lee, Ding-Yong Hong, Jan-Jan Wu

机构 * Institute of Information Science, Academia Sinica(学术院信息研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 SAP通过结合句法结构和注意力模式,提升Transformer模型的剪枝效果和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23195 2025-12-23 cs.LG cs.AI 81%

Less is More: Unlocking Specialization of Time Series Foundation Models via Structured Pruning

少即是多:通过结构化剪枝解锁时间序列基础模型的专精

Lifan Zhao, Yanyan Shen, Zhaoyang Liu, Xue Wang, Jiaji Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化剪枝方法,通过剪枝后再微调提升时间序列基础模型的预测性能,使其在多个基准测试中超越专用模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18452 2025-12-23 cs.LG cs.AI stat.ML 81%

Secret mixtures of experts inside your LLM

LLM中隐藏的专家混合物

Enric Boix-Adsera

机构 * Wharton School of Statistics and Data Science at the University of Pennsylvania(宾夕法尼亚大学沃顿统计与数据科学学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM中MLP层可能通过稀疏计算近似MoE结构,并通过实验验证激活分布对结果的影响,揭示了MLP和MoE的有效性原理。

Comments 8 pages in main text; 23 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14625 2025-12-23 cs.GT cs.LG 79%

Accelerated Preference Elicitation with LLM-Based Proxies

基于大语言模型的加速偏好获取

David Huang, Francisco Marmolejo-Cossío, Edwin Lock, David Parkes

机构 * Harvard University(哈佛大学) King's College London(伦敦国王学院) Boston College(波士顿学院) Input Output

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于大语言模型的高效偏好获取方法,通过减少查询次数实现更高效的偏好近似。

Comments In Proceedings of The 21st Conference on Web and Internet Economics (WINE '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19509 2025-12-23 cs.SE 78%

Beyond Language Boundaries: Uncovering Programming Language Families for Code Language Models

超越语言边界:揭示编程语言家族以优化代码语言模型

Shangbo Yun, Xiaodong Gu, Jianghong Huang, Beijun Shen

专题命中 效率与部署 :language model(title);LLM(abstract)

AI总结 本文提出基于嵌入的框架揭示编程语言家族,通过语言关系优化多语言代码LLM训练,提升代码智能任务性能。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18496 2025-12-23 cs.CV 78%

Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models

Adaptive-VoCo: 用于视觉-语言模型的复杂度感知视觉标记压缩

Xiaoyang Guo, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 Adaptive-VoCo通过动态压缩视觉标记提升视觉-语言模型的效率与鲁棒性

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00029 2025-12-23 cs.SE cs.AI 77%

CodeTF: One-stop Transformer Library for State-of-the-art Code LLMs

CodeTF: 代码大模型的统一Transformer库

Nghi D. Q. Bui, Hung Le, Yue Wang, Junnan Li, Akhilesh Deepak Gotmare, Steven C. H. Hoi

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CodeTF是一个面向最新代码大模型的统一Transformer库,通过模块化设计和可扩展框架,提供统一接口以快速开发和部署代码大语言模型及代码智能应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18747 2025-12-23 cs.CV cs.AI 77%

IPCV: Information-Preserving Compression for MLLM Visual Encoders

IPCV:信息保留的多模态大语言模型视觉编码器压缩

Yuan Chen, Zichen Wen, Yuzhou Wu, Xuyang Liu, Shuang Chen, Junpeng Ma, Weijia Li, Conghui He, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) CityU(城市大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sheffield(谢菲尔德大学) SCU(上海科技大学) FDU(福建大学) SYSU(南方科技大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IPCV通过邻居引导重建和注意力稳定化技术,实现无需训练的多模态大语言模型视觉编码器高效压缩,有效降低计算成本并提升性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18674 2025-12-23 cs.DC cs.AI 77%

Remoe: Towards Efficient and Low-Cost MoE Inference in Serverless Computing

Remoe:面向无服务器计算的高效低成本MoE推理

Wentao Liu, Yuhao Hu, Ruiting Zhou, Baochun Li, Ne Wang

机构 * School of Computer Science and Engineering, Southeast University, China(计算机科学与工程学院,东南大学) Department of Electrical and Computer Engineering, University of Toronto, Canada(电气与计算机工程系,多伦多大学) Department of Computing, The Hong Kong Polytechnic University, Hong Kong(计算系,香港理工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Remoe通过异构架构和优化技术,在无服务器计算中实现高效低成本的MoE推理,降低推理成本和冷启动延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19000 2025-12-23 cs.HC cs.AI cs.SY eess.SY 77%

An AI-Driven Multimodal Smart Home Platform for Continuous Monitoring and Assistance in Post-Stroke Motor Impairment

基于人工智能的多模态智能家庭平台:用于中风后运动功能障碍的持续监测与协助

Chenyu Tang, Ruizhi Zhang, Shuo Gao, Zihe Zhao, Zibo Zhang, Jiaqi Wang, Cong Li, Junliang Chen, Yanning Dai, Shengbo Wang, Ruoyu Juan, Qiaoying Li, Ruimou Xie, Xuhang Chen, Xinkai Zhou, Yunjia Xia, Jianan Chen, Fanghao Lu, Xin Li, Ninglli Wang, Peter Smielewski, Yu Pan, Hubin Zhao, Luigi G. Occhipinti

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于人工智能的多模态智能家庭平台,通过整合可穿戴设备和环境传感器,实现中风后患者运动功能的持续监测与智能协助,显著提升用户满意度。

Comments 5 figures, 41 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17914 2025-12-23 cs.CL cs.MA 77%

Q-KVComm: Efficient Multi-Agent Communication Via Adaptive KV Cache Compression

Q-KVComm: 通过自适应KV缓存压缩实现高效的多智能体通信

Boris Kriuk, Logic Ng

机构 * Department of Computer Science \& Engineering Hong Kong University of Science Department of Physics Hong Kong University of Science

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Q-KVComm通过自适应KV缓存压缩实现多智能体高效通信,提升压缩比与语义保真度。

Comments 7 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17020 2025-12-23 cs.CV 75%

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms

CrossLMM: 通过双交叉注意力机制解耦长视频序列与LMMs

Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang

机构 * Accio Team, Alibaba Group(阿里集团阿奇奥团队) CUHK MMLab(CUHK多模态实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CrossLMM通过双交叉注意力机制解耦长视频序列,有效减少视觉token数量并保持性能,适用于多种视频多模态模型基准测试。

Comments Project page: https://github.com/shilinyan99/CrossLMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18215 2025-12-23 cs.LG cs.AI cs.CL cs.CV 75%

Stable and Efficient Single-Rollout RL for Multimodal Reasoning

稳定且高效的多模态推理单次迭代强化学习

Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学) University of Notre Dame(诺特大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MSSR通过熵基优势塑造机制,实现多模态推理中的稳定高效单次迭代强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18399 2025-12-23 cs.CL cs.AI 73%

AraToken: Optimizing Arabic Tokenization with Normalization Pipeline and Language Extension for Qwen3

AraToken: 通过规范化流程和语言扩展优化阿拉伯语分词以适应Qwen3

Mark Kashirskiy, Artiom Lipinski, Ilya Makarov

机构 * Higher School of Economics(俄罗斯高等经济学院) AI Talent Hub, ITMO University(ITMO大学人工智能人才中心) Markov Lab, Saint Petersburg State University(圣彼得堡国立大学马尔科夫实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AraToken通过规范化流程和语言扩展优化阿拉伯语分词,提升Qwen3的阿拉伯语处理性能。

Comments 8 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02833 2025-12-23 cs.LG cs.CL 73%

In Good GRACEs: Principled Teacher Selection for Knowledge Distillation

在良好的GRACE中:为知识蒸馏选择原则性教师

Abhishek Panigrahi, Bingbin Liu, Sadhika Malladi, Sham Kakade, Surbhi Goel

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Kempner Institute, Harvard(哈佛凯普纳研究所) Microsoft Research, New York(微软研究院(纽约)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 GRACE通过量化教师有效性,为知识蒸馏提供原则性教师选择和蒸馏指导,提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01431 2025-12-23 cs.LG cs.AI 73%

Efficient Deep Learning Infrastructures for Embedded Computing Systems: A Comprehensive Survey and Future Envision

面向嵌入式计算系统的高效深度学习基础设施:全面综述与未来展望

Xiangzhong Luo, Di Liu, Hao Kong, Shuo Huai, Hui Chen, Guochu Xiong, Weichen Liu

机构 * Nanyang Technological University(南洋理工大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了面向嵌入式计算系统的高效深度学习基础设施,涵盖从训练到推理、从手动到自动化、从卷积神经网络到大语言模型的多种方法,旨在缩小计算资源差距以实现无处不在的嵌入式智能。

Comments ACM Transactions on Embedded Computing Systems (TECS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 70%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏