arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 27 篇

2505.01658 2025-11-27 cs.CL 89%

A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency

对大型语言模型推理引擎的综述:优化与效率的视角

Sihyeong Park, Sungryeol Jeon, Chaelyn Lee, Seokhun Jeon, Byung-Soo Kim, Jemin Lee

机构 * Korea Electronics Technology Institute(韩国电子技术研究所) Electronics and Telecommunications Research Institute(电子电信研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型推理引擎的优化与效率,评估了25种开源和商用引擎,探讨了其设计目标及生态系统成熟度,并提供未来研究方向和公开存储库。

Comments Under review; 106 pages; 46 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08524 2025-11-27 cs.CL 89%

Position-Aware Depth Decay Decoding ($D^3$): Boosting Large Language Model Inference Efficiency

位置感知深度衰减解码(D³):提升大语言模型推理效率

Siqi Fan, Xuezhi Fang, Xingrun Xing, Peng Han, Shuo Shang, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Computing Automation, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 D³通过位置感知深度衰减解码提升大语言模型推理效率,实现无需重新训练的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21084 2025-11-27 cs.NI 89%

5G Network Automation Using Local Large Language Models and Retrieval-Augmented Generation

利用本地大语言模型和检索增强生成实现5G网络自动化

Ahmadreza Majlesara, Ali Majlesi, Ali Mamaghani, Alireza Shokrani, Babak Hossein Khalaj

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究通过本地部署大语言模型与检索增强生成技术,实现5G网络自动化管理,提升隐私保护与配置效率。

Comments 4 pages, 1 figure, demonstrated on 6G Summit Abu Dhabi

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 88%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 85%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17041 2025-11-27 cs.IR cs.AI 85%

CLLMRec: LLM-powered Cognitive-Aware Concept Recommendation via Semantic Alignment and Prerequisite Knowledge Distillation

CLLMRec: 基于大语言模型的认知感知概念推荐:通过语义对齐和先决知识蒸馏

Xiangrui Xiong, Yichuan Lu, Zifei Pan, Chang Sun

机构 * Xihua University, Chengdu 610039, China(西华大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CLLMRec通过语义对齐和先决知识蒸馏,利用大语言模型实现认知感知的概念推荐,无需依赖结构化知识图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17264 2025-11-27 cs.LG cs.DC 85%

No Request Left Behind: Tackling Heterogeneity in Long-Context LLM Inference with Medha

没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性

Amey Agrawal, Haoran Qiu, Junda Chen, Íñigo Goiri, Chaojie Zhang, Rayyan Shahid, Ramachandran Ramjee, Alexey Tumanov, Esha Choukse

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院) UC San Diego(圣地亚哥大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16595 2025-11-27 cs.CV cs.AI cs.CL 84%

TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型

Boshen Xu, Zihan Xiao, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。

Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21089 2025-11-27 cs.LG cs.AI 84%

MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts

MLPMoE:密集LLM架构的零样本架构变形

Ivan Novikov

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MLPMoE通过零样本方法将密集LLM的MLP结构转换为静态混合专家,实现参数高效和计算节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21103 2025-11-27 cs.LG cs.AI 81%

From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models

从比特到轮次:为扩散语言模型的并行解码探索

Hengyu Fu, Baihe Huang, Virginia Adams, Charles Wang, Venkat Srinivasan, Jiantao Jiao

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ETE策略,通过探索高不确定token提升扩散语言模型的解码效率,减少轮次并保持生成质量。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21398 2025-11-27 cs.AI cs.CL cs.HC cs.MA 79%

Prune4Web: DOM Tree Pruning Programming for Web Agent

Prune4Web: 面向Web代理的DOM树剪枝编程

Jiayuan Zhang, Kaiquan Chen, Zhihao Lu, Enshen Zhou, Qian Yu, Jing Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06283 2025-11-27 cs.CV 78%

TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks

TinyChemVL:通过高效视觉标记减少和复杂反应任务推进化学视觉-语言模型

Xuanle Zhao, Shuxin Zeng, Xinyuan Cai, Xiang Cheng, Duzhen Zhang, Xiuyi Chen, Bo Xu

专题命中 效率与部署 :language model(title,abstract)

AI总结 TinyChemVL通过高效视觉标记减少和复杂反应任务提升化学视觉-语言模型的效率和推理能力,实现更高效的化学任务处理。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21572 2025-11-27 cs.MA cs.AI 77%

BAMAS: Structuring Budget-Aware Multi-Agent Systems

BAMAS: 构建预算感知的多智能体系统

Liming Yang, Junyu Luo, Xuanzhe Liu, Yiling Lou, Zhenpeng Chen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BAMAS通过整数线性规划和强化学习构建预算感知的多智能体系统,有效降低部署成本的同时保持性能。

Comments Accepted by AAAI 2026 (oral paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20940 2025-11-27 cs.CL 77%

Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs

Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统

Reham Omar, Abdelghny Orogat, Ibrahim Abdelaziz, Omij Mangukiya, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科德大学) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。

Comments This paper is accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21689 2025-11-27 cs.CL cs.AI cs.LG cs.MA 75%

ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration

ToolOrchestra:通过高效模型和工具协同提升智能

Hongjin Su, Shizhe Diao, Ximing Lu, Mingjie Liu, Jiacheng Xu, Xin Dong, Yonggan Fu, Peter Belcak, Hanrong Ye, Hongxu Yin, Yi Dong, Evelina Bakhturina, Tao Yu, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA University of Hong Kong(香港大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolOrchestra通过高效模型和工具协同提升智能,实现更高效且更有效的工具增强推理系统。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15953 2025-11-27 cs.CV 75%

Activator: GLU Activation Function as the Core Component of a Vision Transformer

Activator: GLU激活函数作为视觉变换器的核心组件

Abdullah Nazhat Abdullah, Tarkan Aydin

机构 * Bahcesehir University(巴切塞希尔大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出使用GLU激活函数替代传统MLP和注意力机制,以提高视觉变换器的计算效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02322 2025-11-27 cs.CL cs.LG 73%

CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis

CAMERA:通过微专家冗余分析实现多矩阵联合压缩以优化MoE模型

Yuzhuang Xu, Xu Han, Yuanchi Zhang, Yixuan Wang, Yijun Liu, Shiyu Ji, Qingfu Zhu, Wanxiang Che

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CAMERA通过微专家冗余分析实现多矩阵联合压缩,提升MoE模型的压缩效率与性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 73%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21150 2025-11-27 cs.CV cs.AI 70%

LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs

LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码

Shichu Sun, Yichen Zhang, Haolin Song, Zonghao Guo, Chi Chen, Yidan Zhang, Yuan Yao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21671 2025-11-27 physics.optics 67%

Photonic systolic array for all-optical matrix-matrix multiplication

光子搏动阵列用于全光矩阵-矩阵乘法

Jungmin Kim, Qingyi Zhou, Zongfu Yu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种全光子搏动阵列,用于高效实现全光矩阵-矩阵乘法,通过同频检测和紧凑型芯片上自由形式光学模块设计,实现了高计算密度。

Comments Main 8 pages, 4 figures Supplementary Note S1-2, Supplementary Figures S1-9

Journal ref Laser & Photonics Reviews (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03928 2025-11-27 cs.CV 67%

Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling

Vision Remember: 在高效的LVLM中通过视觉特征采样恢复视觉信息

Ze Feng, Jiang-jiang Liu, Sen Yang, Lingyu Xiao, Zhibin Quan, Zhenhua Feng, Wankou Yang, Jingdong Wang

机构 * Southeast University(东南大学) Baidu VIS(百度视觉) The University of Hong Kong(香港大学) Jiangnan University(江南大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 Vision Remember通过视觉特征采样在高效LVLM中恢复视觉信息,提升效率并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21652 2025-11-27 cs.CV cs.AI cs.LG 62%

Continual Error Correction on Low-Resource Devices

低资源设备上的持续错误校正

Kirill Paramonov, Mete Ozay, Aristeidis Mystakidis, Nikolaos Tsalikidis, Dimitrios Sotos, Anastasios Drosou, Dimitrios Tzovaras, Hyunjun Kim, Kiseok Chang, Sangdok Mo, Namwoong Kim, Woojong Yoo, Jijoong Moon, Umberto Michieli

机构 * Samsung Research(三星研究)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种低资源设备上的持续错误校正系统,通过少量样本学习和原型更新实现高效错误校正,适用于图像分类和目标检测任务。

Comments ACM MMSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20848 2025-11-27 cs.RO cs.AI cs.HC cs.LG cs.SY eess.SY 62%

NOIR 2.0: Neural Signal Operated Intelligent Robots for Everyday Activities

NOIR 2.0:神经信号操作的智能机器人用于日常活动

Tasha Kim, Yingke Wang, Hanvit Cho, Alex Hodges

机构 * Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Department of Computer Science(计算机科学系) Department of Mechanical Engineering(机械工程系)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 NOIR 2.0通过改进的脑解码算法和少样本学习提升机器人执行日常任务的效率和适应性。

Comments Conference on Robot Learning (CoRL 2024), CoRoboLearn

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17464 2025-11-27 cs.LG cs.AI stat.ML 62%

Data Valuation by Fusing Global and Local Statistical Information

通过融合全局和局部统计信息进行数据估值

Xiaoling Zhou, Ou Wu, Michael K. Ng, Hao Jiang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong Baptist University(香港 Baptist大学) Renmin University of China(中国人民大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出融合全局和局部统计信息的增强数据估值方法,通过正则化项优化Shapley值估计,并引入动态数据估值技术提升计算效率。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10959 2025-11-27 cs.CV cs.AI 57%

OuroMamba: A Data-Free Quantization Framework for Vision Mamba

OuroMamba:一种无需数据的视觉Mamba量化框架

Akshat Ramachandran, Mingyu Lee, Huan Xu, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel Labs(英特尔实验室)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 OuroMamba提出一种无需数据的视觉Mamba量化方法,通过生成语义丰富的合成数据和混合精度量化技术,实现高效的模型压缩与性能提升。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20770 2025-11-27 cs.CV 50%

Text-Guided Semantic Image Encoder

基于文本的语义图像编码器

Raghuveer Thirukovalluru, Xiaochuang Han, Bhuwan Dhingra, Emily Dinan, Maha Elbayad

机构 * Duke University(杜克大学) FAIR at Meta(Meta的FAIR)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出基于文本的语义图像编码器,通过文本指导生成图像表示,提升视觉-语言模型在多个基准测试中的性能,并提高推理效率。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13820 2025-11-27 physics.chem-ph cond-mat.mtrl-sci 50%

A foundation machine learning potential with polarizable long-range interactions for materials modelling

一种结合极化长程相互作用的机器学习基础模型用于材料建模

Rongzhi Gao, ChiYung Yam, Jianjun Mao, Shuguang Chen, GuanHua Chen, Ziyang Hu

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究提出了一种结合极化长程相互作用的机器学习基础模型,用于提升材料建模的精度与效率。

Journal ref Nat. Commun. 16, 10484 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏