arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 42 篇

2512.13494 2025-12-16 cs.CL cs.AI 90%

SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping

SkipCat: 通过共享投影和块跳过实现大型语言模型的秩最大化低秩压缩

Yu-Chen Lu, Sheng-Feng Yu, Hui-Hsien Weng, Pei-Shuo Wang, Yu-Fang Hu, Liang Hung-Chun, Hung-Yueh Chiang, Kai-Chiang Wu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SkipCat通过共享投影和块跳过技术实现低秩压缩,无需额外微调即可在相同压缩率下提升零样本任务的准确率7%。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19700 2025-12-16 cs.CL cs.AI 90%

Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models

利用重要性采样将对齐模块从大语言模型中分离出来

Yi Liu, Dianqing Liu, Mingye Zhu, Junbo Guo, Yongdong Zhang, Zhendong Mao

机构 * State Key Laboratory of Communication Content Cognition, People’s Daily Online(通信内容认知国家重点实验室,人民在线) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出残差对齐模型(RAM),通过重要性采样将对齐模块与大语言模型分离,提升灵活性和可扩展性,并在多种任务上优于基线模型。

Comments Accepted by NeurIPS 2025, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05907 2025-12-16 cs.CE 89%

From Text to Returns: Using Large Language Models for Mutual Fund Portfolio Optimization and Risk-Adjusted Allocation

从文本到收益:利用大型语言模型进行共同基金投资组合优化与风险调整分配

Abrar Hossain, Mufakir Qamar Ansari, Haziq Jeelani, Monia Digra, Fayeq Jeelani Syed

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 利用大型语言模型优化共同基金投资组合并提升风险调整分配效果,Zypher 7B模型在收益与风险控制方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11187 2025-12-16 cs.CV 89%

FastVID: Dynamic Density Pruning for Fast Video Large Language Models

FastVID: 动态密度修剪用于快速视频大语言模型

Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FastVID通过动态密度修剪技术,显著降低视频大语言模型的计算开销,同时保持高准确性,实现高效的视频处理性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05915 2025-12-16 cs.CL 88%

Accelerating Large Language Model Inference via Early-Exiting Algorithms

通过早退算法加速大语言模型推理

Sangmin Bae

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过设计高效的并行解码机制和深度参数共享架构,结合预训练轻量级路由器,实现大语言模型推理的高效与性能平衡。

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12063 2025-12-16 cs.SE cs.AI 87%

Instruction-Tuning Open-Weight Language Models for BPMN Model Generation

基于指令微调的开放权重语言模型用于BPMN模型生成

Gökberk Çelikmasat, Atay Özgövde, Fatma Başak Aydemir

机构 * Boğaziçi University(博雅奇大学) Utrecht University(乌得勒支大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);prompting(abstract)

AI总结 本文提出InstruBPM,通过指令微调开放权重语言模型,以高效生成BPMN过程模型,提升结构准确性和鲁棒性,减少对重型提示的依赖。

Comments Preprint. Under preparation for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11986 2025-12-16 cs.LG 87%

Learning to Extract Context for Context-Aware LLM Inference

学习提取上下文以实现上下文感知的LLM推理

Minseon Kim, Lucas Caccia, Zhengyan Shi, Matheus Pereira, Marc-Alexandre Côté, Xingdi Yuan, Alessandro Sordoni

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过提取上下文信息提升LLM推理的安全性,减少有害输出并提高合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 87%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 效率与部署 :LLM(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02718 2025-12-16 cs.DB cs.AI cs.LG 86%

Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving

高吞吐量多LLM服务的高效无训练在线路由

Fangzhou Wu, Sandeep Silwal

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无训练的高效在线路由算法,通过近似最近邻搜索和一次优化,提升多LLM服务的吞吐量、成本效率和整体性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13438 2025-12-16 cs.SE cs.AI 85%

From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents

从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能

Dezhi Ran, Zhi Gong, Yuzhe Guo, Mengzhou Wu, Yuan Cao, Haochuan Lu, Hengyu Zhang, Xia Zeng, Gang Cao, Liangchao Yao, Yuetang Deng, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) SCS, Peking University(SCS,北京大学) Tencent Inc.(腾讯公司) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08808 2025-12-16 cs.LG 85%

TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference

TinyGraphEstimator: 为图结构推断适应轻量级语言模型

Michal Podstawski

机构 * NASK National Research Institute(波兰国家研究 institute)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出TinyGraphEstimator数据集,评估轻量级语言模型在图结构推断中的能力,通过LoRA技术实现参数调优,证明小型模型在图推理任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11920 2025-12-16 cs.AI 85%

CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving

CXL-SpecKV: 一种基于FPGA的分散式KV缓存用于数据中心LLM服务

Dong Liu, Yanxuan Yu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CXL-SpecKV通过FPGA加速和内存分散技术,提升数据中心LLM服务的吞吐量和内存效率。

Comments Accepted to FPGA'26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04146 2025-12-16 cs.LG cs.AI cs.CL 85%

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

超越单个令牌预测:扩散模型与自回归语言模型性能的对比分析

Minseo Kim, Coleman Hooper, Aditya Tomar, Chenfeng Xu, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * Seoul National University(首尔国立大学) University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了扩散模型与自回归语言模型在性能上的差异,发现DLMs在算术强度上占优但难以扩展,而ARMs在批量推理中表现更优。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12801 2025-12-16 cs.DC cs.PF 85%

Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P

细粒度并行LLM推理中的能量预测方法PIE-P

Anurag Dutt, Young Won Choi, Avirup Sil, Anshul Gandhi, Aruna Balasubramanian, Niranjan Balasubramanian

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PIE-P是一种针对多GPU并行LLM推理的细粒度能耗预测框架,通过精确建模和采样解决通信非确定性和开销问题,实现高精度能耗预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12279 2025-12-16 eess.SP 85%

WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip

WATOS: 为晶圆级芯片高效LLM训练策略和架构共探索

Huizheng Wang, Zichuan Wang, Hongbin Wang, Jingxiang Hou, Taiquan Wei, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WATOS通过高效训练策略和晶圆级架构共探索,提升了LLM训练性能,实现平均吞吐量提升2.74倍。

Comments Accepted by HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11997 2025-12-16 cs.AI 84%

Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion

通过知识增强融合进行大规模语言模型的日志异常检测

Anfeng Peng, Ajesh Koyatan Chathoth, Stephen Lee

机构 * University of Pittsburgh(匹兹堡大学) Eaton Corporation(埃顿公司)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 EnrichLog通过知识增强融合技术,提升日志异常检测的准确性和可解释性,适用于实际系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06029 2025-12-16 cs.LG 83%

Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving

Lethe:面向推理密集型大语言模型服务的层和时间自适应KV缓存剪枝

Hui Zeng, Daming Zhao, Pengfei Yang, WenXuan Hou, Tianyang Zheng, Hui Li, Weiye Ji, Jidong Zhai

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Lethe通过引入时空自适应的KV缓存管理框架,在推理密集型大语言模型服务中实现高效的缓存剪枝,提升吞吐量的同时保持生成质量。

Comments aaai26 camera-ready version, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09963 2025-12-16 cs.DC 80%

GoodSpeed: Optimizing Fair Goodput with Adaptive Speculative Decoding in Distributed Edge Inference

GoodSpeed: 通过自适应猜测解码优化公平的好吞吐量在分布式边缘推断中

Phuong Tran, Tzu-Hao Liu, Long Tan Le, Tung-Anh Nguyen, Van Quan La, Eason Yu, Han Shu, Choong Seon Hong, Nguyen H. Tran

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 GOODSPEED通过自适应猜测解码优化分布式边缘推断中的公平好吞吐量,采用梯度调度算法实现资源高效分配。

Comments Accepted at INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13526 2025-12-16 cs.LG 79%

Async Control: Stress-testing Asynchronous Control Measures for LLM Agents

异步控制:对LLM代理的异步控制措施进行压力测试

Asa Cooper Stickland, Jan Michelfeit, Arathi Mani, Charlie Griffin, Ollie Matthews, Tomek Korbak, Rogan Inglis, Oliver Makins, Alan Cooney

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 本研究通过模拟对抗游戏,开发异步监控系统以检测和防止LLM代理的破坏行为,并评估其在实际部署中的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06256 2025-12-16 eess.SP cs.AI 79%

SpectrumFM: A Foundation Model for Intelligent Spectrum Management

SpectrumFM:一种智能频谱管理的基础模型

Fuhui Zhou, Chunyu Liu, Hao Zhang, Wei Wu, Qihui Wu, Tony Q. S. Quek, Chan-Byoung Chae

机构 * College of Artificial Intelligence and the Key Laboratory of Dynamic Cognitive System of Electromagnetic Spectrum Space(人工智能学院和电磁频谱空间动态认知系统重点实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 SpectrumFM通过创新的编码器架构和自监督学习任务,提升频谱管理任务的准确性和鲁棒性,实现高效且可迁移的频谱表示。

Comments This manuscript has been accepted for publication in the IEEE Journal of Selected Areas in Communications (JSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12089 2025-12-16 cs.CV cs.CL 79%

VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering

VEGAS: 通过视觉编码器注意力引导的自适应转向来缓解大视觉-语言模型中的幻觉

Zihu Wang, Boxun Xu, Yuxuan Xia, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 VEGAS通过整合视觉编码器注意力图并自适应引导标记,有效缓解大视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21720 2025-12-16 cs.AI cs.HC cs.LG 79%

A Multi-Component AI Framework for Computational Psychology: From Robust Predictive Modeling to Deployed Generative Dialogue

面向计算心理学的多组件AI框架:从稳健的预测建模到部署的生成对话

Anant Pareek

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个多组件AI框架,结合预测建模与生成对话,实现从心理状态分析到实际应用的完整研究到部署流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13576 2025-12-16 cs.NE 78%

Reproducing and Dissecting Denoising Language Models for Speech Recognition

重现并解析用于语音识别的去噪语言模型

Dorian Koch, Albert Zeyer, Nick Rossenbach, Ralf Schlüter, Hermann Ney

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文研究了去噪语言模型在语音识别中的表现,发现其在特定计算条件下优于传统语言模型,提出DLM-sum方法提升解码性能。

Comments Equal contribution of first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10611 2025-12-16 cs.AI cs.NE 77%

Phythesis: Physics-Guided Evolutionary Scene Synthesis for Energy-Efficient Data Center Design via LLMs

Phythesis: 通过LLMs实现物理引导的进化场景合成,用于高效能数据中心设计

Minghao LI, Ruihang Wang, Rui Tan, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Phythesis通过结合LLMs和物理引导的进化优化,实现高效能数据中心设计的自动化场景合成,提升生成成功率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12806 2025-12-16 cs.AI 77%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13313 2025-12-16 cs.CV 75%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10947 2025-12-16 cs.CV 75%

Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving

迈向高效且有效的多摄像头编码以实现端到端驾驶

Jiawei Yang, Ziyu Chen, Yurong You, Yan Wang, Yiming Li, Yuxiao Chen, Boyi Li, Boris Ivanovic, Marco Pavone, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Flex,一种高效多摄像头编码方法,通过紧凑的场景令牌提升端到端驾驶性能,无需依赖3D先验。

Comments Project Page: https://jiawei-yang.github.io/Flex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 73%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04467 2025-12-16 cs.CL cs.AI 73%

PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference

PDTrim: 针对预填解码分离的定向剪枝

Hao Zhang, Mengsi Lyu, Zhuo Chen, Xingrun Xing, Yulong Ao, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PDTrim通过整合预填解码分离特性,实现更精确的块剪枝,提升推理性能和效率。

Comments Minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00507 2025-12-16 cs.DC 71%

Towards Resource-Efficient Serverless LLM Inference with SLINFER

面向资源高效的服务器less LLM推断的SLINFER

Chuhao Xu, Zijun Li, Quan Chen, Han Zhao, Xueyan Tang, Minyi Guo

专题命中 效率与部署 :LLM(title)

AI总结 SLINFER通过在异构硬件上实现弹性共享,提高小型至中型LLM推断的资源效率,实验显示服务容量提升达86%-154%

Comments To appear at HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏