arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-15 至 2025-12-15 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 24 篇

2503.14749 2025-12-15 cs.CL cs.LG 86%

Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence

不确定性蒸馏:教语言模型表达语义信心

Sophia Hager, David Mueller, Kevin Duh, Nicholas Andrews

机构 * Department of Computer Science(计算机科学系) Johns Hopkins University(约翰霍普金斯大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出不确定性蒸馏方法,通过微调使语言模型能准确表达语义信心,提升不确定性量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04752 2025-12-15 cs.LG 85%

RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting

RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈

Siqi Wang, Hailong Yang, Junjie Zhu, Xuezhu Wang, Yufan Xu, Depei Qian

专题命中 效率与部署 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09012 2025-12-15 cs.SE cs.AI 85%

Software Engineering and Foundation Models: Insights from Industry Blogs Using a Jury of Foundation Models

软件工程与基础模型:基于行业博客的见解,利用基础模型的 jury

Hao Li, Cor-Paul Bezemer, Ahmed E. Hassan

机构 * Queen’s University(女王大学) University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析行业博客,探讨了基础模型在软件工程中的应用与影响,提出了未来研究方向。

Comments ICSE-SEIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11550 2025-12-15 cs.AR 85%

PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration

PD-Swap:通过动态部分重新配置实现端到端LLM推理的边缘FPGA预填解码逻辑交换

Yifan Zhang, Zhiheng Chen, Ye Qiao, Sitao Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PD-Swap通过动态部分重新配置实现边缘FPGA上LLM推理的预填解码逻辑分离,提升吞吐量并优化资源利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11221 2025-12-15 cs.LG cs.AI cs.CL 85%

Adaptive Soft Rolling KV Freeze with Entropy-Guided Recovery: Sublinear Memory Growth for Efficient LLM Inference

自适应软滚动KV冻结与熵引导恢复:用于高效大语言模型推理的亚线性内存增长

Adilet Metinov, Gulida M. Kudakeeva, Bolotbek uulu Nursultan, Gulnara D. Kabaeva

机构 * Institute of Information Technology(信息技术研究所) Kyrgyz State Technical University named after I. Razzakov(伊·拉扎科夫命名的吉尔吉斯斯坦技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ASR-KF-EGR通过自适应软冻结与熵引导恢复,实现高效大语言模型推理的亚线性内存增长,减少KV缓存占用同时保持生成质量。

Comments 6 pages, 3 tables , 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15447 2025-12-15 cs.AI cs.LG 84%

From Bits to Boardrooms: A Cutting-Edge Multi-Agent LLM Framework for Business Excellence

从比特到董事会:一种面向企业卓越的多智能体大语言模型框架

Zihao Wang, Junming Zhang

机构 * College of Artificial Intelligence and Automation(人工智能与自动化学院) Hohai University(河海大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BusiAgent是一种基于多智能体框架的LLM,通过整合CTMDP、熵度量和Stackelberg博弈等创新技术,提升企业决策的效率与质量。

Comments Accepted by ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11482 2025-12-15 cs.SE cs.AI cs.CR 83%

Towards Privacy-Preserving Code Generation: Differentially Private Code Language Models

面向隐私保护的代码生成:差分隐私代码语言模型

Melih Catal, Pooja Rani, Harald C. Gall

机构 * University of Zurich(苏黎世大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出在代码语言模型中应用差分隐私以缓解记忆风险,同时保持代码生成能力,验证了DP在隐私保护中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11225 2025-12-15 cs.CV cs.AI cs.LG 81%

VFMF: World Modeling by Forecasting Vision Foundation Model Features

VFMF:通过预测视觉基础模型特征进行世界建模

Gabrijel Boduljak, Yushi Lan, Christian Rupprecht, Andrea Vedaldi

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13161 2025-12-15 cs.CL 79%

Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference

镜像推测解码:突破LLM推理中的串行壁垒

Nikhil Bhendawade, Kumari Nishu, Arnav Kundu, Chris Bartels, Minsik Cho, Irina Belousova

机构 * Apple(苹果公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 镜像推测解码通过并行异构执行和多令牌推测流式传输,突破LLM推理中的延迟-接受度权衡,实现高接受度低开销的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00862 2025-12-15 cs.LG cs.AI 79%

HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs

HBLLM: 小波增强的高保真1位量化方法用于大语言模型

Ningning Chen, Weicai Ye, Ying Jiang

机构 * Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 HBLLM通过小波增强和结构感知分组策略,实现高保真1位量化,显著提升LLM的存储效率和量化保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11426 2025-12-15 cs.AI 77%

AgentBalance: Backbone-then-Topology Design for Cost-Effective Multi-Agent Systems under Budget Constraints

AgentBalance:在预算约束下为多智能体系统设计成本有效的Backbone-then-Topology架构

Shuowei Cai, Yansong Ning, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentBalance通过Backbone-then-Topology设计,在预算约束下提升多智能体系统的成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11261 2025-12-15 cs.CL 77%

Leveraging LLMs for Title and Abstract Screening for Systematic Review: A Cost-Effective Dynamic Few-Shot Learning Approach

利用LLMs进行系统综述的标题和摘要筛选:一种成本效益高的动态少样本学习方法

Yun-Chung Liu, Rui Yang, Jonathan Chong Kai Liew, Ziran Yin, Henry Foote, Christopher J. Lindsell, Chuan Hong

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种动态少样本学习方法,利用低成本和高性能LLM进行系统综述的标题和摘要筛选,以提高效率并降低成本。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10061 2025-12-15 cs.LG 77%

Text2Graph: Combining Lightweight LLMs and GNNs for Efficient Text Classification in Label-Scarce Scenarios

Text2Graph:结合轻量级LLM和GNN用于标签稀缺场景中的高效文本分类

João Lucas Luz Lima Sarcinelli, Ricardo Marcondes Marcacini

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Text2Graph通过结合轻量级LLM和GNN,为标签稀缺场景提供高效的文本分类方法,兼顾性能与可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11135 2025-12-15 cs.CR 75%

Network and Compiler Optimizations for Efficient Linear Algebra Kernels in Private Transformer Inference

用于私有Transformer推理的网络和编译器优化以提高线性代数内核效率

Karthik Garimella, Negar Neda, Austin Ebel, Nandan Kumar Jha, Brandon Reagen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过网络和编译器优化提升FHE环境下Transformer推理的效率,发现BSGS方法比打包行方法快13.7倍,并通过剪枝策略减少FHE运行时间11.46倍。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11783 2025-12-15 cs.CR cs.AI 70%

Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously

超后缀:同时绕过文本生成对齐和防护模型

Andrew Adiletta, Kathryn Adiletta, Kemal Derya, Berk Sunar

机构 * MITRE(MITRE公司) Worcester Polytechnic Institute(沃斯顿理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出超后缀技术,通过联合优化绕过Llama Prompt Guard 2,同时提出DeltaGuard检测方法提升对抗性提示防御效果。

Comments 13 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11718 2025-12-15 cs.CL 70%

Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks

投机解码速度光速:通过分支随机游走建立最优下界

Sergey Pankratov, Dan Alistarh

机构 * ISTA Red Hat AI(红帽AI)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分支随机游走分析,研究确定了投机解码算法的最优运行时间下界,并通过实验验证了理论结果的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11564 2025-12-15 cs.HC 67%

Say it or AI it: Evaluating Hands-Free Text Correction in Virtual Reality

说它或AI它:评估虚拟现实中的无手文本校正

Ziming Li, Joffrey Guilmet, Suzanne Sorli, Hai-Ning Liang, Diego Monteiro

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文探讨了在虚拟现实中无手文本校正中AI相较于语音输入的可用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10977 2025-12-15 cs.DC cs.AR cs.PL 67%

Agentic Operator Generation for ML ASICs

面向ML ASICs的代理操作生成

Alec M. Hammond, Aram Markosyan, Aman Dontula, Simon Mahns, Zacharias Fisches, Dmitrii Pedchenko, Keyur Muzumdar, Natacha Supper, Mark Saroufim, Joe Isaacson, Laura Wang, Warren Hunt, Kaustubh Gondkar, Roman Levenstein, Gabriel Synnaeve, Richard Li, Jacob Kahn, Ajit Mathews

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 TritorX通过代理AI系统生成适用于新兴加速器平台的PyTorch ATen内核,强调覆盖范围和正确性,成功生成481个内核并通过测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19112 2025-12-15 cs.LG cs.AI 62%

Towards Practical Multi-label Causal Discovery in High-Dimensional Event Sequences via One-Shot Graph Aggregation

通过一次图聚合实现高维事件序列中实用的多标签因果发现

Hugo Math, Rainer Lienhart

机构 * BMW Group(宝马集团) Chair for Machine Learning and Computer Vision, Augsburg University(机器学习与计算机视觉主任,艾尔堡大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 CARGO通过一次图聚合方法,在高维事件序列中实现高效的多标签因果发现,适用于医疗和车辆诊断等复杂场景。

Comments Accepted at NeurIPS2025 Workshop on Structured Probabilistic Inference and Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03343 2025-12-15 cs.CL cs.AI 62%

Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning

Idea-Gated Transformers: 通过可微分词汇修剪强制语义一致性

Darshan Fofadiya

机构 * Darshan Fofadiya(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Gated Transformers通过可微分词汇修剪机制,实现语义一致性,提升语言模型的领域保留能力与生成可控性。

Comments Code available at https://github.com/DarshanFofadiya/idea-gated-transformers/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08838 2025-12-15 cs.CL q-bio.QM 57%

PUMA: Discovery of Protein Units via Mutation-Aware Merging

PUMA:通过突变感知合并发现蛋白质单元

Burak Suyunu, Özdeniz Dolu, Ibukunoluwa Abigail Olaosebikan, Hacer Karatas Bristow, Arzucan Özgür

机构 * Department of Computer Engineering, Boğaziçi University(计算机工程系,博雅大学) C. Eugene Bennett Department of Chemistry, West Virginia University(C. Eugene Bennett化学系,西弗吉尼亚大学) Department of Pharmaceutical Chemistry, Istanbul Medipol University, Faculty of Pharmacy(药学系,伊斯坦布尔Medipol大学) Istanbul Medipol University, Research Institute for Health Sciences and Technologies (SABITA)(伊斯坦布尔Medipol大学,健康科学与技术研究所)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 PUMA通过突变感知合并算法发现具有进化意义的蛋白质单元,构建了基于进化关系的谱系结构,为理解生命语言提供结构化方法。

Comments 18 pages, 12 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20975 2025-12-15 cs.DC 50%

Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows

Aragog: 为可扩展的代理工作流服务的即时模型路由

Yinwei Dai, Zhuofu Chen, Anand Iyer, Ravi Netravali

专题命中 效率与部署 :LLM(abstract)

AI总结 Aragog通过动态配置调整提升工作流服务吞吐量和降低延迟,保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15066 2025-12-15 cs.MA cs.IR 50%

Osprey: Production-Ready Agentic AI for Safety-Critical Control Systems

Osprey:面向安全关键控制系统的生产级代理AI

Thorsten Hellert, João Montenegro, Antonin Sulc

专题命中 效率与部署 :language model(abstract)

AI总结 Osprey通过四种机制解决安全关键控制系统的协调与安全问题,展示在先进光源中的生产应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 50%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 效率与部署 :language model(abstract)

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏