arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 29 篇

2512.13194 2025-12-18 cs.CL cs.AI 88%

Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models

高效自适应拒绝采样用于加速大语言模型中的推测解码

Chendong Sun, Ali Mao, Lei Xu, mingmin Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出高效自适应拒绝采样方法,通过动态调整接受阈值减少随机拒绝,提升大语言模型推测解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14717 2025-12-18 cs.LG 88%

Is GPT-OSS All You Need? Benchmarking Large Language Models for Financial Intelligence and the Surprising Efficiency Paradox

GPT-OSS真的足够吗?对大型语言模型进行金融智能评估及令人惊讶的效率悖论

Ziqian Bi, Danyang Zhang, Junhao Song, Chiung-Yi Tseng

机构 * Purdue University(普渡大学) Independent Researcher(独立研究者) Imperial College London(帝国理工学院伦敦分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文评估了GPT-OSS在金融NLP任务中的表现,发现较小的模型在效率和性能上优于更大的竞争对手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14946 2025-12-18 cs.OS cs.AI cs.LG 86%

EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving

EVICPRESS: 多存储层级的KV缓存联合压缩与驱逐以提高LLM服务效率

Shaoting Feng, Yuhan Liu, Hanchen Li, Xiaokun Chen, Samuel Shen, Kuntai Du, Zhuohan Gu, Rui Zhang, Yuyang Huang, Yihua Cheng, Jiayi Yao, Qizheng Zhang, Ganesh Ananthanarayanan, Junchen Jiang

机构 * University of Chicago(芝加哥大学) UC Berkeley(伯克利大学) Tensormesh, Inc.(Tensormesh公司) MIT(麻省理工学院) UC Santa Cruz(圣克拉拉大学) Stanford(斯坦福大学) Microsoft(微软公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EVICPRESS通过联合优化KV缓存压缩与驱逐策略,提高LLM服务效率,实现更低延迟和高质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15343 2025-12-18 cs.HC cs.AI cs.CY 85%

Exploring User Acceptance and Concerns toward LLM-powered Conversational Agents in Immersive Extended Reality

探索沉浸式扩展现实中基于大语言模型的对话代理用户接受度与担忧

Efe Bozkir, Enkelejda Kasneci

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了沉浸式扩展现实中基于大语言模型的对话代理的用户接受度与担忧,发现熟悉度和性别影响接受度,位置数据敏感性最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15358 2025-12-18 cs.CL 83%

Dual-Density Inference for Efficient Language Model Reasoning

双密度推理用于高效语言模型推理

Zhengyi Zhao, Shubo Zhang, Yuxi Zhang, Huimin Wang, Binyang Li, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 Denser通过双密度推理框架,优化语言模型在推理和回答阶段的信息密度,减少token消耗达62%,提升复杂推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 82%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 82%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 效率与部署 :language model(title,abstract);small language model(abstract)

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14954 2025-12-18 cs.CL cs.LG 81%

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

跨分词器似然评分算法用于语言模型蒸馏

Buu Phan, Ashish Khisti, Karen Ullrich

机构 * University of Toronto(多伦多大学) Meta AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出跨分词器似然评分算法,通过BPE递归结构解决词汇不匹配问题,提升蒸馏效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15335 2025-12-18 cs.LG cs.CR 79%

Bits for Privacy: Evaluating Post-Training Quantization via Membership Inference

比特与隐私:通过成员推断评估训练后量化

Chenxiang Zhang, Tongxi Qu, Zhong Li, Tian Zhang, Jun Pang, Sjouke Mauw

机构 * Department of Computer Science University of Luxembourg(计算机科学系卢森堡大学) Department of Computer Science Nanjing University(计算机科学系南京大学)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 研究通过成员推断攻击评估训练后量化在隐私和效用之间的平衡,发现低精度量化可显著降低隐私泄露风险,但会牺牲模型效用。

Comments accepted at TrustCom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15176 2025-12-18 cs.LG cs.AI 79%

DEER: Draft with Diffusion, Verify with Autoregressive Models

DEER:通过扩散模型草稿,通过自回归模型验证

Zicong Cheng, Guo-Wei Yang, Jia Li, Zhijie Deng, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DEER通过扩散模型草稿和自回归模型验证,实现高效推测解码,大幅提升解码速度和草稿长度。

Comments Homepage : https://czc726.github.io/DEER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24832 2025-12-18 cs.CL cs.AI 79%

SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching

SemShareKV: 通过令牌级LSH匹配实现语义相似提示的高效KV缓存共享

Xinye Zhao, Spyridon Mastorakis

机构 * University of Notre Dame(诺特大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SemShareKV通过语义相似提示的令牌级LSH匹配实现高效KV缓存共享,提升LLM推理速度并降低内存占用。

Comments 11 figures, 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10021 2025-12-18 cs.CL cs.AI 79%

LATTE: Learning Aligned Transactions and Textual Embeddings for Bank Clients

LATTE:学习对齐的交易和文本嵌入以用于银行客户

Egor Fadeev, Dzhambulat Mollaev, Aleksei Shestov, Omar Zoloev, Artem Sakhno, Dmitry Korolev, Ivan Kireev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院可信人工智能研究信息中心) NUST MISIS(莫斯科国立信息安全大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LATTE通过对比学习对齐原始事件嵌入与冻结LLM的语义嵌入,有效降低计算成本并提升银行客户序列表示学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15705 2025-12-18 cs.DC cs.LG 77%

Dynamic Rebatching for Efficient Early-Exit Inference with DREX

动态重新分组以实现高效的早退推理

Xuting Liu, Daniel Alexander, Siva Kesava Reddy Kakarla, Behnaz Arzani, Vincent Liu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DREX通过动态重新分组和优化策略提升早退推理效率,提高吞吐量并保障输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18916 2025-12-18 cs.LG cs.DB 77%

HI-SQL: Optimizing Text-to-SQL Systems through Dynamic Hint Integration

HI-SQL:通过动态提示集成优化文本到SQL系统

Ganesh Parab, Zishan Ahmad, Dagnachew Birru

机构 * Quantiphi Analytics Solutions Pvt Ltd(Quantiphi分析解决方案私人有限公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 HI-SQL通过动态提示集成优化文本到SQL系统,提升查询准确性和效率。

Comments Accepted at International Joint Conference on Neural Networks (IJCNN), IEEE, 2025

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15306 2025-12-18 cs.DC cs.LG 74%

LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs

LLMQ:面向消费级GPU的高效低精度预训练

Erik Schultheis, Dan Alistarh

机构 * IST Austria(奥地利因斯布鲁克理工大学)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 LLMQ通过优化消费级GPU的内存和通信瓶颈,实现了高效低精度语言模型的训练,无需额外算法近似,可在中端显卡上训练大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15312 2025-12-18 cs.CL 74%

Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution

通过推测解码和NPU协同执行加速移动语言模型

Zhiyang Chen, Daliang Xu, Haiyang Shen, Chiheng Lou, Mengwei Xu, Shangguang Wang, Xin Jin, Yun Ma

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :language model(title);分类 cs.CL

AI总结 本文提出sd.npu框架,通过推测解码和NPU协同执行,提升移动设备RAG任务的效率与能耗表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14719 2025-12-18 cs.LG cs.AI 73%

Hybrid Attribution Priors for Explainable and Robust Model Training

混合归因先验用于可解释和鲁棒模型训练

Zhuoran Zhang, Feng Zhang, Shangyuan Li, Yang Shi, Yuanxing Zhang, Wei Chen, Tengjiao Wang, Kam-Fai Wong

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Key Lab of High Confidence Software Technologies, Peking University(北京大学高可信软件技术重点实验室) Kling Team(Kling团队) Department of Systems Engineering and Engineering Management, CUHK(CUHK系统工程与工程管理系)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAP Hybrid方法,通过结合CAP与现有归因技术,提升模型的可解释性和鲁棒性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23049 2025-12-18 cs.LG cs.CL 73%

DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration

DenoiseRotator: 通过重要性集中增强大语言模型的剪枝鲁棒性

Tianteng Gu, Bei Liu, Bo Xiao, Ke Zeng, Jiacheng Liu, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Meituan(美团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DenoiseRotator通过重要性集中提升大语言模型剪枝鲁棒性,采用可学习正交变换优化参数重要性分布,有效减少稀疏性约束下的性能下降。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15302 2025-12-18 cs.CL 70%

Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues

通过用户个性化配置实现对话中的前瞻性个性化

Xiaotian Zhang, Yuan Wang, Ruizhe Chen, Zeya Wang, Runchen Hou, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PersonalAgent,通过构建和动态完善用户档案,实现对话中的长期个性化和用户偏好推断,提升对话代理的适应性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25155 2025-12-18 cs.DC cs.LG 70%

Context-Driven Performance Modeling for Causal Inference Operators on Neural Processing Units

面向神经处理单元的因果推断运算上下文驱动性能建模

Neelesh Gupta, Rakshith Jayanth, Dhruv Parikh, Viktor Prasanna

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希德电气与计算机工程系,南加州大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了NPUs上因果推断运算的性能瓶颈,通过对比二次注意力与子二次替代方案,为边缘平台的高效长上下文推断提供优化方向。

Comments IEEE HiPC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15275 2025-12-18 cs.CR 67%

Bounty Hunter: Autonomous, Comprehensive Emulation of Multi-Faceted Adversaries

Bounty Hunter: 自主、全面的多面对手模拟

Louis Hackländer-Jansen, Rafael Uetz, Martin Henze

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 Bounty Hunter是一种自动化对手模拟工具,通过Caldera平台实现自主、全面的多面对手模拟,提升安全评估和入侵检测研究的效率与真实性。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14879 2025-12-18 cs.LG cs.AI 62%

Entropy-Reservoir Bregman Projection: An Information-Geometric Unification of Model Collapse

熵-蓄水池Bregman投影:信息几何统一模型崩溃

Jingwei Chen

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 ERBP通过信息几何框架统一模型崩溃现象,提供熵流监控和预算的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14796 2025-12-18 eess.IV cs.AI cs.CV cs.LG 62%

Magnification-Aware Distillation (MAD): A Self-Supervised Framework for Unified Representation Learning in Gigapixel Whole-Slide Images

放大意识蒸馏(MAD):一种用于吉像素整张图像统一表征学习的自监督框架

Mahmut S. Gokmen, Mitchell A. Klusty, Peter T. Nelson, Allison M. Neltner, Sen-Ching Samson Cheung, Thomas M. Pearce, David A Gutman, Brittany N. Dugger, Devavrat S. Bisht, Margaret E. Flanagan, V. K. Cody Bumgardner

机构 * Center for Applied Artificial Intelligence, University of Kentucky(应用人工智能中心,肯塔基大学) Sanders-Brown Center on Aging, University of Kentucky(老龄化桑德斯-布朗中心,肯塔基大学) Department of Electrical and Computer Engineering, University of Kentucky(电气与计算机工程系,肯塔基大学) Division of Neuropathology, University of Pittsburgh(神经病理学部,匹兹堡大学) Department of Biomedical Informatics, Emory University(生物医学信息学系,埃默里大学) Department of Pathology and Laboratory Medicine, University of California Davis(病理学与实验室医学系,加州大学戴维斯分校) Department of Laboratory Medicine and Pathology, University of Texas Health(实验室医学与病理学系,德克萨斯大学健康科学中心)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 MAD通过跨尺度对应关系学习吉像素整张图像的统一表征,实现放大不变的表征学习和分割一致性。

Comments 10 pages, 4 figures, 5 tables, submitted to AMIA 2026 Informatics Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14090 2025-12-18 cs.LG cs.AI 62%

Arithmetic-Intensity-Aware Quantization

算力感知量化

Taig Singh, Shreshth Rajan, Nikhil Jain

机构 * Harvard College(哈佛学院)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 AIQ通过动态调整每层位宽提升算力并保持精度,适用于内存受限的神经网络模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14993 2025-12-18 cond-mat.mtrl-sci cs.LG 57%

Efficient Nudged Elastic Band Method using Neural Network Bayesian Algorithm Execution

利用神经网络贝叶斯算法执行的高效受迫弹性带方法

Pranav Kakhandiki, Sathya Chitturi, Daniel Ratner, Sean Gasiorowski

机构 * SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出NN-BAX框架,通过神经网络联合学习能量景观和MEP,显著降低计算成本并提升效率。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 50%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15002 2025-12-18 cs.NE 50%

Dense Associative Memories with Analog Circuits

具有模拟电路的密集关联记忆

Marc Gong Bacvanski, Xincheng You, John Hopfield, Dmitry Krotov

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出了一种基于模拟电路的DenseAM加速器,实现了在模型大小不变的情况下恒定时间推断,展示了模拟DenseAM在高效大规模推断中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13421 2025-12-18 cs.CV 50%

RecTok: Reconstruction Distillation along Rectified Flow

RecTok: 修复流中的重建蒸馏

Qingyu Shi, Size Wu, Jinbin Bai, Kaidong Yu, Yujing Wang, Yunhai Tong, Xiangtai Li, Xuelong Li

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) TeleAI

专题命中 效率与部署 :foundation model(abstract)

AI总结 RecTok通过流语义蒸馏和重建-对齐蒸馏提升高维视觉分词器的重建和生成性能,实现更丰富的潜在空间结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05170 2025-12-18 cs.CV 50%

MUSE: Multi-Scale Dense Self-Distillation for Nucleus Detection and Classification

MUSE:多尺度密集自蒸馏用于核检测与分类

Zijiang Yang, Hanqing Chao, Bokai Zhao, Yelin Yang, Yunshuo Zhang, Dongmei Fu, Junping Zhang, Le Lu, Ke Yan, Dakai Jin, Minfeng Xu, Yun Bian, Hui Jiang

机构 * DAMO Academy, Alibaba Group(阿里集团 DAMO 院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 MUSE通过多尺度密集自蒸馏方法,有效解决组织病理学中核检测与分类的核心挑战,提升细粒度核级表示能力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏