arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-16 至 2026-02-16 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 34 篇

2602.12618 2026-02-16 cs.CV cs.AI cs.CL 90%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03262 2026-02-16 cs.CV cs.AI 89%

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

探究多模态大语言模型中多个视觉编码器的冗余性

Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。

Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12962 2026-02-16 cs.AR cs.AI 88%

TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design

TriGen:基于软硬件协同设计的NPU架构,用于大型语言模型的端到端加速

Jonghun Lee, Junghoon Lee, Hyeonjin Kim, Seoho Jeon, Jisup Yoon, Hyunbin Park, Meejeong Park, Heonjae Ha

机构 * Gachon University(高丽大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 TriGen通过软硬件协同设计,提出了一种针对资源受限环境的NPU架构,实现大型语言模型的端到端加速,平均性能提升2.73倍,内存传输减少52%。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12674 2026-02-16 cs.CL 88%

$\mathcal{X}$-KD: General Experiential Knowledge Distillation for Large Language Models

$\mathcal{X}$-KD:用于大型语言模型的通用经验知识蒸馏

Yuang Cai, Yuyu Yuan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出$\mathcal{X}$-KD,通过模拟教师的原始学习环境,提升大型语言模型的蒸馏效果,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20101 2026-02-16 cs.DC cs.AI 88%

PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving

PlanetServe: 一种去中心化、可扩展且隐私保护的叠加层,用于民主化大语言模型服务

Fei Fang, Yifan Hua, Shengze Wang, Ruilin Zhou, Yi Liu, Chen Qian, Xiaoxue Zhang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Nevada, Reno(内华达大学拉森)

专题命中 效率与部署 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 PlanetServe通过去中心化叠加层提升大语言模型服务的可扩展性和隐私保护,实现服务效率与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07675 2026-02-16 cs.LG 85%

Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation

语义缓存用于低成本LLM服务:从离线学习到在线适应

Xutong Liu, Baran Atalar, Xiangxiang Dai, Jinhang Zuo, Siwei Wang, John C. S. Lui, Wei Chen, Carlee Joe-Wong

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于学习的语义缓存框架,解决LLM服务中的缓存淘汰问题,通过离线优化和在线学习方法,在未知查询和成本分布下实现高效缓存管理。

Comments Accepted to INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12630 2026-02-16 cs.CR cs.AI 85%

TensorCommitments: A Lightweight Verifiable Inference for Language Models

张量承诺:一种轻量级可验证的语言模型推断

Oguzhan Baser, Elahe Sadeghi, Eric Wang, David Ribeiro Alves, Sam Kazemian, Hong Kang, Sandeep P. Chinchali, Sriram Vishwanath

机构 * The University of Texas at Austin(德克萨斯大学) Georgia Institute of Technology(佐治亚理工学院) Theseus AI Labs(Theseus AI实验室) McGill University(麦吉尔大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 张量承诺通过轻量级的证明方案实现可验证的语言模型推断,提高对抗性攻击的鲁棒性。

Comments 23 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12528 2026-02-16 cs.IR cs.CL 85%

DiffuRank: Effective Document Reranking with Diffusion Language Models

DiffuRank: 基于扩散语言模型的有效文档重排序

Qi Liu, Kun Ai, Jiaxin Mao, Yanzhao Zhang, Mingxin Li, Dingkun Long, Pengjun Xie, Fengbin Zhu, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 DiffuRank利用扩散语言模型改进文档重排序,通过三种策略提升效率和可控性,实验表明其性能可与自回归模型媲美。

Comments The code is available at https://github.com/liuqi6777/DiffusionRank

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12318 2026-02-16 cs.LG 83%

Abstractive Red-Teaming of Language Model Character

语言模型特征的抽象式红队测试

Nate Rahn, Allison Qi, Avery Griffin, Jonathan Michala, Henry Sleight, Erik Jones

机构 * Anthropic Fellows Program(Anthropic Fellow计划) McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克AI研究所) MATS Program(MATS计划) Anthropic

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本研究提出抽象式红队测试方法,通过高效算法发现语言模型在部署中可能违反特征规范的查询类别,验证了模型在特定场景下的行为一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02083 2026-02-16 cs.CR cs.AI cs.CY 83%

Watermarking Discrete Diffusion Language Models

对离散扩散语言模型进行水印标记

Avi Bagchi, Akhil Bhimaraju, Moulik Choraria, Daniel Alabi, Lav R. Varshney

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Stony Brook University(石溪大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出了一种针对离散扩散语言模型的水印标记方法,通过保持分布的Gumbel-max采样技巧和序列位置播种随机性,实现了可靠检测和无失真水印。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12669 2026-02-16 cs.PF 82%

Characterize LSM-tree Compaction Performance via On-Device LLM Inference

通过设备端LLM推理特性化LSM树压缩性能

Jiabiao Ding, Yina Lv, Qiao Li, Zhirong Shen, Chun Jason Xue

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文通过设备端LLM推理特性化LSM树压缩性能,评估不同规模LLM在调优与延迟间的权衡,并针对RocksDB v8.8.1优化键压缩参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12470 2026-02-16 cs.LG cs.AI 81%

Designing RNAs with Language Models

用语言模型设计RNA

Milan Gautam, Ning Dai, Tianshuo Zhou, Bowen Xie, David Mathews, Liang Huang

机构 * School of EECS Dept. of Biochemistry \& Biophysics , Oregon State University , USA Center for RNA Biology Computational Biology , University of Rochester Medical Center , USA

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出用自回归语言模型进行RNA设计,通过监督学习和强化学习优化,实现高效生成目标结构的序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11287 2026-02-16 cs.LG cs.AI cs.AR 81%

HiFloat4 Format for Language Model Inference

HiFloat4格式用于语言模型推断

Yuanyong Luo, Jing Huang, Yu Cheng, Ziwei Yu, Kaihua Tang, Xinda Ma, Xin Wang, Anping Tong, Guipeng Hu, Yun Xu, Mehran Taghian, Peng Wu, Guanglin Li, Yunke Peng, Tianchi Hu, Minqi Chen, Michael Bi Mi, Hu Liu, Xiping Zhou, Junsong Wang, Qiang Lin, Heng Liao

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 HiFloat4通过优化块浮点格式提升语言模型推断的精度与效率,减少硬件资源消耗。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 80%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12685 2026-02-16 cs.CL cs.AI cs.LG 80%

ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction

ToolACE-MT:非自回归生成用于代理多轮交互

Xingshan Zeng, Weiwen Liu, Lingzhi Wang, Liangyou Li, Fei Mi, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolACE-MT通过非自回归生成方法高效构建高质量多轮代理对话,解决传统自回归方法效率低下的问题。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06014 2026-02-16 cs.CV cs.LG 79%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11850 2026-02-16 cs.AI 79%

EvoCut: Strengthening Integer Programs via Evolution-Guided Language Models

EvoCut:通过进化引导的语言模型强化整数规划

Milad Yazdani, Mahdi Mostajabdaveh, Samin Aref, Zirui Zhou

机构 * University of British Columbia(不列颠哥伦比亚大学) Huawei Technologies Canada(华为技术加拿大分公司) University of Toronto(多伦多大学)

专题命中 效率与部署 :language model(title);LLM(abstract);分类 cs.AI

AI总结 EvoCut通过进化引导的语言模型自动生成整数规划的加速切割,显著提升求解效率和最优性间隙缩减效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12526 2026-02-16 cs.LG cs.CL 79%

Constraint-Rectified Training for Efficient Chain-of-Thought

约束校正训练用于高效的推理链

Qinhang Wu, Sen Lin, Ming Zhang, Yingbin Liang, Ness B. Shroff

机构 * The Ohio State University(俄亥俄州立大学) University of Houston(休斯顿大学) Google(谷歌)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 CRT通过约束校正训练提升推理效率,减少冗余并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12432 2026-02-16 cs.HC 78%

KeySense: LLM-Powered Hands-Down, Ten-Finger Typing on Commodity Touchscreens

KeySense: 基于LLM的双手下十指触屏输入

Tony Li, Yan Ma, Zhuojun Li, Chun Yu, IV Ramakrishnan, Xiaojun Bi

专题命中 效率与部署 :LLM(title,abstract)

AI总结 KeySense通过认知-运动时间模式和微调LLM解码器,实现高效的十指触屏输入,无需额外硬件。

Comments 16 pages, 11 figures. Accepted to appear in the Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026). This version corresponds to the accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13786 2026-02-16 eess.SP 78%

Efficient Quantization-Aware Neural Receivers: Beyond Post-Training Quantization

高效量化感知神经接收机:超越后训练量化

SaiKrishna Saketh Yellapragada, Esa Ollila, Mario Costa

专题命中 效率与部署 :post-training(title,abstract)

AI总结 本文提出了一种基于量化感知训练的神经接收机方法,通过在超低位宽下实现鲁棒性,展示了在6G边缘设备中实现低复杂度和实时处理的潜力。

Comments Accepted for 51st International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11079 2026-02-16 cs.AI 77%

Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows

面向查询难度的代理 orchestration 为查询特定的多代理工作流

Jinwei Su, Qizhen Lan, Yinghui Xia, Lifan Sun, Weiyou Tian, Tianyu Shi, Xinyuan Song, Lewei He, Yang Jingsong

机构 * South China Normal University(华南师范大学) The University of Texas Health Science Center(德克萨斯大学健康科学中心) The Hong Kong University of Science(香港科学大学) University of California(加州大学) Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出难度感知的代理 orchestration 方法,通过动态生成查询特定的多代理工作流,提升查询处理的准确性和效率。

Comments Accepted to WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12609 2026-02-16 cs.CV cs.AI 77%

QuEPT: Quantized Elastic Precision Transformers with One-Shot Calibration for Multi-Bit Switching

QuEPT:具有单次校准的弹性精度变换器多比特切换

Ke Xu, Yixin Wang, Zhongcheng Li, Hao Cui, Jinshui Hu, Xingyi Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 QuEPT通过单次校准实现多比特切换,结合多比特标记融合和级联低秩适配器提升后训练量化性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12988 2026-02-16 cs.LG 70%

Optimal Formats for Weight Quantisation

权重量化最优格式

Douglas Orr, Luka Ribar, Carlo Luschi

机构 * Graphcore Research(Graphcore研究)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种系统设计和分析量化格式的框架,通过最小化KL散度和平方量化误差,优化位宽分配,提升大语言模型的效率。

Comments 36 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12579 2026-02-16 cs.CR cs.CL 70%

Provable Secure Steganography Based on Adaptive Dynamic Sampling

可证明安全的自适应动态采样隐写术

Kaiyi Pang, Minhao Bai

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于自适应动态采样的可证明安全隐写术方法,通过无需显式分布的模型API实现高效隐蔽通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07871 2026-02-16 cs.SE 67%

HerAgent: Rethinking the Automated Environment Deployment via Hierarchical Test Pyramid

HerAgent: 通过分层测试金字塔重新思考自动化环境部署

Xiang Li, Siyu Lu, Federica Sarro, Claire Le Goues, He Ye

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 HerAgent通过分层测试金字塔方法,利用执行验证和修复实现自动化环境部署,显著提升环境配置成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10037 2026-02-16 q-bio.OT cs.IR 67%

The Cell Ontology in the age of single-cell omics

单细胞组学时代中的细胞本体

Shawn Zheng Kai Tan, Aleix Puig-Barbe, Damien Goutte-Gattat, Caroline Eastwood, Brian Aevermann, Alida Avola, James P Balhoff, Ismail Ugur Bayindir, Jasmine Belfiore, Anita Reane Caron, David S Fischer, Nancy George, Benjamin M Gyori, Melissa A Haendel, Charles Tapley Hoyt, Huseyin Kir, Tiago Lubiana, Nicolas Matentzoglu, James A Overton, Beverly Peng, Bjoern Peters, Ellen M Quardokus, Patrick L Ray, Paola Roncaglia, Andrea D Rivera, Ray Stefancsik, Wei Kheng Teh, Sabrina Toro, Nicole Vasilevsky, Chuan Xu, Yun Zhang, Richard H Scheuermann, Christopher J Mungall, Alexander D Diehl, David Osumi-Sutherland

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文介绍了细胞本体在单细胞组学中的应用,包括其在数据整合中的作用以及与人类细胞图谱等项目的合作,同时探讨了如何利用LLMs提升CL工作流的效率。

Comments 48 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09567 2026-02-16 cs.CL cs.AI 62%

MorphNLI: A Stepwise Approach to Natural Language Inference Using Text Morphing

MorphNLI:一种通过文本变形进行自然语言推理的分步方法

Vlad Andrei Negru, Robert Vacareanu, Camelia Lemnaru, Mihai Surdeanu, Rodica Potolea

机构 * Technical University of Cluj-Napoca(克卢日-纳波卡技术大学) University of Arizona(亚利桑那大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 MorphNLI通过文本变形逐步改进自然语言推理任务,在跨领域场景中显著优于现有基线模型。

Comments 16 pages, 11 figures, 8 tables. Accepted for NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12342 2026-02-16 cs.LG cs.AI 62%

Intrinsic Credit Assignment for Long Horizon Interaction

长期交互中的内在信用分配

Ilze Amanda Auzina, Joschka Strüber, Sergio Hernández-Gutiérrez, Shashwat Goel, Ameya Prabhu, Matthias Bethge

机构 * Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ΔBelief-RL,通过内在ΔBelief奖励实现长期交互中的信用分配,提升强化学习在不确定性环境下的性能。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19093 2026-02-16 cs.LG 57%

Weight Decay may matter more than muP for Learning Rate Transfer in Practice

权重衰减可能比muP对学习率转移更重要

Atli Kosson, Jeremy Welborn, Yang Liu, Martin Jaggi, Xi Chen

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) EPFL(瑞士联邦理工学院)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 研究发现权重衰减在学习率转移中比muP更有效,挑战了传统观点并解释了muP对独立权重衰减的依赖。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12510 2026-02-16 cs.IR cs.CV cs.LG 57%

Visual RAG Toolkit: Scaling Multi-Vector Visual Retrieval with Training-Free Pooling and Multi-Stage Search

视觉RAG工具包:通过无训练池化和多阶段搜索扩展多向量视觉检索

Ara Yeroyan

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 视觉RAG工具包通过无训练池化和多阶段搜索提升多向量视觉检索效率,减少向量存储并提高检索吞吐量。

Comments 4 pages, 3 figures. Submitted to SIGIR 2026 Demonstrations Track. Project website: https://github.com/Ara-Yeroyan/visual-rag-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏