arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2604.02119 2026-04-03 cs.LG 88%

AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression

AA-SVD:面向大语言模型压缩的锚定与自适应SVD

Atul Kumar Sinha, François Fleuret

机构 * University of Geneva(日内瓦大学) FAIR, Meta(Meta FAIR)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种快速低秩因子分解框架,用于压缩大语言模型,实现无需重新训练的快速压缩。通过同时考虑原始输入和分布偏移,改进Transformer块的端到端压缩,减少输出失真并联合补偿累积误差,实验表明在高压缩率下优于现有SVD基方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03396 2026-04-03 cs.CL 88%

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

迈向抗蒸馏的大语言模型:信息论视角

Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文从信息论角度分析蒸馏防御问题,提出通过最小化条件互信息来提升模型抗蒸馏能力,设计变换矩阵净化输出以增强安全性,实验表明方法有效降低蒸馏性能并保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09176 2026-04-01 cs.LG 88%

$D^2Prune$: Sparsifying Large Language Models via Dual Taylor Expansion and Attention Distribution Awareness

$D^2Prune$:通过双重泰勒展开和注意力分布意识对大型语言模型进行稀疏化

Lang Xiong, Ning Liu, Ao Ren, Yuheng Bai, Haining Fang, BinYan Zhang, Zhe Jiang, Yujuan Tan, Duo Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出$D^2Prune$方法,通过双重泰勒展开和注意力分布意识,解决现有剪枝方法在激活分布偏移和注意力模块长尾分布方面的不足,提升模型压缩效果。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(32), 27171-27179, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25155 2026-03-27 cs.CV cs.AI 88%

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon:通过高效多模态大语言模型加速体积理解

Chengyu Fang, Heng Guo, Zheng Jiang, Chunming He, Xiu Li, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(湖畔实验室) Duke University(杜克大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 88%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19733 2026-03-23 cs.CL 88%

PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction

PoC:通过性能预测实现面向性能的上下文压缩

Runsong Zhao, Shilei Liu, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Yujin Yuan, Tong Xiao, Jingbo Zhu, Wenbo Su, Bo Zheng

机构 * Northeastern University, China(东北大学,中国) Tsinghua University(清华大学) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PoC方法,通过设定性能底线而非压缩比来优化大语言模型的上下文压缩,设计两种预测器并验证其在问答和摘要任务中的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17885 2026-03-23 cs.CV cs.LG 88%

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning

FastMMoE:通过动态专家激活和路由感知的标记剪枝加速多模态大语言模型

Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto(利亚自动化)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出FastMMoE,一种无需训练的加速框架,通过动态专家激活和路由感知标记剪枝,显著降低计算量并保持性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17809 2026-03-19 cs.CV cs.AI 88%

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 88%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10436 2026-03-16 cs.IR cs.AI 88%

Development of Ontological Knowledge Bases by Leveraging Large Language Models

通过利用大语言模型开发本体知识库

Le Ngoc Luyen, Marie-Hélène Abel, Philippe Gouspillou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型开发本体知识库的结构化迭代方法,通过案例研究展示加速本体构建、提升一致性及透明度的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23830 2026-03-13 cs.DC cs.AI 88%

OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training

OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练

Yijie Zheng, Bangjun Xiao, Lei Shi, Xiaoyang Li, Faming Wu, Tianyu Li, Xuefeng Xiao, Yang Zhang, Yuxuan Wang, Shouda Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08083 2026-03-10 cs.CL 88%

High-Fidelity Pruning for Large Language Models

大语言模型的高保真剪枝

Yijun Zhu, Jianxin Wang, Chengchao Shen

机构 * Central South University(中南大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出基于模型输出分布信息熵的高保真剪枝方法,有效提升大语言模型的剪枝效率和预测保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03081 2026-03-04 cs.CL 88%

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

TAO-Attack:迈向大型语言模型的高级优化基 Jailbreak 攻击

Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

机构 * Dalian University of Technology(大连理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 TAO-Attack 提出了一种基于优化的 Jailbreak 攻击方法,通过双阶段损失函数和方向优先 token 优化策略,有效提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16122 2026-03-03 cs.LG 88%

Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning Large Language Models

计划与预算:在推理大语言模型中实现有效且高效的测试时扩展

Junhong Lin, Xinyue Zeng, Jie Zhu, Song Wang, Julian Shun, Jun Wu, Dawei Zhou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 Plan-and-Budget通过分解复杂查询并动态分配token预算,提升大语言模型在推理任务中的效率与准确性。

Comments This work has been accepted to the ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19785 2026-03-03 cs.CL cs.CY 88%

Gender Bias in Emotion Recognition by Large Language Models

大语言模型在情绪认知中的性别偏见

Maureen Herbert, Katie Sun, Angelica Lim, Yasaman Etesam

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究探讨了大语言模型在情绪认知任务中的性别偏见问题,并提出基于训练的干预方法以减少偏见。

Comments Accepted at AAAI 2026 Workshop (WS37)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00364 2026-03-03 cs.CL 88%

Distribution-Aware Companding Quantization of Large Language Models

面向分布的扩增量化:大型语言模型

Athul Radhakrishnan, Siddhant Mohan, Mahima Sachdeva

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出一种多标记预测方法,通过提升样本效率和推理速度,显著提高大型语言模型在编码等生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11076 2026-03-03 cs.LG 88%

Addition is almost all you need: Compressing large language models with double binary factorization

加法几乎就够了:通过双重二进制分解压缩大语言模型

Vladimír Boža, Vladimír Macko

机构 * Faculty of Mathematics, Physics and Informatics(数学、物理与信息学系) Comenius University(科尼乌斯大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出双重二进制分解方法,通过分解权重矩阵为二进制矩阵乘积,实现高效压缩大语言模型,同时保持较高的精度和压缩率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07782 2026-03-02 cs.CL 88%

RCPU: Rotation-Constrained Error Compensation for Structured Pruning of Large Language Models

RCPU: 结构化剪枝中旋转约束的误差补偿

Shuichiro Haruta, Kazunori Matsumoto, Zhi Li, Yanan Wang, Mori Kurokawa

机构 * AI Division, KDDI Research, Inc.(KDDI研究公司人工智能部门)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出RCPU方法,通过旋转约束更新和方差感知评分,有效补偿结构化剪枝中的误差,提升LLM的性能。

Comments Accepted as ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15226 2026-02-27 cs.MM cs.CL 88%

Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models

并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习

Qiong Wu, Weihao Ye, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出高效注意力跳过方法,通过减少冗余注意力计算提升多模态大语言模型的推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 88%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16670 2026-02-24 cs.CR cs.AI 88%

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

BitHydra: 面向大语言模型的位翻转推理成本攻击

Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17497 2026-02-20 cs.LG 88%

Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models

回顾上下文学习用于大语言模型中的时间信用分配

Wen-Tse Chen, Jiayu Chen, Fahim Tajwar, Hao Zhu, Xintong Duan, Ruslan Salakhutdinov, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出利用大语言模型进行回顾上下文学习,以提高强化学习中时间信用分配的样本效率和泛化能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14492 2026-02-18 cs.CL cs.IR 88%

Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

查询作为锚点:通过大语言模型实现场景自适应的用户表示

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Ziyi Gao, Xiaotong Lin, Yun Liu, Xing Fu, Yu Cheng, Yongchao Liu, Weiqiang Wang, Zhongle Xie

机构 * Ant Group(蚂蚁集团) East China Normal University(东华大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过Query-as-Anchor框架,利用大语言模型实现动态查询感知的用户表示,提升工业级用户建模的场景适应性和性能表现。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10193 2026-02-17 cs.AI 88%

SAFER: Risk-Constrained Sample-then-Filter in Large Language Models

SAFER:在大语言模型中基于风险的采样-过滤方法

Qingni Wang, Yue Fan, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SAFER通过两阶段风险控制框架,在大语言模型中实现风险约束的采样与过滤,提升输出可信度与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13547 2026-02-17 cs.CR cs.AI 88%

AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks

AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识

Weiming Song, Xuan Xie, Ruiping Yin

机构 * Beijing University of Technology(北京理工大学) Macau University of Science and Technology(澳门科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12962 2026-02-16 cs.AR cs.AI 88%

TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design

TriGen:基于软硬件协同设计的NPU架构,用于大型语言模型的端到端加速

Jonghun Lee, Junghoon Lee, Hyeonjin Kim, Seoho Jeon, Jisup Yoon, Hyunbin Park, Meejeong Park, Heonjae Ha

机构 * Gachon University(高丽大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 TriGen通过软硬件协同设计,提出了一种针对资源受限环境的NPU架构,实现大型语言模型的端到端加速,平均性能提升2.73倍,内存传输减少52%。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12674 2026-02-16 cs.CL 88%

$\mathcal{X}$-KD: General Experiential Knowledge Distillation for Large Language Models

$\mathcal{X}$-KD:用于大型语言模型的通用经验知识蒸馏

Yuang Cai, Yuyu Yuan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出$\mathcal{X}$-KD,通过模拟教师的原始学习环境,提升大型语言模型的蒸馏效果,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20101 2026-02-16 cs.DC cs.AI 88%

PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving

PlanetServe: 一种去中心化、可扩展且隐私保护的叠加层,用于民主化大语言模型服务

Fei Fang, Yifan Hua, Shengze Wang, Ruilin Zhou, Yi Liu, Chen Qian, Xiaoxue Zhang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Nevada, Reno(内华达大学拉森)

专题命中 效率与部署 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 PlanetServe通过去中心化叠加层提升大语言模型服务的可扩展性和隐私保护,实现服务效率与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10147 2026-02-12 cs.SE cs.AI 88%

On the Use of a Large Language Model to Support the Conduction of a Systematic Mapping Study: A Brief Report from a Practitioner's View

在系统映射研究中使用大型语言模型以支持其开展:一名实践者视角的简要报告

Cauã Ferreira Barros, Marcos Kalinowski, Mohamad Kassab, Valdemar Vicente Graciano Neto

机构 * Federal University of Goiás\ Institute Goiânia Goiás Brazil Pontifical Catholic University of Rio de Janeiro\ of Informatics Rio de Janeiro Rio de Janeiro Brazil Boston University\ of Computer Science Boston Massachusetts USA Federal University of Goiás\ Institute Pontifical Catholic University of Rio de Janeiro\ of Informatics Boston University\ of Computer Science

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文从实践者视角报告了使用大型语言模型开展系统映射研究的经验,讨论了其在时间节省和数据标准化方面的优势,以及构建提示、幻觉和手动验证等挑战。

Comments 6 pages, includes 2 tables. Submitted and Accepted to the WSESE 2026 ICSE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13333 2026-02-10 cs.AI cs.NE math.OC 88%

HiFo-Prompt: Prompting with Hindsight and Foresight for LLM-based Automatic Heuristic Design

HiFo-Prompt: 基于前瞻性与回顾性的提示方法用于基于大语言模型的自动启发式设计

Chentong Chen, Mengyuan Zhong, Ye Fan, Jialong Shi, Jianyong Sun

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Xi’an, China(西安交通大学数学与统计学院) School of Electronics and Information, Northwest Polytechnical University, Xi’an, China(西北工业大学电子与信息学院)

专题命中 效率与部署 :LLM(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 HiFo-Prompt通过前瞻性与回顾性提示策略,提升基于大语言模型的自动启发式设计效率与质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏