arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2603.27914 2026-04-01 cs.LG cs.AI cs.DC 81%

ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing

ITQ3_S:通过交错三进制量化与旋转域平滑实现高保真3位LLM推理

Edward J. Yoon

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ITQ3_S,一种新的3位权重量化格式,通过FWHT预旋转空间,解决传统3位方法的精度损失问题,实现高保真LLM部署。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL 81%

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26675 2026-03-31 cs.CL cs.LG 81%

GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language Models

GeoBlock:从扩散语言模型中的依赖几何推断块粒度

Lipeng Wan, Junjie Ma, Jianhui Gu, Zeyang Liu, Xuyang Lu, Xuguang Lan

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 GeoBlock通过分析依赖几何推断块粒度,提升扩散语言模型的并行效率与依赖一致性。

Comments 13 pages, 4 figures, Code available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25403 2026-03-30 cs.CR cs.AI cs.LG 81%

Shape and Substance: Dual-Layer Side-Channel Attacks on Local Vision-Language Models

形状与物质:针对本地视觉-语言模型的双层侧信道攻击

Eyal Hadad, Mordechai Guri

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文针对本地视觉-语言模型的动态高分辨率预处理引入的算法侧信道,提出双层攻击框架,通过执行时间差异和缓存竞争分析,揭示隐私敏感内容的推理能力。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14549 2026-03-30 cs.CL cs.AI 81%

Dual-objective Language Models: Training Efficiency Without Overfitting

双目标语言模型:无需过拟合的训练效率

David Samuel, Lucas Georges Gabriel Charpentier

机构 * University of Oslo(奥斯陆大学) National Library of Norway(挪威国家图书馆)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文结合自回归和掩码扩散训练目标,提出灵活的语言模型,优于单一目标模型。通过训练50个模型,证明双目标训练在效率与抗过拟合间取得最佳平衡。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20721 2026-03-27 cs.CV cs.AI cs.LG cs.NE 81%

Foundry: Distilling 3D Foundation Models for the Edge

Foundry:为边缘设备蒸馏3D基础模型

Guillaume Letellier, Siddharth Srivastava, Frédéric Jurie, Gaurav Sharma

机构 * GREYC, Normandy University, Unicaen, ENSICAEN, UMR CNRS 6072(GREYC,诺曼底大学,卡昂大学,ENSICAEN,CNRS UMR 6072) IIT Delhi(印度理工学院德里分校) IIT Kanpur(印度理工学院坎普尔分校)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Foundry,一种蒸馏3D点云的大规模自监督学习模型的方法,通过压缩模型保留通用表示能力,使模型更适用于资源受限的边缘设备。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22984 2026-03-25 cs.LG cs.AI cs.SI 81%

Can Graph Foundation Models Generalize Over Architecture?

图基础模型能否在架构上泛化?

Benjamin Gutteridge, Michael Bronstein, Xiaowen Dong

机构 * University of Oxford(牛津大学) AITHYRA

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨图基础模型在架构适应性上的必要性,指出现有模型在任务依赖的架构属性上缺乏鲁棒性,并提出一种能适应任务特定线性图运算的框架,实现跨异构架构的零样本泛化。

Comments 9 pages main text + 18 pages references and appendix (27 pages total), 5 figures. Accepted to GRaM Workshop @ ICLR 2026: Workshop on Geometry-grounded Representation Learning and Generative Modeling (to appear in PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19296 2026-03-25 cs.LG cs.CL eess.SP 81%

TTQ: Activation-Aware Test-Time Quantization to Accelerate LLM Inference On The Fly

TTQ:激活感知的测试时间量化以加速LLM的实时推理

Toshiaki Koike-Akino, Jing Liu, Ye Wang

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 效率与部署 :LLM(title);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TTQ框架,在推理时动态压缩大模型,通过高效在线校准实现无需重训练的激活感知量化,提升推理速度并适应不同下游任务。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18179 2026-03-25 cs.LG cs.AI 81%

GAIA: A Foundation Model for Operational Atmospheric Dynamics

GAIA:一种用于操作大气动力学的基准模型

Ata Akbari Asanjan, Olivia Alexander, Tom Berg, Stephen Peng, Jad Makki, Clara Zhang, Matt Yang, Disha Shidham, Srija Chakraborty, William Bender, Cara Crawford, Arun Ravindran, Olivier Raiman, David Potere, David Bell

机构 * Research Institute for Advanced Computer Science (RIACS) at Universities Research Space Association (USRA)(大学研究空间协会(USRA)高级计算机科学研究所) BCG X AI Science Institute(BCG X AI科学研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 GAIA通过融合MAE与无标签自蒸馏,生成丰富的语义表示,提升大气动态建模的迁移能力,优于MAE基线在大气河流分割、热带气旋检测和降水估计中表现更优。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22248 2026-03-24 cs.LG cs.AI cs.IT math.IT stat.ML 81%

Confidence-Based Decoding is Provably Efficient for Diffusion Language Models

基于置信度的解码在扩散语言模型中具有可证明的效率

Changxiao Cai, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, The Chinese University of Hong Kong(统计与数据科学系,香港中文大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于熵和的解码策略,证明其在KL散度下具有ε精度,并在迭代次数上达到O(H(X0)/ε)的效率,适用于低熵数据分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20642 2026-03-24 cs.CL cs.AI 81%

Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models

Transformer幅度表示中的韦伯定律:高效编码、表示几何与语言模型中的心理物理定律

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了Transformer语言模型如何表示幅度,发现其表示几何具有对数压缩特性,但该几何与行为表现无关,且因果干预揭示了不同层的处理差异。

Comments 18 pages, 7 figures, 5 tables. Pre-registered on OSF. Submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01749 2026-03-24 cs.CY cs.AI cs.LG 81%

Towards Urban General Intelligence: A Review and Outlook of Urban Foundation Models

迈向城市通用智能:城市基础模型的综述与展望

Weijia Zhang, Jindong Han, Zhao Xu, Hang Ni, Tengfei Lyu, Hao Liu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Shandong University(山东大学) Shandong University China(山东大学中国)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了城市基础模型的发展,探讨了其定义、挑战及应用前景,提出了一种数据导向的分类框架,并汇总了相关基准和数据集,以推动城市通用智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24166 2026-03-19 cs.LG cs.AI 81%

Stable Forgetting: Bounded Parameter-Efficient Unlearning in Foundation Models

稳定遗忘:基础模型中的有界参数高效反遗忘

Arpit Garg, Hemanth Saratchandran, Ravi Garg, Simon Lucey

机构 * Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出稳定反遗忘方法,通过限制MLP适配器的权重动态,解决基础模型中反遗忘的不稳定问题,并在多个基准测试中验证其有效性。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16092 2026-03-18 cs.CV cs.AI cs.LG 81%

Parallel In-context Learning for Large Vision Language Models

大规模视觉语言模型的并行上下文学习

Shin'ya Yamaguchi, Daiki Chijiwa, Tamao Sakao, Taku Hasegawa

机构 * NTT(日本电信电话研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行上下文学习方法,通过将长上下文分割为短片段并行处理,提升大视觉语言模型的推理效率,同时保持性能与传统多模态上下文学习相当。

Comments Accepted to CVPR 2026 (Findings); Code is available at https://github.com/yshinya6/parallel-icl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16001 2026-03-18 cs.CV cs.CL cs.LG 81%

Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models

大部分文本,智能视觉:不对称文本-视觉剪枝用于大型视觉-语言模型

Sijie Li, Biao Qian, Jungong Han

机构 * University of Sheffield, UK(英国谢菲尔德大学) Tsinghua University, China(清华大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出不对称文本-视觉剪枝方法,通过解耦文本和视觉token的权重,发现文本路径需用文本token校准,视觉路径可实现50%稀疏率,验证了其在多模态基准上的优越性。

Comments CVPR 2026. Code available here: https://github.com/LezJ/ATV-Pruning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14591 2026-03-17 cs.LG cs.AI cs.IR 81%

FlashHead: Efficient Drop-In Replacement for the Classification Head in Language Model Inference

FlashHead: 语言模型推理中分类头的高效替换方案

Wilhelm Tranheden, Shahnawaz Ahmed, Devdatt Dubhashi, Jonna Matthiesen, Hannes von Essen

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FlashHead通过信息检索原理优化语言模型分类头,实现推理效率提升1.75倍,同时保持输出准确性,为更小的模型在消费级硬件上应用奠定基础。

Comments A collection of models with FlashHead optimization can be found at: https://huggingface.co/collections/embedl/flashhead

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13426 2026-03-17 cs.LG cs.AI 81%

Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference

面向结果的工具选择用于语义路由器:无LLM推理的延迟受限学习

Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) Tensormesh Inc / UChicago(Tensormesh公司/芝加哥大学) MBZUAI / McGill University(MBZUAI/麦吉尔大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出面向结果的工具选择方法OATS,通过插值工具嵌入向成功查询的质心,提升语义路由器的NDCG@5指标,同时在无额外计算开销的情况下优化工具选择。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17015 2026-03-17 cs.LG cs.AI cs.DC 81%

Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering

Justitia: 任务并行LLM代理的公平高效调度算法

Mingyan Yang, Guanjie Wang, Manqi Luo, Yifei Liu, Chen Chen, Han Zhao, Yu Feng, Quan Chen, Minyi Guo

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Justitia调度器,通过内存导向的成本量化和轻量预测方法,实现任务并行LLM代理的公平高效调度,实验表明其能显著提升调度效率并保持公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15511 2026-03-16 cs.LG cs.AI 81%

Language Models are Injective and Hence Invertible

语言模型是单射的,因此可逆

Giorgos Nikolaou, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli, Yannis Panagakis, Emanuele Rodolà

机构 * EPFL(苏黎世联邦理工学院) Sapienza University of Rome(罗马大学) Paradigma University of Athens(雅典大学) Archimedes/Athena RC, Greece(阿基米德/雅典研究中心,希腊)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究证明语言模型在映射离散序列到连续表示时是单射的,通过实验验证无碰撞,并提出SipIt算法实现精确逆向恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12634 2026-03-16 cs.LG cs.AI 81%

Spend Less, Reason Better: Budget-Aware Value Tree Search for LLM Agents

少花钱,多思考:基于预算的值树搜索用于大语言模型代理

Yushu Li, Wenlong Deng, Jiajin Li, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需训练的推理时框架,通过单个LLM骨干模型将多跳推理建模为动态搜索树,并引入预算条件的节点选择机制,以在预算耗尽时实现从广度探索到贪婪利用的平稳过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09566 2026-03-12 cs.AI cs.LG 81%

Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search

通过语言模型、性质对齐和战略搜索实现闭环分子发现

Junkai Ji, Zhangfan Yang, Dong Xu, Ruibin Bai, Jianqiang Li, Tingjun Hou, Zexuan Zhu

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Trio结合语言模型、性质对齐和战略搜索,实现高效且可解释的闭环分子设计,提升药物配体的结合亲和力、药物性和合成可及性。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08660 2026-03-10 cs.LG cs.CL 81%

How Far Can Unsupervised RLVR Scale LLM Training?

无监督强化学习如何扩展大语言模型训练?

Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang, Cheng Qian, Kaiyan Zhang, Yuchen Fan, Ganqu Cui, Xiusi Chen, Youbang Sun, Xingtai Lv, Xuekai Zhu, Li Sheng, Ran Li, Huan-ang Gao, Yuchen Zhang, Bowen Zhou, Zhiyuan Liu, Ning Ding

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了无监督强化学习如何扩展大语言模型训练,分析了内在和外部奖励方法的理论和实验结果,揭示了模型先验对训练效果的影响,并提出了模型崩溃步骤作为评估指标。

Comments Accepted to the ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08429 2026-03-10 cs.CL cs.AI cs.IR 81%

One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States

一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11148 2026-03-10 cs.CL cs.AI 81%

Improving the Efficiency of Visually Augmented Language Models

提升视觉增强语言模型的效率

Paula Ontalvilla, Aitor Ormazabal, Gorka Azkune

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心 - Ixa,巴斯克大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BLIND-VALM模型,通过使用CLIP获取的视觉 grounding 文本表示,提升视觉增强语言模型的效率和性能。

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07835 2026-03-10 cs.CR cs.AI cs.CL 81%

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施

Bo Jiang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06726 2026-03-10 cs.LG cs.AI 81%

Regression Models Meet Foundation Models: A Hybrid-AI Approach to Practical Electricity Price Forecasting

回归模型与基础模型相遇:一种混合AI方法用于实际电价预测

Yunzhong Qiu, Binzhu Li, Hao Wei, Shenglin Weng, Chen Wang, Zhongyi Pei, Mingsheng Long, Jianmin Wang

机构 * School of Software, BNRist Tsinghua University(软件学院,北京理工大学) Suzhou Industrial Park Xingzhixun CS Co., Ltd.(苏州工业园区星讯CS公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FutureBoosting方法,通过整合时间序列基础模型生成的预测特征,提升回归模型在电价预测中的性能,实现MAE降低超过30%。

Comments 15 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04443 2026-03-06 cs.DC cs.AI cs.LG cs.SY eess.SY 81%

AMV-L: Lifecycle-Managed Agent Memory for Tail-Latency Control in Long-Running LLM Systems

AMV-L:用于长运行LLM系统中尾延迟控制的生命周期管理代理内存

Emmanuel Bamidele

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 AMV-L通过生命周期管理内存,有效降低LLM长运行系统的延迟和吞吐量,提升极端尾部性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04428 2026-03-06 cs.LG cs.AI 81%

Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices

代理记忆低于提示:持久化Q4 KV缓存用于边缘设备上的多代理LLM推理

Yakov Pyotr Shkolnikov

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种持久化Q4 KV缓存的方法,用于在边缘设备上提高多代理LLM推理效率,通过减少缓存恢复时间,提升模型性能。

Comments 24 pages, 6 figures, 16 tables. Open-source implementation at https://github.com/yshk-mxim/agent-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 81%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04045 2026-03-05 cs.LG cs.AI 81%

Inference-Time Toxicity Mitigation in Protein Language Models

蛋白质语言模型中的推理时间毒性缓解

Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin Moreno, Enzo Ferrante

机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) Goodfire APOLO Biotech(APOLO生物技术)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏