arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 40 篇

2601.19934 2026-01-29 cs.CL cs.AI 90%

Quantifying non deterministic drift in large language models

量化大型语言模型中的非确定性漂移

Claire Nicholson

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过实验量化大型语言模型在无操作员条件下的非确定性漂移,揭示了不同模型大小和部署类型下的输出变化模式,并探讨了语义方法在评估漂移缓解技术中的应用。

Comments 10 pages, 3 figures, 1 table. Empirical measurement study reporting new repeated-run experiments quantifying baseline nondeterministic drift in large language models. This manuscript presents original empirical results (not a review or position paper) and establishes a baseline reference for future drift-mitigation work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19672 2026-01-29 cs.LG cs.AI cs.SE 90%

ProToken: Token-Level Attribution for Federated Large Language Models

ProToken: 联邦大语言模型中的令牌级归因

Waris Gill, Ahmad Humayun, Ali Anwar, Muhammad Ali Gulzar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ProToken通过令牌级归因方法,解决联邦大语言模型中客户端贡献识别问题,提升隐私保护下的模型调试与信任验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11300 2026-01-29 cs.CL cs.AI 90%

Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning

超越随机采样:通过课程学习实现高效的语言模型预训练

Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis

专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过课程学习优化语言模型预训练,发现压缩比、词汇多样性和可读性是关键难度指标,显著提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14569 2026-01-29 cs.LG cs.AI 88%

NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models

NoWag:一种用于大型语言模型形状保持压缩的统一框架

Lawrence Liu, Inesh Chakrabarti, Yixiao Li, Mengdi Wang, Tuo Zhao, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) Princeton University(普林斯顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 NoWag提出了一种统一的单次形状保持压缩框架,通过向量量化和剪枝技术有效压缩大型语言模型,展示了其在性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20704 2026-01-29 cs.LG 85%

Structurally Human, Semantically Biased: Detecting LLM-Generated References with Embeddings and GNNs

结构上的人类,语义上偏见:利用嵌入和图神经网络检测LLM生成的参考文献

Melika Mobini, Vincent Holst, Floriano Tori, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) SEAS, Harvard University(哈佛大学工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过嵌入和图神经网络检测LLM生成的参考文献,发现其拓扑结构接近人类,但语义特征可被识别。

Comments 34 pages, 20 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19908 2026-01-29 cs.AR cs.LG 85%

CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference

基于芯片组的异构近内存加速用于边缘多模态大语言模型推理

Yanru Chen, Runyang Tian, Yue Pan, Zheyu Li, Weihong Xu, Tajana Rosing

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20706 2026-01-29 cs.AR cs.AI cs.DC 83%

Beyond GEMM-Centric NPUs: Enabling Efficient Diffusion LLM Sampling

超越以GEMM为中心的NPUs:使高效的扩散LLM采样成为可能

Binglei Lou, Haoran Wu, Yao Lai, Jiayi Nie, Can Xiao, Xuan Guo, Rika Antonova, Robert Mullins, Aaron Zhao

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种针对扩散LLM采样的NPU架构优化方案,通过轻量级向量原语、内存重用策略和混合精度内存层次结构,实现了2.53倍的加速性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 83%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03996 2026-01-29 cs.LG cs.NE 79%

Spiking Brain Compression: Post-Training Second-order Compression for Spiking Neural Networks

脉冲神经网络压缩:针对脉冲神经网络的后训练二次压缩

Lianfeng Shi, Ao Li, Benjamin Ward-Cherrier

机构 * School of Engineering Mathematics and Technology, University of Bristol, England(工程数学与技术学院,布里斯托大学,英格兰)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出Spiking Brain Compression(SBC)框架,通过一次性后训练压缩提升脉冲神经网络的效率,实现比传统ANN基线更高的准确率。

Comments Preliminary work accepted at non-archival OPT-ML workshop at NeurIPS 2025. The workshop version is available in an earlier version of this arXiv paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20148 2026-01-29 cs.SE cs.LG 79%

LogSieve: Task-Aware CI Log Reduction for Sustainable LLM-Based Analysis

LogSieve: 任务感知的CI日志缩减以实现基于大语言模型的可持续分析

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) Faculty of Information University of Toronto Toronto Ontario Ontario(信息学院多伦多大学多伦多安大略安大略) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 LogSieve通过任务感知的日志缩减技术,有效减少CI日志体积并提升大语言模型推理的可持续性与可解释性。

Comments Preprint. Accepted for presentation at Mining Software Repositories (MSR'26), co-located ICSE 2026. The final version will appear in the ACM Digital Library as part of the MSR'26 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11589 2026-01-29 cs.DC cs.AI 79%

LAPS: A Length-Aware-Prefill LLM Serving System

LAPS:一种长度感知的LLM服务系统

Jianshu She, Zonghang Li, Hongchao Du, Shangyu Wu, Wenhao Zheng, Eric Xing, Zhengzhong Liu, Huaxiu Yao, Jason Xue, Qirong Ho

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 LAPS通过长度感知的调度策略优化LLM服务,降低预填充延迟并减少SLO违规,提升吞吐量。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17461 2026-01-29 cs.CV cs.CL 79%

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。

Comments Accepted to appear in the main conference of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11558 2026-01-29 cs.CV cs.AI cs.CL 79%

DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs

DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理

Bo-Cheng Chiu, Jen-Jee Chen, Yu-Chee Tseng, Feng-Chi Chen, An-Zi Yen

机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20190 2026-01-29 eess.SP 78%

WirelessJEPA: A Multi-Antenna Foundation Model using Spatio-temporal Wireless Latent Predictions

无线JEPA:一种利用空间-时间无线潜在预测的多天线基础模型

Viet Chu, Omar Mashaal, Hatem Abou-Zeid

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 WirelessJEPA通过空间-时间无线潜在预测,实现多天线信号的通用表示学习,适用于多种下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19910 2026-01-29 cs.AR cs.DC 78%

Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading

理解高效服务大语言模型推理的瓶颈:KV卸载

William Meng, Benjamin Lee, Hong Wang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文通过分析KV缓存卸载的瓶颈,提出优化硬件互连、模型架构和调度算法以提升大语言模型推理效率的方法。

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20707 2026-01-29 cs.CV 78%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19918 2026-01-29 cs.CL 77%

Lowest Span Confidence: A Zero-Shot Metric for Efficient and Black-Box Hallucination Detection in LLMs

最低跨度置信度:一种用于高效且黑盒幻觉检测的零样本度量

Yitong Qiao, Licheng Pan, Yu Mi, Lei Liu, Yue Shen, Fei Sun, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种名为最低跨度置信度(LSC)的零样本度量,用于高效且黑盒检测大型语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19213 2026-01-29 cs.AR 75%

M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization

M2XFP:一种元数据增强的微缩放数据格式,用于高效低比特量化

Weiming Hu, Zihan Zhang, Haoyan Zhang, Chen Zhang, Cong Guo, Yu Feng, Tianchi Hu, Guanglin Li, Guipeng Hu, Junsong Wang, Jingwen Leng

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 M2XFP通过引入元数据增强的微缩放数据格式,实现高效低比特量化,显著降低精度损失并提升加速器性能

Comments 17 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20573 2026-01-29 cs.LG cs.AI cs.DC 73%

Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs

快速失败,大获成功:通过扩散大语言模型重新思考推测解码的起草策略

Rui Pan, Zhuofu Chen, Hongyi Liu, Arvind Krishnamurthy, Ravi Netravali

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google(谷歌) Rice University(里士满大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FailFast通过动态调整推测长度,利用扩散大语言模型的并行解码优势,实现快速失败和大获成功,提升推测解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20745 2026-01-29 cs.LG cs.AI 73%

HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs

HESTIA: 一种基于Hessian的可微量化感知训练框架用于极低比特LLMs

Guoan Wang, Feiyu Wang, Zongwei Lv, Yikun Zong, Tong Yang

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HESTIA通过Hessian引导的可微量化感知训练框架,实现极低比特LLMs的高效训练,提升模型性能。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20357 2026-01-29 cs.LG cs.CL 73%

TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs

TABED: 为在LVLMs中实现鲁棒性推测解码的测试时间自适应集成草稿

Minjae Lee, Wonjun Kang, Byeongkeun Ahn, Christian Classen, Kevin Galim, Seunghyuk Oh, Minghao Yan, Hyung Il Koo, Kangwook Lee

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TABED通过动态集成多个草稿提高LVLMs在推测解码中的鲁棒性和效率,实现1.74倍的加速和5%的性能提升。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17367 2026-01-29 cs.CL cs.AI 73%

Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers

弹性注意力:用于高效变换器的测试时间自适应稀疏率

Zecheng Tang, Quantong Qiu, Yi Yang, Zhiyi Hong, Haiya Xiang, Kebin Liu, Qingqing Dang, Juntao Li, Min Zhang

机构 * Soochow University, China(苏州大学) LCM Laboratory(LCM实验室) Baidu Inc, China(百度公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 弹性注意力通过动态调整稀疏率提升LLMs在长上下文任务中的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20810 2026-01-29 cs.SE cs.LG 70%

Context-Augmented Code Generation Using Programming Knowledge Graphs

基于编程知识图谱的上下文增强代码生成

Shahd Seddik, Fahd Seddik, Iman Saberi, Fatemeh Fard, Minh Hieu Huynh, Patanamon Thongtanunam

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Melbourne(墨尔本大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出编程知识图谱(PKG)和重排序机制,通过细粒度检索和减少幻觉,提升代码生成在复杂问题上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20689 2026-01-29 cs.CV cs.AI 70%

Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework

解耦感知与校准:一种标签高效的图像质量评估框架

Xinyue Li, Zhichao Zhang, Zhiming Xu, Shubo Xu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Baidu(百度)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LEAF通过蒸馏多模态大语言模型的感知先验,实现轻量级图像质量评估,减少对人类标注的依赖,同时保持与人类注释的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20687 2026-01-29 cs.LG 70%

Positive-Unlabeled Reinforcement Learning Distillation for On-Premise Small Models

基于正例-未标记强化学习的本地小型模型蒸馏

Zhiqiang Kou, Junyang Chen, Xin-Qiang Cai, Xiaobo Xia, Ming-Kun Xie, Dong-Dong Wu, Biao Liu, Yuheng Jia, Xin Geng, Masashi Sugiyama, Tat-Seng Chua

机构 * Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) National University of Singapore(新加坡国立大学) University of Tokyo(东京大学)

专题命中 效率与部署 :SFT(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出了一种基于正例-未标记强化学习的本地小型模型蒸馏方法,无需人工标注或奖励模型,通过本地训练循环实现偏好优化,实验证明在低成本环境下性能优异。

Comments 22 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05580 2026-01-29 cs.AI cs.RO 70%

MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption

MetaVLA:统一的元学习协同训练用于高效的具身适应

Chen Li, Zhantao Yang, Han Zhang, Fangyi Chen, Chenchen Zhu, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Reality Labs, USA(Meta现实实验室(美国))

专题命中 效率与部署 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 MetaVLA通过统一的元学习协同训练方法,实现高效的具身适应,提升任务泛化能力并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07286 2026-01-29 cs.CL cs.IR 70%

Arce: Augmented Roberta with Contextualized Elucidations for Ner in Automated Rule Checking

Arce:增强的RoBERTa与上下文澄清用于自动规则检查中的命名实体识别

Jian Chen, Jiabao Dou

机构 * Ningxia Research Institute of Transport Science(宁夏交通运输科学研究院) Department of Computer Science(计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ARCE通过增强RoBERTa并结合上下文澄清,有效解决了AEC领域自动规则检查中的命名实体识别问题,实现了77.20%的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04655 2026-01-29 cs.CV cs.AI 70%

X-SAM: From Segment Anything to Any Segmentation

X-SAM:从Segment Anything到Any Segmentation

Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, Xiaodan Liang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 X-SAM通过引入统一框架和VGD分割任务,提升多模态大语言模型的像素级视觉理解能力,实现更广泛的分割任务整合。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20764 2026-01-29 cs.DC cs.MA 67%

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

代理雾:一种基于策略的雾计算分布式智能框架

Saeed Akbar, Muhammad Waqas, Rahmat Ullah

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。

Comments 09 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20742 2026-01-29 cs.CV 67%

Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification

压缩揭示智能:视觉编码、视觉令牌技术与统一

Xin Jin, Jinming Liu, Yuntao Wei, Junyan Lin, Zhicheng Wang, Jianguo Huang, Xudong Yang, Yanxiao Liu, Wenjun Zeng

机构 * Eastern Institute of Technology, Ningbo(宁波东部技术研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文探讨了视觉编码与视觉令牌技术的统一,揭示压缩效率与模型性能的权衡,并预测了下一代视觉编解码器和令牌技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏