arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 80 篇

2512.20861 2026-01-21 cs.LG cs.AI 81%

Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs

基于资源受限GPU的块低秩基础模型的内存高效加速

Pierre Abillama, Changwoo Lee, Juechu Dong, David Blaauw, Dennis Sylvester, Hun-Seok Kim

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种内存高效的块低秩基础模型加速方法,通过自定义Triton内核优化,显著提升了在资源受限GPU上的推理速度和模型压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08604 2026-01-21 cs.CV cs.AI cs.LG 81%

Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization

可迁移的模型无关视觉-语言模型适应方法用于高效的弱到强泛化

Jihwan Park, Taehoon Song, Sanghyeok Lee, Miso Choi, Hyunwoo J. Kim

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 TransMiter是一种轻量级适配器,通过无监督方式提升视觉-语言模型的泛化能力,实现高效的知识迁移。

Comments AAAI2026 Oral (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13559 2026-01-21 cs.AI 79%

AgentGC: Evolutionary Learning-based Lossless Compression for Genomics Data with LLM-driven Multiple Agent

AgentGC: 基于进化学习的无损基因组数据压缩方法与LLM驱动的多智能体

Sun Hui, Ding Yanfeng, Huidong Ma, Chang Xu, Keyan Jin, Lizheng Zu, Cheng Zhong, xiaoguang Liu, Gang Wang, Wentong Cai

机构 * Nankai University(南开大学) Nanyang Technology University(南阳技术大学) Microsoft Research Asia(微软亚洲研究院) Macao Polytechnic University(澳门理工学院) Guangxi University(广西大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 AgentGC通过LLM驱动的多智能体架构,实现基因组数据的高效无损压缩,提升压缩比和吞吐量,解决传统方法的适应性和用户友好性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09258 2026-01-21 cs.DC cs.LG cs.OS 79%

LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference

LatencyPrism: 一种在线非侵入式延迟塑形系统以保证LLM推理的SLA

Yin Du, Jiayi Ren, Xiayu Sun, Tianyao Zhou, Haizhu Zhou, Ruiyan Ma, Danyang Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 LatencyPrism是一种非侵入式延迟塑形系统,通过实时监控和异常检测保证LLM推理的SLA要求。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15566 2026-01-21 cs.SD cs.AI cs.NE 79%

SpikeVox: Towards Energy-Efficient Speech Therapy Framework with Spike-driven Generative Language Models

SpikeVox: 向能量高效的言语治疗框架迈进:基于脉冲的生成语言模型

Rachmad Vidya Wicaksana Putra, Aadithyan Rajesh Nair, Muhammad Shafique

机构 * eBrain Lab, New York University (NYU) Abu Dhabi(eBrain实验室,纽约大学阿布扎赫尔分校) Pune University(普纳大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 SpikeVox通过基于脉冲的生成语言模型实现能量高效的言语治疗框架,提供高精度语音识别和完整的治疗反馈。

Comments Accepted at the IEEE Biomedical Circuits and Systems Conference (BioCAS) 2025, Abu Dhabi, UAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 79%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12150 2026-01-21 cs.CV cs.AI 79%

Enhanced Diagnostic Performance via Large-Resolution Inference Optimization for Pathology Foundation Models

通过大规模分辨率推断优化提升诊断性能的病理基础模型

Mengxuan Hu, Zihan Guan, John Kang, Sheng Li, Zhongliang Zhou

机构 * University of Virginia(弗吉尼亚大学) Merck & Co., Inc. Biometrics Research(默克公司生物医学研究)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出了一种高效推断策略,通过稀疏化注意力和过滤非信息性标记,在保持性能的同时提升高分辨率WSI推断效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12042 2026-01-21 cs.CR cs.AI 79%

Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models

少即是多——直到它破裂:大视觉-语言模型中视觉标记压缩的安全隐患

Xiaomei Zhang, Zhaoxi Zhang, Leo Yu Zhang, Yanjun Zhang, Guanhong Tao, Shirui Pan

机构 * Griffith University(格里菲斯大学) University of Technology Sydney(悉尼技术大学) University of Utah(犹他大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本研究揭示了视觉标记压缩在大视觉-语言模型中显著降低鲁棒性的问题,并提出压缩感知攻击以系统研究该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22007 2026-01-21 math.ST cs.CL cs.CR cs.LG stat.ML stat.TH 79%

Optimal Detection for Language Watermarks with Pseudorandom Collision

语言水印的最优检测与伪随机碰撞

T. Tony Cai, Xiang Li, Qi Long, Weijie J. Su, Garrett G. Wen

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于最小单位的统计框架,用于在不完美伪随机性下优化语言水印检测,通过理论分析和实验验证提升了检测能力并严格控制类型I错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20156 2026-01-21 cs.CL cs.AI cs.SD eess.AS 79%

Fun-Audio-Chat Technical Report

Fun-Audio-Chat 技术报告

Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, Qinglin Zhang, Qiquan Zhang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Fun-Audio-Chat通过双分辨率语音表示和核心鸡尾酒训练,解决语音-文本模型的时间分辨率不匹配和灾难性遗忘问题,实现高效且高质量的音频理解与生成。

Comments Authors are listed in alphabetical order, 21 pages, open-source at https://github.com/FunAudioLLM/Fun-Audio-Chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17272 2026-01-21 cs.LG cs.CL 79%

Zebra-Llama: Towards Extremely Efficient Hybrid Models

Zebra-Llama:迈向极高效混合模型

Mingyu Yang, Mehdi Rezagholizadeh, Guihong Li, Vikram Appia, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 Zebra-Llama通过结合状态空间模型和多头潜在注意力层,构建高效混合模型,以极低成本实现接近Transformer的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12212 2026-01-21 cs.LG cs.AI 79%

Speculative Sampling with Reinforcement Learning

推测采样与强化学习

Chenan Wang, Daniel H. Shi, Haipeng Chen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Re-SpS通过强化学习优化草稿树超参数,提升大规模语言模型的生成速度,实现高达5.45倍的速度提升。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11619 2026-01-21 cs.LG cs.AI 79%

NoiseFormer -- Noise Diffused Symmetric Attention Transformer

NoiseFormer -- 噪声扩散对称注意力变换器

Phani Kumar, Nyshadham, Jyothendra Varma, Polisetty V R K, Aditya Rathore

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 NoiseFormer通过引入噪声扩散对称注意力机制,在保持内存优势的同时提升模型准确性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06448 2026-01-21 physics.optics 78%

Physics-guided foundation model for universal speckle removal in ultrathin multimode fiber imaging

基于物理的通用散射消除基础模型用于超薄多模光纤成像

Xianrui Zeng, Yirui Zang, Pengfei Liu, Fei Yu, Yang Yang, Tomáš Čižmár, Yang Du

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出基于物理的SCNet模型,用于超薄多模光纤成像中的通用散射消除,实现高保真重建与快速推理。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12865 2026-01-21 cs.CV 78%

Proxy Robustness in Vision Language Models is Effortlessly Transferable

视觉语言模型中的代理鲁棒性可以轻易转移

Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) School of Microelectronics(微电子学院) Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13481 2026-01-21 cs.AI 77%

Towards Efficient and Robust Linguistic Emotion Diagnosis for Mental Health via Multi-Agent Instruction Refinement

通过多智能体指令细化实现高效的稳健语言情绪诊断以促进心理健康

Jian Zhang, Zhangqi Wang, Zhiyuan Wang, Weiping Fu, Yu He, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Saw Swee Hock School of Public Health, National University of Singapore(Saw Swee Hock 公共卫生学院,新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 APOLO通过多智能体协作优化提示空间,提升语言情绪诊断的效率与鲁棒性,适用于心理健康领域的可信LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24713 2026-01-21 cs.LG cs.AR 77%

FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference

面向高效N:M稀疏和量化模型推断的FPGA协同设计

Fen-Yu Hsieh, Yun-Chang Teng, Ding-Yong Hong, Jan-Jan Wu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种FPGA协同设计方法,通过N:M稀疏性和量化技术提升LLM在资源受限环境下的推断效率。

Comments Withdrawn due to substantial inconsistencies between the machine-learning pipeline and the independently developed FPGA-based hardware accelerator. The manuscript does not reflect a coherent, jointly developed system and a clearly integrated methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09014 2026-01-21 cs.CL 77%

LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction

LitE-SQL: 一种轻量高效的文本到SQL框架,具备基于向量的模式链接和执行引导的自我纠正

Shengmin Piao, Jieun Lee, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LitE-SQL通过轻量高效的框架和基于向量的模式链接技术,实现高准确率的文本到SQL生成,无需多候选采样即可执行引导自我纠正,适用于隐私敏感和资源受限场景。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16162 2026-01-21 cs.CL 77%

KNN-SSD: Enabling Dynamic Self-Speculative Decoding via Nearest Neighbor Layer Set Optimization

KNN-SSD: 通过最近邻层集优化实现动态自推测解码

Mingbo Song, Heming Xia, Jun Zhang, Chak Tou Leong, Qiancheng Xu, Wenjie Li, Sujian Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KNN-SSD通过KNN搜索优化层集,提升推测解码在不同领域中的通用性和推理速度

Comments EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12343 2026-01-21 econ.EM cs.AI stat.ML 77%

How Well Do LLMs Predict Human Behavior? A Measure of their Pretrained Knowledge

LLMs预测人类行为有多好?一种衡量其预训练知识的方法

Wayne Gao, Sukjin Han, Annie Liang

机构 * Department of Economics, University of Pennsylvania(宾夕法尼亚大学经济学系) School of Economics, University of Bristol(布里斯托大学经济学院) Department of Economics, Northwestern University(西北大学经济学系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种衡量LLM预测人类行为能力的方法,通过等效样本量评估其预训练知识,并在经济领域应用发现其预测效果因变量而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08930 2026-01-21 cs.LG 77%

VectorLiteRAG: Latency-Aware and Fine-Grained Resource Partitioning for Efficient RAG

VectorLiteRAG: 一种面向延迟敏感的细粒度资源划分方法以实现高效的RAG系统

Junkyum Kim, Divya Mahajan

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VectorLiteRAG通过细粒度GPU资源划分方法,提升RAG系统在延迟敏感场景下的吞吐量性能,无需额外硬件资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10657 2026-01-21 cs.NE cs.LG 77%

PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution

PACEvolve: 促进长周期一致性演进

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Isabella Ye, Weili Wang, Chi Wang, Ed H. Chi, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PACEvolve通过分层上下文管理和自适应采样策略,解决进化搜索中的上下文污染、模式崩溃和弱协作问题,实现长周期一致性自我提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10378 2026-01-21 cs.CV cs.AI 77%

Global Context Compression with Interleaved Vision-Text Transformation

全局上下文压缩与交错视觉-文本转换

Dian Jiao, Jiaxin Duan, Shuai Zhao, Jiabing Leng, Yiran Zhang, Feng Huang

机构 * China Electronics Cloud Technology Co Ltd.(中国电子云科技有限公司)

专题命中 效率与部署 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出VIST2模型,通过交错视觉与文本信息实现全局上下文压缩,提升长写任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14140 2026-01-21 cs.AR 75%

CREATE: Cross-Layer Resilience Characterization and Optimization for Efficient yet Reliable Embodied AI Systems

CREATE: 跨层韧性表征与优化以实现高效且可靠的具身AI系统

Tong Xie, Yijiahao Qi, Jinqi Wen, Zishen Wan, Yanchi Dong, Zihao Wang, Shaofei Cai, Yitao Liang, Tianyu Jia, Yuan Wang, Runsheng Wang, Meng Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CREATE提出了一种跨层韧性优化方法,通过电路、模型和应用层面的协同设计,实现高效且可靠的具身AI系统。

Comments 18 pages, 21 figures. Accepted by ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13702 2026-01-21 cs.NI 75%

IGAA: Intent-Driven General Agentic AI for Edge Services Scheduling using Generative Meta Learning

IGAA: 基于生成元学习的意图驱动通用代理AI用于边缘服务调度

Yan Sun, Yinqiu Liu, Shaoyong Guo, Ruichen Zhang, Feng Qi, Xuesong Qiu, Weifeng Gong, Dusit Niyato, Qihui Wu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 IGAA通过生成元学习和意图驱动机制,提升边缘服务调度的泛化能力与适应性,有效应对动态服务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13015 2026-01-21 cs.SE 75%

MeltRTL: Multi-Expert LLMs with Inference-time Intervention for RTL Code Generation

MeltRTL: 多专家LLMs结合推理时干预用于RTL代码生成

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MeltRTL通过多专家注意力和推理时干预提升LLM生成RTL代码的准确性和效率,实现96%的可综合性和60%的功能正确性,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02121 2026-01-21 cs.DB cs.DC 75%

Batch Query Processing and Optimization for Agentic Workflows

批量查询处理与优化用于代理工作流

Junyi Shen, Noppanat Wadlom, Yao Lu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Halo通过统一查询优化与异构LLM服务,提升代理工作流在批量推理和在线服务中的效率,实现3.6倍速度提升和2.6倍吞吐量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20776 2026-01-21 cs.CL cs.AI cs.LG 75%

SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences

SpecExtend: 为长序列推测解码的即插即用增强

Jungyoub Cha, Hyunjong Kim, Sungzoon Cho

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SpecExtend通过集成高效注意力机制和Cross-model Retrieval策略,提升长序列推测解码效率,加速文档摘要和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12241 2026-01-21 cs.DC 75%

Power Aware Dynamic Reallocation For Inference

面向功率的动态重分配用于推理

Yiwei Jiang, Sangeeta Chowdhary, Nathaniel Morris, Rutwik Jain, Srilatha Manne, Sam Bayliss

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RAPID通过动态功率和GPU重分配技术,在严格功率限制下提升LLM推理性能,实现峰值负载下SLO达成率提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11553 2026-01-21 cs.DC 75%

PerCache: Predictive Hierarchical Cache for RAG Applications on Mobile Devices

PerCache:面向移动设备的预测性分层缓存用于检索增强生成应用

Kaiwei Liu, Liekang Zeng, Lilin Xu, Bufang Yang, Zhenyu Yan

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PerCache通过预测性分层缓存减少移动RAG应用的端到端延迟,实现34.4%的延迟降低和动态资源下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏