arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2511.19438 2026-02-06 cs.DC cs.PF 82%

Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms

Opt4GPTQ: 为异构平台上的4位GPTQ量化LLM推理共同优化内存与计算

Yaozheng Zhang, Wei Wang, Jie Kong, Jiehan Zhou, Xianwei Zhang, Huanqing Cui, Han Bao, Yuhai Liu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 Opt4GPTQ通过整合三种平台优化策略,提升异构平台上4位GPTQ量化LLM推理的性能和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 82%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract)

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03358 2026-02-04 cs.AI cs.CL cs.LG 82%

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

GFlowPO:生成流网络作为语言模型提示优化器

Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

机构 * Korea Advanced Institute of Science Korea University Mila -- Qu\'ebec AI Institute

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GFlowPO通过生成流网络和动态内存更新机制,提升语言模型提示优化的样本效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13847 2026-02-04 cs.CL cs.AI cs.LG 82%

DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models

DynaSpec: 一种基于上下文的动态推测采样方法用于大词汇量语言模型

Jinbin Zhang, Nasib Ullah, Erik Schultheis, Rohit Babbar

机构 * Department of Computer Science(计算机科学系) Aalto University(阿alto大学) Deep Algorithms and Systems Lab(深度算法与系统实验室) IST Austria(IST奥地利研究院) University of Bath(巴斯大学)

专题命中 效率与部署 :language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DynaSpec通过动态短名单机制提升大词汇量语言模型的推测解码效率,实现更高的吞吐量和更精确的验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 82%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract)

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23101 2026-02-03 cs.CR cs.PL cs.SE 82%

Beyond Imprecise Distance Metrics: Trace-Guided Directed Greybox Fuzzing via LLM-Predicted Call Stacks

超越不精确的距离度量:通过LLM预测的调用栈引导的定向灰盒模糊测试

Yifan Zhang, Xin Zhang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 通过LLM预测调用栈引导的定向灰盒模糊测试,提升漏洞触发效率并发现新漏洞。

Comments Preprint, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23281 2026-02-02 cs.CV 82%

User Prompting Strategies and Prompt Enhancement Methods for Open-Set Object Detection in XR Environments

面向XR环境的开放集目标检测中的用户提示策略与提示增强方法

Junfeng Lin, Yanming Xiu, Maria Gorlatova

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学)

专题命中 效率与部署 :prompting(title,abstract);language model(abstract)

AI总结 本文提出针对XR环境中的开放集目标检测,通过研究用户提示策略和增强方法,提升模型在模糊提示下的鲁棒性,实验结果显示提示增强可使mIoU提升超过55%。

Comments Accepted by IEEE VR 2026: GenAI-XR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06446 2026-02-02 cs.CL cs.AI cs.LG stat.ML 82%

Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service

令牌化多样性导致LLM-as-a-service中的任意价格波动

Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出规范生成方法,通过限制LLM生成唯一令牌化以解决LLM-as-a-service中令牌化多样性导致的价格波动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21647 2026-01-30 cs.CL cs.AI cs.LG 82%

ILRR: Inference-Time Steering Method for Masked Diffusion Language Models

ILRR: 用于掩码扩散语言模型的推理时间引导方法

Eden Avrahami, Eliya Nachmani

机构 * School of Computer Science, Tel Aviv University, Israel(特拉维夫大学计算机科学学院) Department of Electrical and Computer Engineering, Ben Gurion University, Beer Sheva, Israel(本· Gurion大学电气与计算机工程系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ILRR是一种无需学习的引导方法,通过单个参考序列在去噪过程中动态对齐生成序列与参考序列的激活,实现对扩散语言模型属性的高效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 82%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 82%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15907 2026-01-21 cs.DC 82%

Decentralized LLM Inference over Edge Networks with Energy Harvesting

基于边缘网络的分布式大语言模型推理与能量收集

Aria Khoshsirat, Giovanni Perin, Michele Rossi

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于能量收集的边缘网络中分布式大语言模型推理方法,利用半马尔可夫模型优化调度算法以提高能效和网络吞吐量。

Journal ref Proceedings of IEEE Global Communications Conference (GLOBECOM), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12272 2026-01-21 cs.CV 82%

AgenticPruner: MAC-Constrained Neural Network Compression via LLM-Driven Strategy Search

AgenticPruner: 通过LLM驱动的策略搜索实现MAC约束的神经网络压缩

Shahrzad Esmat, Mahdi Banisharif, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 AgenticPruner通过LLM驱动策略搜索实现MAC约束的神经网络压缩,通过三个专门代理协调优化,提升收敛成功率并实现精确的MAC预算控制。

Comments 38 pages, 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17807 2026-01-19 cs.CV 82%

Attention Debiasing for Token Pruning in Vision Language Models

视觉语言模型中用于标记剪枝的注意力去偏

Kai Zhao, Wubang Yuan, Yuchen Lin, Liting Ruan, Xiaofeng Lu, Deng-Ping Fan, Ming-Ming Cheng, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(通信与信息工程学院,上海大学) School of Computer Science and Engineering, Shanghai University(计算机科学与工程学院,上海大学) School of Computer Science and Engineering, Nankai University(计算机科学与工程学院,南开大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出两种轻量有效的注意力去偏技术,用于改进视觉语言模型中基于注意力的标记剪枝,以提升计算效率和模型性能。

Comments https://github.com/intcomp/attention-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17077 2026-01-16 cs.DC 82%

Taming the Memory Footprint Crisis: System Design for Production Diffusion LLM Serving

缓解内存占用危机:面向生产扩散大语言模型服务的系统设计

Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 dLLM-Serve通过优化内存占用、计算调度和生成质量,解决了扩散大语言模型在生产中的内存占用危机,实现了更高的吞吐量和更低的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25626 2026-01-16 cs.CL cs.AI cs.LG cs.LO 82%

Are Language Models Efficient Reasoners? A Perspective from Logic Programming

语言模型是高效的推理者吗?从逻辑编程的角度看

Andreas Opedal, Yanick Zengaffinen, Haruki Shirakami, Clemente Pasti, Mrinmaya Sachan, Abulhair Saparov, Ryan Cotterell, Bernhard Schölkopf

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所) EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构) Purdue University(普渡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从逻辑编程角度评估语言模型的推理效率,发现其在存在无关信息时推理能力下降,生成证明常包含不必要的推理步骤。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09186 2026-01-15 eess.SP 82%

WiFo-E: A Scalable Wireless Foundation Model for End-to-End FDD Precoding in Communication Networks

WiFo-E:一种用于通信网络端到端FDD预编码的可扩展无线基础模型

Weibo Wen, Shijian Gao, Haotian Zhang, Xiang Cheng, Liuqing Yang

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 WiFo-E通过多任务预训练和稀疏MoE架构,实现大规模MIMO系统中端到端FDD预编码的高效可扩展解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16682 2026-01-15 cs.CL cs.AI cs.LG cs.PF 82%

Bench360: Benchmarking Local LLM Inference from 360 Degrees

Bench360:从360度角度评估本地LLM推理

Linus Stuhlmann, Mauricio Fadel Argerich, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Bench360提供了一种综合评估本地LLM推理性能的框架,通过多任务、多引擎和多指标的测试,揭示了不同设计选择对效率和输出质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06588 2026-01-13 cs.IT math.IT physics.comp-ph 82%

TCLNet: A Hybrid Transformer-CNN Framework Leveraging Language Models as Lossless Compressors for CSI Feedback

TCLNet:一种结合语言模型的Transformer-CNN混合框架,用于利用语言模型作为无损压缩器进行CSI反馈

Zijiu Yang, Qianqian Yang, Shunpu Tang, Tingting Yang, Zhiguo Shi

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 TCLNet通过结合Transformer-CNN架构和语言模型,实现CSI的高效无损压缩,提升压缩效率和传输性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08211 2026-01-13 cs.CL cs.AI cs.LG 82%

SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders

SAEMark: 通过稀疏自编码器引导个性化多语言大语言模型水印

Zhuohao Yu, Xingru Jiang, Weizheng Gu, Yidong Wang, Qingsong Wen, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAEMark通过稀疏自编码器实现多语言大语言模型的高效水印标记,无需修改模型参数,保持文本质量,适用于多种语言和领域。

Comments 24 pages, 12 figures, NeurIPS 2025, code available: https://zhuohaoyu.github.io/SAEMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 82%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 82%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 效率与部署 :language model(title,abstract);instruction tuning(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00644 2026-01-05 cs.DC 82%

FlexSpec: Frozen Drafts Meet Evolving Targets in Edge-Cloud Collaborative LLM Speculative Decoding

FlexSpec: 冻结草稿与演进目标在边缘-云协作大语言模型推测解码中的结合

Yuchen Li, Rui Kong, Zhonghao Lyu, Qiyang Li, Xinran Chen, Hengyi Cai, Lingyong Yan, Shuaiqiang Wang, Jiashu Zhao, Guangxu Zhu, Linghe Kong, Guihai Chen, Haoyi Xiong, Dawei Yin

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 FlexSpec通过共享骨干架构和通道感知机制,提升边缘-云协作大语言模型推测解码的效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24511 2026-01-01 cs.DC 82%

Understanding LLM Checkpoint/Restore I/O Strategies and Patterns

理解LLM检查点/恢复I/O策略和模式

Mikaila J. Gossman, Avinash Maurya, Bogdan Nicolae, Jon C. Calhoun

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract)

AI总结 本文研究了LLM检查点/恢复I/O策略,通过微基准测试发现聚合和合并策略能显著提升写入吞吐量,比现有方法提高3.9至7.6倍。

Comments SCA/HPCAsia 2026 Workshops: Supercomputing Asia and International Conference on High Performance Computing in the Asia Pacific Region Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17313 2025-12-22 cs.CV 82%

Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model

辅助描述性知识用于视觉-语言模型的少样本适应

SuBeen Lee, GilHan Park, WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出ADK框架,通过生成丰富的描述性提示提升视觉-语言模型在少样本适应中的性能,提供两种知识类型以增强类别区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 82%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 82%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 效率与部署 :language model(title,abstract);small language model(abstract)

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10316 2025-12-12 cs.CV 82%

ConStruct: Structural Distillation of Foundation Models for Prototype-Based Weakly Supervised Histopathology Segmentation

ConStruct:用于基于原型的弱监督病理分割的基模态结构蒸馏

Khang Le, Ha Thach, Anh M. Vu, Trang T. K. Vo, Han H. Huynh, David Yang, Minh H. N. Le, Thanh-Huy Nguyen, Akash Awasthi, Chandra Mohan, Zhu Han, Hien Van Nguyen

机构 * Ho Chi Minh City University of Technology(胡志明市技术大学) University of Technology Sydney(悉尼技术大学) University of Houston(休斯顿大学) University of Information Technology(信息科技大学) College of Medical Science and Technology, Taipei Medical University(台北医学院医学科技学院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Montefiore Medical Center, Albert Einstein College of Medicine(蒙特福伊医疗中心,阿尔伯特·爱因斯坦医学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract)

AI总结 ConStruct通过结合CONCH的形态感知表示、SegFormer的多尺度结构线索和文本引导的语义对齐,提出一种高效的弱监督病理分割方法,提升分割精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV 82%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00719 2025-12-02 cs.DC 82%

SIMPLE: Disaggregating Sampling from GPU Inference into a Decision Plane for Faster Distributed LLM Serving

SIMPLE: 将采样从GPU推理中分解到决策平面以实现更快的分布式LLM服务

Bohan Zhao, Zane Cao, Yongchao He

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 SIMPLE通过将采样分解到CPU侧,结合序列并行和热点词汇采样,显著提升分布式LLM服务的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏