arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2604.09493 2026-04-13 cs.NI 85%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09332 2026-04-13 eess.AS 85%

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR

音素与投影器:针对基于LLM的ASR的语音-语言接口研究

Ziwei Li, Lukuang Dong, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文比较了基于音素和投影器的接口在英语和塔塔尔语ASR中的性能,提出BPE-音素接口提升生成效果。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08266 2026-04-10 cs.CV 85%

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

Orion-Lite:将LLM推理能力蒸馏到高效视觉-only驾驶模型

Jing Gu, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Orion-Lite,通过潜特征蒸馏和真实轨迹监督,在闭环评估中实现高效视觉-only驾驶模型,超越大规模VLA模型ORION,达到Bench2Drive基准的80.6 Driving Score。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 85%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07569 2026-04-10 cs.LG cs.AI cs.CL cs.IT math.IT 85%

Learning is Forgetting: LLM Training As Lossy Compression

学习是遗忘:LLM训练作为有损压缩

Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

机构 * Princeton University(普林斯顿大学) Cohere

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLM训练可视为有损压缩过程,通过保留训练数据中与目标相关的信息,揭示模型表示结构与下游性能的联系。

Comments 12 page core paper, 16 page Appendix - A shorter version with fewer visuals appears at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 85%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract);post-training(abstract)

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04253 2026-04-10 cs.AR 85%

Rethinking Compute Substrates for 3D-Stacked Near-Memory LLM Decoding: Microarchitecture-Scheduling Co-Design

重新思考用于3D堆叠近内存LLM解码的计算子系统:微架构与调度的协同设计

Chenyang Ai, Yixing Zhang, Haoran Wu, Yudong Pan, Lechuan Zhao, Wenhui OU

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文重新设计3D堆叠近内存LLM解码的计算子系统,通过改进微架构和调度策略,提高内存带宽利用率和能效,实现更高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07379 2026-04-10 cs.DC 85%

DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance

DuoServe-MoE:双阶段专家预取和缓存用于LLM推理QoS保障

Yuning Zhang, Grant Pinkert, Nan Yang, Yanli Li, Dong Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DuoServe-MoE系统,通过分离预填和解码阶段,采用专用专家调度策略,有效降低内存占用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09942 2026-04-10 cs.NI cs.DC cs.SY eess.SY math.OC 85%

Green-LLM: Optimal Workload Allocation for Environmentally-Aware Distributed Inference

Green-LLM:面向环境感知分布式推断的最优工作负载分配

Jiaming Cheng, Duong Tung Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Green-LLM框架,通过联合优化运营成本、碳排放和延迟惩罚,实现可持续的大语言模型推断,同时满足水消耗约束。

Comments 8 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01423 2026-04-09 stat.ME 85%

Active Hypothesis Testing under Computational Budgets with Applications to GWAS and LLM

在计算预算下主动假设检验及其在GWAS和LLM中的应用

Qi Kuang, Bowen Gang, Yin Xia

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种主动假设检验框架,利用低成本辅助统计量分配全局计算预算,通过数据自适应方法在保证有效性的同时满足预算约束,理论和实证结果表明其在固定资源限制下提升了统计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07144 2026-04-09 cs.DC 85%

Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics

自组织:一种面向LLM服务的自演化系统范式,用于运行时动态

Youhe Jiang, Ran Yan, You Peng, Wenshuang Li, Taiyi Wang, Fangcheng Fu, Binhang Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Autopoiesis,一种自演化系统,使LLM服务从静态策略部署转向持续在线策略演化,通过实时动态驱动策略合成,提升服务在运行时动态下的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05375 2026-04-08 cs.MM 85%

DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems

DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理

Qi Guo, Zheming Yang, Yunqing Hu, Chang Zhao, Wen Ji

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。

Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05905 2026-04-08 cs.CL cs.AI cs.HC cs.LG cs.MA 85%

Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency

自信的幻觉?通过邻域一致性诊断LLM的真实性

Haoming Xu, Ningyuan Zhao, Yunzhi Yao, Weihong Xu, Hongru Wang, Xinle Deng, Shumin Deng, Jeff Z. Pan, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出邻域一致性信念(NCB)来评估LLM在上下文干扰下的信念鲁棒性,通过结构化测量提升模型在真实场景中的可靠性,并引入结构感知训练(SAT)减少知识脆性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04783 2026-04-07 cs.CR cs.AR 85%

GPU Acceleration of TFHE-Based High-Precision Nonlinear Layers for Encrypted LLM Inference

基于GPU的TFHE高精度非线性层加速用于加密LLM推理

Guoci Chen, Xiurui Pan, Qiao Li, Bo Mao, Congming Gao, Chengying Huan, Mingzhe Zhang, Jie Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TIGER框架,通过GPU优化的WoP-PBS方法和数值算法,实现高精度加密LLM非线性层计算,提升GPU效率,实现GELU、Softmax和LayerNorm的加速效果。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04654 2026-04-07 cs.DC 85%

Communication-Efficient Collaborative LLM Inference over LEO Satellite Networks

高效协作的低地球轨道卫星网络大语言模型推理

Songge Zhang, Wen Wu, Liang Li, Ye Wang, Xuemin, Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种高效的协作大语言模型推理方案,通过将模型拆分并部署在卫星上,利用中间激活信息交换减少延迟,并通过自适应激活压缩保持精度。

Comments 13 pages, 12 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04461 2026-04-07 cs.LG cs.AI cs.CL 85%

DP-OPD: Differentially Private On-Policy Distillation for Language Models

DP-OPD:基于差分隐私的在线策略蒸馏

Fatemeh Khadem, Sajad Mousavi, Yi Fang, Yuhong Liu

机构 * Santa Clara University(圣克拉拉大学) Independent Researcher(独立研究员)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DP-OPD,一种无需合成的差分隐私在线策略蒸馏框架,通过在学生模型上应用DP-SGD实现隐私保护,利用冻结的教师模型提供密集的token级目标,提升压缩效率和隐私-效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04247 2026-04-07 cs.AI cs.CL cs.LG 85%

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

Combee:用于自我改进语言模型代理的提示学习扩展

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh Gradient Network

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Combee通过并行扫描和增强洗牌机制,提升提示学习效率,实现多代理并行训练,同时保持学习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03676 2026-04-07 cs.IR 85%

Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead

基于大语言模型的检索器是否值得其成本?对效率、鲁棒性和推理开销的实证研究

Abdelrahman Abdallah, Jamie Holdcroft, Mohammed Ali, Adam Jatowt

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过12个任务和14个检索器评估了基于大语言模型的检索器在效率、鲁棒性和推理开销方面的表现,发现部分专门化检索器在吞吐量上具有竞争力,而某些大语言模型双编码器则带来显著延迟。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08542 2026-04-02 cs.AR 85%

BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference

BitROM:无权重重载的CiROM架构面向十亿参数1.58位LLM推理

Wenlun Zhang, Xinyu Li, Shimpei Ando, Kentaro Yoshioka

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 BitROM通过与BitNet的1.58位量化模型联合设计,解决了传统CiROM在大语言模型中的扩展性问题,实现了高效边缘LLM推理,具备更高的面积效率和更低的外部内存访问需求。

Comments Accepted to ASP-DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28772 2026-04-01 cs.DC 85%

Federated Inference for Heterogeneous LLM Communication and Collaboration

联邦推断用于异构大语言模型通信与协作

Zihan Chen, Zeshen Li, Howard H. Yang, Tony Q. S. Quek, Jihong Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FedRefine框架,解决多LLM协作中的性能、隐私和异构性问题,通过隐私保护的KV缓存通信提升设备端推断能力。

Comments 6 pages. Accepted by AAAI 2026 Workshop on ML4Wireless

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28018 2026-03-31 eess.SP 85%

Low-Latency Edge LLM Handover via Joint KV Cache Transfer and Token Prefill

通过联合KV缓存传输和令牌预填充实现低延迟边缘LLM切换

Seunghun Lee, Jihong Park, Ce Zheng, Hyuncheol Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种联合选择预填充长度和调度回传KV缓存传输的统一切换设计,以最小化多用户设备的LLM切换延迟,通过仿真验证其在不同回传容量、预填充速度和上下文大小下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10079 2026-03-31 cs.LG cs.AI cs.CL 85%

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts

稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈

Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV 85%

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23186 2026-03-25 cs.CV 85%

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

ViKey:通过视觉提示增强视频中的时间理解

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 ViKey通过视觉提示和轻量级关键词-帧映射模块提升视频模型的时间推理能力,在减少帧数的情况下保持性能。

Comments accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20661 2026-03-25 cs.DC 85%

WWW.Serve: Interconnecting Global LLM Services through Decentralization

WWW.Serve:通过去中心化连接全球大语言模型服务

Huanyu Wang, Ziyu Xia, Zhuoming Chen, Beidi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出WWW.Serve框架,通过去中心化方式连接全球大语言模型服务,实现灵活的参与政策和资源承诺,自主分配请求,提升服务级别目标达成率和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19220 2026-03-24 cs.CL cs.AI cs.LG 85%

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

Nemotron-Cascade 2:基于级联强化学习和多领域在线蒸馏的后训练大语言模型

Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 效率与部署 :post-training(title);LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nemotron-Cascade 2是一款30B MoE模型,通过级联强化学习和多领域在线蒸馏提升推理和智能体能力,在2025年国际数学奥林匹克竞赛、国际信息学奥林匹克竞赛和ICPC世界总决赛中达到金奖水平,参数更少性能更强。

Comments We release the model and data at https://huggingface.co/collections/nvidia/nemotron-cascade-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18415 2026-03-24 cs.HC 85%

AI-Wrapped: Participatory, Privacy-Preserving Measurement of Longitudinal LLM Use In-the-Wild

AI-Wrapped:参与式、隐私保护的长期LLM使用情况实地测量

Cathy Mengying Fang, Sheer Karny, Chayapatr Archiwaranguprok, Yasith Samaradivakara, Pat Pataranutaporn, Pattie Maes

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AI-Wrapped系统,通过隐私保护的方式收集真实LLM聊天使用数据,并分析用户使用模式及主题,揭示用户在日常场景中对LLM的使用特点及潜在问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18734 2026-03-20 cs.SE 85%

Green Architectural Tactics in ML-enabled Systems: An LLM-based Repository Mining Study

在ML系统中采用绿色建筑策略:基于LLM的代码库研究

Vincenzo De Martino, Silverio Martínez-Fernández, Fabio Palomba

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析205个开源ML项目,发现现有绿色实践在实际应用中存在差异,并识别出九种未记录的可持续实践,为减少ML系统的环境影响提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12671 2026-03-20 cs.NI 85%

HyGra: Accelerating Network-State Simulation for LLM Training in DCNs via Adaptive Packet-Flow Granularity

HyGra: 通过自适应数据包流粒度加速LLM训练在DCN中的网络状态模拟

Wenyi Wang, Zheng Wu, Yanmeng Wang, Haolin Mao, Lei Han, Gaogang Xie, Fu Xiao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HyGra通过自适应调整网络模拟粒度,结合数据包级和流级模拟,提升LLM训练在DCN中的网络状态模拟效率,同时保持高精度。

Comments 14 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11468 2026-03-20 cs.SE 85%

TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation

TRACE: 评估基于LLM的代码翻译的执行效率

Zhihao Gong, Zeyu Sun, Dong Huang, Qingyuan Liang, Jie M. Zhang, Dan Hao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TRACE基准,评估LLM翻译代码的执行效率,发现正确性不等于效率,23.5%的正确翻译存在显著低效,提示需更关注效率评估。

详情

展开后加载摘要…

URL PDF HTML 收藏