arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2073 篇

2607.13115 2026-07-16 cs.AI cs.LG 新提交 90%

Improving Molecular Property Prediction in Small Language Models Using Graph-based Tools

使用基于图的工具改进小语言模型中的分子性质预测

Konstantinos Bougiatiotis, Dimitrios Kelesis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型在分子性质预测时的结构盲目性问题,提出模块化上下文增强提示框架,通过GNN专家模型和提取子图来辅助预测,在MUTAG和Tox21数据集上实验表明该方法能显著提升预测准确性,验证了基序相关性,但与专门GNN模型仍有差距。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08786 2026-07-13 cs.LG cs.AI cs.AR 新提交 90%

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18063 2026-06-17 cs.CV cs.AI cs.LG 新提交 90%

When LLMs Analyze Scars: From Images to Clinically-Meaningful Features

当LLM分析疤痕:从图像到临床有意义的特征

Ruman Wang, Hangting Ye

机构 * Liaoning University of Traditional Chinese Medicine(辽宁中医药大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ScaFE框架,利用LLM作为知识驱动的特征工程师,将高维图像转化为低维临床可解释特征,在数据稀缺的疤痕分类中优于端到端深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19998 2026-08-21 cs.IR 新提交 89%

SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation

SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏

Seunghyun Baek, Gyuseok Lee, Seunghan Lee, Wonbin Kweon, Dong Wang, SeongKu Kang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 89%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18645 2026-08-20 cs.SE 新提交 89%

Code Health in LLM-Based Test Generation: Effectiveness and Token Efficiency

基于大语言模型的测试生成中的代码健康度:有效性与标记效率

Freya Wirdemann, Markus Borg, Nadim Hagatulah, Adam Tornhill

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究LLM生成单元测试的有效性随CodeScene的CodeHealth水平的变化,发现CH是测试有效性的微弱但一致信号,且与输入标记数负相关,证实可维护性与LLM软件开发存在关联。

Comments Accepted at the Engineering Track of the 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16174 2026-08-18 eess.SY cs.SY 新提交 89%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15531 2026-08-18 cs.DC 新提交 89%

FlashQuant: Sparse-Dense Fusion for Memory-Efficient Outlier-Aware LLM Inference

FlashQuant:面向内存高效的异常值感知大语言模型推理的稀疏-密集融合方案

Junqing Lin, Jingwei Sun, Zhengding Hu, Guangzhong Sun

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FlashQuant是面向异常值感知W4A16解码的内容共享执行框架,通过融合GPU内核实现稀疏-密集路径的片上复用,在内存受限的LLM解码中大幅降低异常值处理开销,获得显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15118 2026-08-18 cs.DC 新提交 89%

Collective Communication for Distributed LLM Systems: Planning, Runtime Adaptation, and Computation Coordination

分布式大语言模型系统的集体通信:规划、运行时适配与计算协调

Xuebin Song, Menghao Zhang, Yuezheng Liu, Jinyi Xia, Shucan Yang, Xiaohe Hu, Chunming Hu, Mingwei Xu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出以集体为中心的分类法,将分布式LLM系统集体通信进展分为规划、执行适配、计算通信协调三层,探讨相关开放挑战与未来机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14575 2026-08-18 cs.NI 新提交 89%

HW-Router: Hardware-Aware Routing for Scalable Multi-LLM Serving

HW-Router:面向可扩展多大语言模型服务的硬件感知路由

Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 HW-Router是一种动态路由框架,结合实时硬件信号与模型特征实现SLO感知路由,在多LLM服务中相比CARROT等基线显著降低延迟、提升SLO达成率并均衡GPU负载。

Comments Preprint

Journal ref 2026 Design Automation Conference (DAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13868 2026-08-17 cs.AR 新提交 89%

Exploring High-Bandwidth Flash for Modern LLM Inference: Opportunities and Challenges

探索用于现代大语言模型推理的高带宽闪存:机遇与挑战

Dowon Son, Yonggon Park, Hyunuk Cho, Hyungkyu Ham, Onur Mutlu, Sungjin Lee, Gwangsun Kim, Jisung Park

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究分析高带宽闪存(HBF)用于大语言模型(LLM)推理的机遇与挑战,发现HBF可提升LLM服务系统性能并降低GPU需求,但需维持类HBM读取带宽并提升耐用性。

Comments 4 pages, 7 figures, IEEE Computer Architecture Letters (CAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09089 2026-08-11 stat.AP 新提交 89%

Extreme Value Alpha and Crash Risk: Separating Structural Tails from Lottery Tails with LLM-Extracted Disclosure Networks

极值阿尔法与崩盘风险:通过LLM提取的披露网络区分结构性尾部与彩票式尾部

Lin Zhang, Fan Yang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究利用LLM从10-K文件提取的公司披露网络,将股票收益上尾分为崩盘侧与结构性尾部,通过24家科技公司试点验证了崩盘侧信号的有效性,明确了判别器的适用边界。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09440 2026-08-11 cs.IR 新提交 89%

MetaStrategy: Generative Ranking with Executable LLM Strategies

MetaStrategy:基于可执行大语言模型策略的生成式排序

Chengyu Lai, Jiuning Lin, Zhibo Xiao, Xiaodong Zhu, Ruiquan Lan, Bin Zhang, Zihong Huang, Wendong Zhang, Chuxin Chen, Yinjiang Cai, Shuai Zhong, Lingqing Zhang, Dimin Wang, Jialin Zhu, Han Zhu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MetaStrategy是一种可执行LLM策略的生成式排序框架,经淘宝部署测试,其提升了多项核心业务指标且未增加响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09252 2026-08-11 cs.AR 新提交 89%

FSGen: Agile Fused and Sparse Accelerator Generator with Accurate Power Model for LLM Applications

FSGen:面向大语言模型应用的具备精确功耗模型的敏捷融合与稀疏加速器生成器

Jay Zhe-An Mok, Qijun Zhang, Zhiyao Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FSGen是面向LLM的敏捷加速器生成框架,支持融合算子数据流与稀疏性,其PPA评估器精度更高,能找到功耗效率提升1.4倍或加速比达10倍的帕累托最优设计,大幅缩短设计空间探索时间,品质因数提升58倍。

Comments Research Manuscript Published in Design Automation Conference (DAC) 63 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08611 2026-08-11 cs.DC cs.AR cs.CE 新提交 89%

C2C-Explorer: An Exploration Framework for Chip-to-Chip Interconnect Architectures in LLM Cloud Computing Systems

C2C-Explorer:用于大语言模型云计算系统中芯片间互连架构的探索框架

Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 C2C-Explorer是一种自适应贝叶斯DSE框架,整合流量生成器、可扩展互连模拟器与评估器,用于探索LLM云计算系统的C2C互连架构,在DeepSeek-R1-671B负载中可提升有效吞吐量并降低内存占用。

Comments Accepted in DAC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 89%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 89%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 89%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02341 2026-08-04 cs.NI 新提交 89%

Broadcast Rate Limits in Wi-Fi: A Forgotten Bottleneck for Collaborative Edge LLM Inference

Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈

Liujianfu Wang, Yuyang Du, Shiqi Xu, Soung Chang Liew

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00378 2026-08-04 cs.SE 新提交 89%

CASPER-Change-Aware Slice Prioritization for Efficient Regression Testing of LLM-based systems

CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序

Biruk Asmare Muse, Lionel Briand, Yiwei Lu, Keheliya Gallaba

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01126 2026-08-04 cs.IT math.IT 新提交 89%

Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework

面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架

Le Yang, Zhouyong Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29575 2026-08-03 cs.DC cs.PF 新提交 89%

SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving

SLIM:面向大语言模型服务的饱和度感知轻量级性能建模

Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Jordi Torres, Josep Ll. Berral

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。

Comments Pol G. Recasens and Ferran Agullo contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28150 2026-07-31 cs.DC 新提交 89%

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

SmartGen:支持无缝拆分式大语言模型推理的选择性KV缓存传输方案

Xuchuan Luo, Jiacheng Shen, Xin Wang, Yangfan Zhou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SmartGen是一款KV缓存传输引擎,通过三种数据传输路径实现拆分式LLM推理的KV缓存选择性传输,可将首token生成时间最多缩短4.3倍,且后续性能与准确率相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27648 2026-07-31 cs.SE 新提交 89%

Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows

换个名字就不甜了:LLM文档工作流中格式鲁棒性的实证研究

Xiaoyu Zhang, Xianyun Cheng, Tianlin Li, Yuwei Zheng, Yue Yang, Yang Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出感知格式的变形测试框架,经大规模实证研究发现LLM文档工作流的格式鲁棒性存在严重问题,切换格式可致准确率降53.63%,并设计出无需重训模型的缓解策略。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27606 2026-07-31 cs.SE 新提交 89%

LimICE: Integrating LLM into ICE Framework for Efficient Loop Invariant Inference

LimICE:将大语言模型(LLM)集成到ICE框架以实现高效循环不变式推理

Kai Fan, ShiWen Yu, GuangSheng Fan, HaoAng Chi, WanWei Liu, Ji Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究提出集成LLM与ICE框架的增量式学习框架LimICE,用于循环不变式综合,在367个线性、50个非线性基准上的实验显示其解决实例更多、运行速度更快,性能优于相关基线。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26633 2026-07-30 cs.AR 新提交 89%

NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement

NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现

Sookyung Choi, Seungyong Lee, Kangkyu Park, Yunseo Chun, Junseok Lee, Hyeongseok Gwak, Myunghyun Rhee, Euiseok Kim, Donguk Moon, Kwangsik Shin, Guseul Heo, Youngpyo Joo, Hoshik Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。

Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25498 2026-07-29 cs.AR 新提交 89%

Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling

超越预填充-解码分解:通过动态算子调度剖析异构平台上的大语言模型推理

Jiaqi Yang, Jiayi Li, Yihan Fu, Hongxiao Zhao, Zhan Chen, Qiuping Wu, Yuchao Yang, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对异构平台上LLM推理,提出硬件感知的DOPS框架,通过构建阶段感知DAG,集成双焦点调度器和权重布局仲裁器,实现算子调度与权重布局联合优化,在异构系统中取得加速效果并支持相关分析。

Comments To appear in MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17175 2026-07-21 cs.DC 新提交 89%

LMEdge: QoS-Aware LLM Inference Orchestration on Edge Clusters

LMEdge:边缘集群上的QoS感知大语言模型推理编排

Reza Farahani, Zoha Azimi, Mario Colosi, Schahram Dustdar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。

Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏