arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1990 篇

2606.17666 2026-06-17 cs.SE cs.AI 新提交 90%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17536 2026-06-17 cs.CV cs.AI 新提交 90%

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) National Taiwan University(国立台湾大学) Wuhan University(武汉大学) Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 90%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16332 2026-06-16 cs.DC cs.AI cs.PF 新提交 90%

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

SMEPilot: 利用可扩展矩阵扩展表征和优化LLM推理

Feiyang Chen, Haibo Chen

机构 * IPADS, Shanghai Jiao Tong University(上海交通大学IPADS)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对CPU矩阵扩展单元与核心在LLM推理中的不匹配,提出SMEPilot引擎,通过基于屋顶线的表征指导算子执行选择,实现SME与CPU协同工作,端到端性能提升达3.94倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13968 2026-06-15 cs.DC cs.AI 新提交 90%

STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

STREAM:具有双通道 HPC 令牌流的多层 LLM 推理中间件

Anas Nassar, Steve Mohr, Leonard Apanasevich, Himanshu Sharma

机构 * Advanced Cyberinfrastructure for Education and Research (ACER) University of Illinois Chicago(高级教育与研究计算基础设施(ACER)伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 STREAM 系统,通过三层路由架构(本地、HPC、云)和双通道 HPC 流(控制平面与数据平面分离)实现亚秒级 TTFT,解决现有系统无法统一三种推理场景的问题。

Comments 6 pages, 1 figure, PEARC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 90%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11379 2026-06-11 cs.AI 新提交 90%

Automated Mediator for Human Negotiation: Pre-Mediation via a Structured LLM Pipeline

人类谈判的自动调解器:通过结构化LLM流水线进行预调解

Jamie Bergen, Sarit Kraus

机构 * University of Washington(华盛顿大学) University of Haifa(海法大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结构化LLM流水线作为自动调解器,在整合性谈判中支持预调解,通过分解准备任务为专用模块,在短期自我报告结果上与人类调解员相当,并在偏好推理任务上误差降低36%。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10861 2026-06-10 cs.SE cs.AI cs.HC 新提交 90%

From Perception to Action: Can UI Interventions Foster Sustainable LLM Chatbot

从感知到行动:UI干预能否促进可持续的LLM聊天机器人

Nitish Patkar, Pooja Rani, Jack Glässer, Simon Lüscher, Martin Kropp

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(瑞士西北应用科学与艺术大学(FHNW)) University of Mannheim(曼海姆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过UI干预(如模式切换、能耗反馈)提升用户对LLM聊天机器人能耗的感知,并鼓励节能行为,发现模式切换是主要行为机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09551 2026-06-09 cs.CR cs.AI 新提交 90%

FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing

FuseFSS:基于函数秘密共享的高效安全LLM推理

Yuhan Ma, Yong Li, Stefan Schmid

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FuseFSS编译器,通过统一编译流水线替代逐算子协议设计,实现安全推理中非线性与辅助操作的高效处理,在BERT和GPT模型上取得1.24-1.50倍加速并减少通信与预处理开销。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 90%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07846 2026-06-09 cs.DC cs.AI cs.MA 新提交 90%

Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method

成本感知的LLM-Agent工作流投机执行:一种综合五维方法

Faisal Fareed

机构 * AWS(亚马逊网络服务)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种五维投机执行方法,通过贝叶斯概率估计和成本定价,在LLM-Agent工作流中平衡延迟与成本,并确保无副作用回滚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13591 2026-08-17 cs.AI cs.CL 新提交 90%

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

大语言模型中的稳定校准误差:高置信度错误的实用视角

Akira Okutomi

机构 * ToppyMicroServices OÜ

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出稳定校准误差概念,结合两类诊断方法,发现自我批判提示可降低模型隐藏状态敏感性,但高置信度错误未必是推理脆弱,部分或为稳定校准不当。

Comments Accepted at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML)@ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13580 2026-08-17 cs.CL cs.AI 新提交 90%

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2:以阿拉伯语为核心的开源大语言模型家族

Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Jais 2是MBZUAI等联合开发的以阿拉伯语为核心的开源大语言模型家族,含70B、8B参数变体,在阿拉伯语及文化相关基准上表现领先,已开源并部署为多平台聊天应用,可支撑相关研究开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18280 2026-07-22 cs.LG cs.AI 新提交 90%

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

超越单维压缩:大语言模型的复合稀疏前沿

Chao Han, Haozhe Hu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型压缩,提出复合稀疏框架,结合静态参数剪枝和动态令牌级计算,通过低秩近似、通道剪枝及引入轻量级路由器实现。实验表明其在相同总稀疏度下优于单机制压缩,揭示跨维度干扰及有效分配方式,为改进压缩提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 90%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13115 2026-07-16 cs.AI cs.LG 新提交 90%

Improving Molecular Property Prediction in Small Language Models Using Graph-based Tools

使用基于图的工具改进小语言模型中的分子性质预测

Konstantinos Bougiatiotis, Dimitrios Kelesis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型在分子性质预测时的结构盲目性问题,提出模块化上下文增强提示框架,通过GNN专家模型和提取子图来辅助预测,在MUTAG和Tox21数据集上实验表明该方法能显著提升预测准确性,验证了基序相关性,但与专门GNN模型仍有差距。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08786 2026-07-13 cs.LG cs.AI cs.AR 新提交 90%

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18063 2026-06-17 cs.CV cs.AI cs.LG 新提交 90%

When LLMs Analyze Scars: From Images to Clinically-Meaningful Features

当LLM分析疤痕:从图像到临床有意义的特征

Ruman Wang, Hangting Ye

机构 * Liaoning University of Traditional Chinese Medicine(辽宁中医药大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ScaFE框架,利用LLM作为知识驱动的特征工程师,将高维图像转化为低维临床可解释特征,在数据稀缺的疤痕分类中优于端到端深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19998 2026-08-21 cs.IR 新提交 89%

SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation

SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏

Seunghyun Baek, Gyuseok Lee, Seunghan Lee, Wonbin Kweon, Dong Wang, SeongKu Kang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19803 2026-08-21 cs.LG cs.AI cs.CL 新提交 89%

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理

Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 89%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18645 2026-08-20 cs.SE 新提交 89%

Code Health in LLM-Based Test Generation: Effectiveness and Token Efficiency

基于大语言模型的测试生成中的代码健康度:有效性与标记效率

Freya Wirdemann, Markus Borg, Nadim Hagatulah, Adam Tornhill

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究LLM生成单元测试的有效性随CodeScene的CodeHealth水平的变化,发现CH是测试有效性的微弱但一致信号,且与输入标记数负相关,证实可维护性与LLM软件开发存在关联。

Comments Accepted at the Engineering Track of the 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16174 2026-08-18 eess.SY cs.SY 新提交 89%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15531 2026-08-18 cs.DC 新提交 89%

FlashQuant: Sparse-Dense Fusion for Memory-Efficient Outlier-Aware LLM Inference

FlashQuant:面向内存高效的异常值感知大语言模型推理的稀疏-密集融合方案

Junqing Lin, Jingwei Sun, Zhengding Hu, Guangzhong Sun

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FlashQuant是面向异常值感知W4A16解码的内容共享执行框架,通过融合GPU内核实现稀疏-密集路径的片上复用,在内存受限的LLM解码中大幅降低异常值处理开销,获得显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15118 2026-08-18 cs.DC 新提交 89%

Collective Communication for Distributed LLM Systems: Planning, Runtime Adaptation, and Computation Coordination

分布式大语言模型系统的集体通信:规划、运行时适配与计算协调

Xuebin Song, Menghao Zhang, Yuezheng Liu, Jinyi Xia, Shucan Yang, Xiaohe Hu, Chunming Hu, Mingwei Xu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出以集体为中心的分类法,将分布式LLM系统集体通信进展分为规划、执行适配、计算通信协调三层,探讨相关开放挑战与未来机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14575 2026-08-18 cs.NI 新提交 89%

HW-Router: Hardware-Aware Routing for Scalable Multi-LLM Serving

HW-Router:面向可扩展多大语言模型服务的硬件感知路由

Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 HW-Router是一种动态路由框架,结合实时硬件信号与模型特征实现SLO感知路由,在多LLM服务中相比CARROT等基线显著降低延迟、提升SLO达成率并均衡GPU负载。

Comments Preprint

Journal ref 2026 Design Automation Conference (DAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13868 2026-08-17 cs.AR 新提交 89%

Exploring High-Bandwidth Flash for Modern LLM Inference: Opportunities and Challenges

探索用于现代大语言模型推理的高带宽闪存:机遇与挑战

Dowon Son, Yonggon Park, Hyunuk Cho, Hyungkyu Ham, Onur Mutlu, Sungjin Lee, Gwangsun Kim, Jisung Park

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究分析高带宽闪存(HBF)用于大语言模型(LLM)推理的机遇与挑战,发现HBF可提升LLM服务系统性能并降低GPU需求,但需维持类HBM读取带宽并提升耐用性。

Comments 4 pages, 7 figures, IEEE Computer Architecture Letters (CAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09089 2026-08-11 stat.AP 新提交 89%

Extreme Value Alpha and Crash Risk: Separating Structural Tails from Lottery Tails with LLM-Extracted Disclosure Networks

极值阿尔法与崩盘风险:通过LLM提取的披露网络区分结构性尾部与彩票式尾部

Lin Zhang, Fan Yang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究利用LLM从10-K文件提取的公司披露网络,将股票收益上尾分为崩盘侧与结构性尾部,通过24家科技公司试点验证了崩盘侧信号的有效性,明确了判别器的适用边界。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09440 2026-08-11 cs.IR 新提交 89%

MetaStrategy: Generative Ranking with Executable LLM Strategies

MetaStrategy:基于可执行大语言模型策略的生成式排序

Chengyu Lai, Jiuning Lin, Zhibo Xiao, Xiaodong Zhu, Ruiquan Lan, Bin Zhang, Zihong Huang, Wendong Zhang, Chuxin Chen, Yinjiang Cai, Shuai Zhong, Lingqing Zhang, Dimin Wang, Jialin Zhu, Han Zhu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MetaStrategy是一种可执行LLM策略的生成式排序框架,经淘宝部署测试,其提升了多项核心业务指标且未增加响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏