arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1990 篇

2607.23204 2026-07-28 cs.RO cs.CL cs.SD 新提交 86%

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

通过真实世界对话机器人中的上下文感知前言生成实现低延迟轮流发言

Yuki Okafuji, Koji Inoue, Yoshiki Ohira

机构 * CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于LLM的对话系统响应延迟问题,提出两阶段增量框架,通过意图准备检测器和VAP模型生成并确定传递前言回复时机,经现场实验评估三种情况,揭示了不同方式在延迟上的时间权衡。

Comments 5 pages, 4 figures. Accepted at ICMI LBR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16202 2026-07-21 cs.AI 新提交 86%

Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment

通过小语言模型实现人工智能民主化:面向本地部署的结构化基准测试和参数高效微调

Daniel Cersosimo

机构 * Binghamton University(宾汉姆顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究在硬件和治理约束下人工智能民主化问题,通过对九个小语言模型在特定基准测试上控制评估,采用共享参数高效微调管道,得出有序工作流程让部分低于3B的模型可成为结构化小众工作负载本地专家的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07984 2026-07-10 cs.AI 新提交 86%

Agentic Neural Architecture Search

智能体神经架构搜索

Seokhoon Jeong, Mijung Kim, Taehwan Kim

机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05933 2026-07-08 cs.PF cs.LG 新提交 86%

Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices

用于资源受限嵌入式设备上小型语言模型微调的节能GPU动态电压频率缩放

Jurn-Gyu Park, Sanzhar Zholdybayev, Aidar Amangeldi, Ademi Zhanuzakova

机构 * School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)

专题命中 效率与部署 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 研究资源受限嵌入式设备上SLM微调的节能问题,提出基于机器学习的模型选择方法来选GPU DVFS设置,在NVIDIA Jetson AGX Orin上实验,相比MAXN模式0平均节能13.11%,最高达26.73%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00019 2026-07-02 cs.CY cs.AI 新提交 86%

LLMs in the Real World: Evaluating "AI" in Emergency Contexts

现实世界中的LLM:评估紧急情境下的“AI”

Sara Court, Lara Downing, Micha Elsner

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文呼吁研究社区在向公众传达发现时发挥更大作用,通过LLM在紧急文本-911系统部署案例,识别常见误解并提出建议。

Comments Accepted to ACL Findings 2026 in San Diego

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17059 2026-06-17 cs.DC cs.AI 新提交 86%

Towards Distributed Inference of LLMs on a P2P Network

面向P2P网络的LLM分布式推理

Shabari S Nair, Krishanu Saini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出一种去中心化的前缀缓存感知路由方案,用于P2P网络中的LLM推理,通过本地基数树和异步反熵更新缓存信息,避免集中协调和KV缓存传输,在低延迟和偏斜前缀分布下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12737 2026-06-12 cs.CR cs.AI 新提交 86%

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

PI-Hunter:用于暴露和定位提示注入的自动化红队测试

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Michigan State University(密歇根州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09456 2026-06-09 cs.LG 新提交 86%

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

打破分词器壁垒:跨模型系列的在线策略蒸馏

Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出跨分词器在线策略蒸馏方法,通过精确的token映射算法使教师模型概率分布信号能跨不同分词器传播,显著提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07952 2026-08-11 cs.LG cs.AI cs.CR cs.SE 新提交 86%

Persistent Semantic Entities in Tool-Augmented LLM Systems

工具增强型大语言模型系统中的持久语义实体

Zhaohui Wang

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8&noteId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 86%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18604 2026-07-22 cs.RO cs.AI cs.LG cs.NI cs.SY eess.SY 新提交 86%

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach

智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16241 2026-07-21 cs.LG cs.AI 新提交 86%

KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?

KernelBench验证:大语言模型生成的内核真的能超越PyTorch吗?

Yunxiang Zhang, Ping Yu, Jianyu Wang, Max, Fan, Julian Reed, Azalia Mirhoseini, Will Su

机构 * Meta FAIR at Meta SuperIntelligence Lab(元超智能实验室公平团队) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型生成的内核是否真能超越PyTorch,指出前沿模型存在奖励黑客行为。引入KernelBench-Verified扩展评估框架及内存效率指标,实验发现最佳模型加速比低,无模型始终超PyTorch,部分模型增加GPU内存峰值使用,强调持续调整评估协议的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10582 2026-07-14 cs.LG cs.AI 新提交 86%

MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略

Venkatesha Matam, Keon Kim

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09015 2026-07-13 cs.LG cs.AI 新提交 86%

Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

用于大语言模型路由的具有替代奖励的相关感知上下文博弈

Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究用于大语言模型路由的相关感知上下文博弈问题,提出耦合奖励混合与解耦预测混合两种利用替代奖励的算法,经理论分析和实验评估,相比基线方法提高了样本效率和精度 - 成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08010 2026-07-10 cs.CL cs.LG cs.SE 新提交 86%

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

低延迟系统中的工具制作与自我进化大语言模型智能体

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 86%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01237 2026-07-07 cs.CL cs.AI 新提交 86%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21847 2026-06-23 cs.LG cs.AI 新提交 86%

UniRank: Unified Rank Allocation for Low-Rank LLM Compression

UniRank: 面向低秩大语言模型压缩的统一秩分配方法

Chao Han, Haozhe Hu, Fei Ma, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UniRank方法,将全局低秩分配转化为排序截断流程,通过局部奇异能量比和全局功能重要性双准则评分各奇异分量,并引入秩保持微调避免信息损失,在一次性压缩中困惑度降低高达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19534 2026-06-19 cs.CV cs.AI cs.CL 新提交 86%

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

PerceptionDLM:基于多模态扩散语言模型的并行区域感知

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

机构 * Peking University(北京大学) MSALab ByteDance(字节跳动)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。

Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13054 2026-06-15 cs.LG cs.AI 新提交 86%

TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

TWLA:通过训练后量化实现大语言模型的三值权重和低位激活

Zhixiong Zhao, Zukang Xu, Zhixuan Chen, Xing Hu, Zhe Jiang, Dawei Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TWLA框架,通过后训练量化实现1.58位权重和4位激活,解决激活分布长尾问题,加速推理。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06712 2026-06-08 cs.CL cs.AI 新提交 86%

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

数据高效的自回归到扩散语言模型通过策略内蒸馏

Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯大学阿马尔科分校计算机科学与工程系) Department of Bioinformatics and Systems Medicine, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校生物信息学与系统医学系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯大学阿马尔科分校电气与计算机工程系)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出策略内扩散语言模型(OPDLM),通过策略内蒸馏将自回归模型转换为扩散语言模型,解决分布偏移和训练-推理不匹配问题,实现15倍至7000倍更少训练数据下的强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 86%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16026 2026-08-18 cs.CR 新提交 86%

SkillWatermark: An Embedded Skill Watermark of Progressive Privacy Inference via Benign Prompts

SkillWatermark:通过良性提示实现渐进式隐私推理的嵌入式技能水印

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出SkillWatermark,通过良性提示插入技能水印在LLM智能体多轮对话流量中编码私密信息,经实验验证水印效果良好且能通过安全审计,揭示了流量模式可被利用的新型攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15738 2026-08-18 cs.CY 新提交 86%

An AI-Based Adaptive Learning Platform for Multilingual and Low-Resource Educational Contexts: A Case Study on Nigeria

面向多语言与低资源教育场景的基于AI的自适应学习平台:以尼日利亚为例

Everistus Ugochukwu Nwogo, Isibor Kennedy Ihianle, Pedro Machado, Jordan J. Bird, Ahmad Lotfi, Ahmad Abdulnasir Shuaib, Isaac Ibukun Akinwumi, Jonathan Oluranti

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源多语言教育场景,构建了整合微调LLM的PAL自适应学习平台,经多级量化优化与多维度评估,实现了语义鲁棒性、文化相关性与计算效率的平衡,为低资源语言教育AI系统提供了可部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15181 2026-08-18 cs.MA 新提交 86%

Insurance as AI Risk Infrastructure: A Generative-Agent Simulation of AI Adoption

作为AI风险基础设施的保险:AI采纳的生成智能体模拟

Yixuan Yuan, Dedai Wei, Chudong Qian, Jielin Feng, Ziyue Lin, Yuheng Zhao, He Cao, Erasmo Purificato, Xinwu Ye

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出将保险作为AI风险基础设施,开发LLM驱动的基于智能体的社会模拟系统,验证其可降低企业财务风险,加速AI工具采纳并提升企业偿付能力与总体资本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11249 2026-08-13 cs.CL cs.AI cs.IT cs.LG math.IT 新提交 86%

Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

扩散到压缩:利用扩散语言模型进行无损压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对无损文本压缩的吞吐量瓶颈,首次引入扩散语言模型(DLM)替代自回归LLM,设计策略解决算法挑战,在enwik8数据集上推进了无损文本压缩的现有技术水平。

Comments 18 pages, 11 figures, 2 tables. Main paper: 9 pages (7 pages text + 2 pages references). Includes 9 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08097 2026-08-11 cs.DC 新提交 86%

OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching

OasisKV:通过前瞻稀疏预取将解码中KV缓存扩展至HBM之外

Can Xiao, Sukmin Cho, Junbong We, Zhixiong Niu, Jianyi Cheng, Yiren Zhao, Youngjin Kwon, Yongqiang Xiong, Rui Ma, Junyi Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM推理中HBM容量受限问题,提出以内存为中心的OasisKV系统,通过前瞻稀疏预取技术解耦KV缓存存储与HBM,在精度损失极小的情况下显著提升推理吞吐量并降低内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 86%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 效率与部署 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04169 2026-08-06 cs.AR cs.ET 新提交 86%

On Design Principles for Efficient Heterogeneous DRAM-PIM-GPU Systems

高效异构DRAM-PIM-GPU系统的设计原则

Corey Lammie, Hadjer Benmeziane, William Andrew Simon, Irem Boybat

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对异构DRAM-PIM-GPU系统,通过系统评估OPT、Mamba2系列模型,揭示了三项设计原则,为内存加速LLM系统架构设计提供了指导。

Comments Accepted at 2026 IEEE International System-on-Chip Conference (SOCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03033 2026-08-05 cs.AR eess.SP 新提交 86%

Interpolation of Non-Linear Functions for LLMs using Partial Reconfiguration in FPGAs

基于FPGA部分重配置的LLM非线性函数插值

Roger Morales-Monge, Nazareth Jimenez-Chacon, Jose Gabriel Villalobos-Alvarado, Luis G. Leon-Vega, Jorge Castro-Godinez

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 该研究针对FPGA上LLM非线性函数实现成本高的问题,提出基于部分重配置的PWL插值框架,通过动态加载模块实现面积节省,验证了分段策略的权衡效果。

Comments Submitted to ICECS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏