arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2608.08033 2026-08-11 eess.SP 新提交 82%

WiFo-INR: A Wireless Foundation Model Based on Implicit Neural Representations

WiFo-INR:一种基于隐式神经表示的无线基础模型

Boxun Liu, Xuanyu Liu, Shijian Gao, Xiang Cheng, Liuqing Yang

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出基于隐式神经表示的无线基础模型WiFo-INR,通过两阶段自监督预训练实现高效紧凑的CSI表示,在性能提升的同时降低延迟,可高效迁移至多任务并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 82%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02050 2026-08-04 cs.CL cs.AI cs.LG 新提交 82%

TextNCA: Neural Cellular Automata for Language Modeling via Hierarchical Local Attention

TextNCA:通过分层局部注意力实现语言建模的神经细胞自动机

Avni Mittal, Avinash Anand, Ashutosh Kumar, Dikshant Kukreja, Kritarth Prasad, Sushane Dulloo, Erik Cambria, Timothy Liu, Zhengkui Wang, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度信息技术学院) Nanyang Technological University(南洋理工大学) NVIDIA AI Technology Centre(英伟达人工智能技术中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出分层局部注意力的TextNCA模型作为分析探针,发现其性能受从窄到宽的分阶段调度主导,迭代和GRU门控等仅带来小增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01356 2026-08-04 cs.CV 新提交 82%

Harnessing Adversarial Distillation to Customise Debiased, Disease-Specific Pathology Foundation Models for Breast Cancer

利用对抗蒸馏定制去偏差的、针对乳腺癌的疾病专用病理学基础模型

Zhiwei Chen, Yang Hu, Yuxiang Xiao, Yakun Ju, Tianyang Zhang, Yingxue Xu, Wei Li, Hao Chen, Jens Rittscher, Kaixiang Yang

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学系) ZoyMed(佐医医疗(ZoyMed))

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本研究提出SmartStu框架,通过多教师集成蒸馏与对抗蒸馏等技术,定制出比通用PFMs小30倍以上且性能相当的乳腺癌专用病理学基础模型。

Comments 11 pages, 2 figures, 2 tables. Accepted to MICCAI 2026 (early accept)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26554 2026-07-30 cs.CV 新提交 82%

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩

Yitao Zhu, Mengjun Liu, Yingji Fu, Haowen Pang, Anqi Qiu

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract)

AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交 82%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract)

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23015 2026-07-28 cs.CR 新提交 82%

Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks

Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性

Ying JinCheng, Minghui Xu, Yinhao Xiao, Xiuzhen Cheng, Wencheng Yang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22723 2026-07-28 cs.CV 新提交 82%

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

通过分类引导的大型视觉语言模型从文档中提取视觉信息

Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li

机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司) School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)

专题命中 效率与部署 :language model(title,abstract);SFT(abstract)

AI总结 研究从视觉丰富文档提取视觉信息的挑战,提出分类引导大型视觉语言模型框架,通过解耦分类与提取、运用动态提示工程实现零样本推理,在真实数据集上性能超监督基线,为办公自动化文档理解提供高效方案。

Comments 14 pages, 3 figures

Journal ref Scientific Reports 16, 14158 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22605 2026-07-28 cs.CY 新提交 82%

Socioeconomic Inference in LLM Medical Triage: Same Symptoms, Different ZIP Code

大语言模型在医疗分诊中的社会经济推断:相同症状,不同邮政编码

Qi Han Wong

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型对相同症状但不同社会经济地位患者的医疗分诊建议,通过三个模型固定症状改变SES信号,发现对明确信号各模型均提高低SES患者急诊转诊率,对隐含信号的敏感性因模型而异,揭示信号明确性梯度并发布相关内容。

Comments 8 pages, 4 tables. Code, prompts, and raw results: https://github.com/wongqihan/triagebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21983 2026-07-27 cs.CR 新提交 82%

Ethereum NFT Smart Contracts: Knowledge-Guided Vulnerability Detection with LLM and Code Slicing

以太坊非同质化代币智能合约:基于大语言模型和代码切片的知识引导漏洞检测

Deyu Yang, Rundong Wei, Xiaoqi Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究以太坊NFT智能合约漏洞检测,结合漏洞聚焦代码切片、ERC-721知识库及受限DeepSeek分析,正则表达式定位候选语句,提取代码切片分析,结果显示聚焦代码上下文和领域约束影响检测器输出,提升阳性标签率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20475 2026-07-24 cs.AI cs.CL cs.LG 新提交 82%

SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification

SonicSampler:用于语言模型采样和推测性验证的统一瓦片感知内核

Pragaash Ponnusamy, Shivam Sahni, Jue Wang, Tri Dao

机构 * Together AI

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对语言模型推理采样中现有实现的局限,提出SonicSampler,它是统一的瓦片感知Triton内核套件,垂直融合采样流水线。核心方法是分层两阶段top-k算法,在异构推测性解码工作负载中比基线快达16倍,保持灵活批处理执行。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13068 2026-07-16 cs.AR 新提交 82%

The Economics of AI Decoding Chips: Rebalancing Compute, Capacity, and Bandwidth for Efficient LLM Inference

人工智能解码芯片的经济学:重新平衡计算、容量和带宽以实现高效的大语言模型推理

Michael J. Yuan, Ju Long

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型解码中GPU计算与内存不匹配问题,提出用F/B和F/S常数衡量效率,主张重新平衡解码加速器,介绍Skymizer HTX-301优势,如成本低、无受限输入,能以较低成本实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08326 2026-07-10 cs.CY 新提交 82%

Diagnosing and Repairing Persona Collapse in LLM Advice

诊断和修复大语言模型建议中的角色崩塌

Harsh Kumar, Karina Vold, Louis Tay, Ashton Anderson

专题命中 效率与部署 :LLM(title);post-training(abstract);prompting(abstract)

AI总结 研究大语言模型建议中的角色崩塌问题,提出逆过程蒸馏方法,将情境到角色的策略提炼出来进行训练,减少与人类角色分布的差异,但在盲测中发现多数经验丰富的建议者更青睐崩塌的默认回复。

Comments Working draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05533 2026-07-08 cs.CV 新提交 82%

Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models

用于边缘高效病理学基础模型的多教师对比蒸馏

Tim Lenz, Maurice Heide, Marco Gustav, Nic G. Reitsam, Jakob Nikolas Kather

机构 * EKFZ for Digital Health(数字健康EKFZ) TU Dresden(德累斯顿工业大学) University of Augsburg(奥格斯堡大学) Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) Department of Medicine I, TU Dresden(德累斯顿工业大学第一医学院) NCT Heidelberg(海德堡NCT) University of Leeds(利兹大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 研究针对计算病理学基础模型本地部署难题,提出MuCoDi预训练框架,通过多教师对比蒸馏,将多个PFMs的切片嵌入蒸馏到轻量级编码器,经实验验证该方法能大幅减小模型大小并保持性能,推动病理学表示向边缘部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04164 2026-07-07 cs.DC 新提交 82%

BrownoutMoE: Structure-Aware Expert Grouping for Efficient and Accurate LLM Web-based Services

BrownoutMoE:用于高效准确的基于大语言模型的网络服务的结构感知专家分组

Yi Ding, Minxian Xu, Zhengxin Fang, Kejiang Ye, Chengzhong Xu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究基于混合专家(MoE)的大语言模型在网络服务中推理的问题,通过结构感知优化框架BrownoutMoE,将专家分组并利用强化学习找策略,减少精度下降,提升吞吐量。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01851 2026-07-03 cs.CV 新提交 82%

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction

几何基础模型蒸馏用于高效月球三维重建

Clémentine Grethen, Florient Chouteau, Géraldine Morin, Simone Gasparini

机构 * IRIT, University of Toulouse(图卢兹大学IRIT研究所) Airbus Defence and Space(空中客车防务与航天公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对硬件受限场景,通过知识蒸馏将MASt3R模型压缩7倍,保留大部分重建精度,提出SVD初始化方法提升训练稳定性,并揭示编码器类型、蒸馏策略等关键因素。

Comments Accepted to ECCV 2026, code can be accessed via https://clementinegrethen.github.io/publications/ECCV.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28057 2026-06-29 cs.CL cs.AI cs.LG 新提交 82%

MultiHashFormer: Hash-based Generative Language Models

MultiHashFormer: 基于哈希的生成式语言模型

Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield, United Kingdom(谢菲尔德大学计算机科学学院,英国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MultiHashFormer框架,通过多哈希签名表示令牌,实现参数高效的因果语言建模,在多个规模上优于标准Transformer。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22376 2026-06-23 quant-ph 新提交 82%

Vibe Calibration: Autonomous Bring-up of a 112-Qubit Superconducting Quantum Processor by a Skill-Orchestrating Language Agent

Vibe Calibration:通过技能编排语言代理自主启动112量子比特超导量子处理器

Huikai Xu, Jiaxiu Han, Shigang Ou, Cheng Ye, Zisong Shen, Jing Gao, Yijia Wang, Tianrui Che, Yu Song, Weiyang Liu, Lei Wang, Lin-Feng Zhang, Pan Zhang, Hai-Feng Yu

专题命中 效率与部署 :language agent(title);large language model(abstract);language model(abstract)

AI总结 提出Vibe Calibration系统,利用大语言模型代理将专家隐性知识转化为可复用的技能,在112量子比特处理器上实现4.7小时内自主校准108个量子比特,速度提升4-5倍,并跨设备迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11270 2026-06-11 cs.LG cs.AI cs.CL 新提交 82%

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation

量化语言模型蒸馏中的潜意识行为迁移比率

Uwe König, Hamza Kazmi, Ruizhe Li, Maheep Chaudhary

机构 * University of Freiburg(弗赖堡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过控制教师模型行为强度并蒸馏学生模型,量化了潜意识行为迁移比率,发现迁移具有鲁棒性且呈现不同缩放行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08470 2026-06-09 cs.RO 新提交 82%

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving

LUNA-AD: 面向自动驾驶的轻量级不确定性感知语言模型与终身学习

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 提出LUNA-AD,一种结合三系统架构、多智能体分析、双头轻量模型和反思驱动终身学习的轻量级不确定性感知语言模型,在nuPlan上实现高成功率与低推理延迟。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 81%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27244 2026-08-28 cs.DB cs.AI 新提交 81%

Compositional Online Learning for Semantic Data Processing Systems

面向语义数据处理系统的组合式在线学习

Paweł Liskowski, Fuheng Zhao, Benjamin Han, Anupam Datta, Dimitris Tsirogiannis

机构 * Snowflake Inc.(斯诺flake公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对语义数据处理系统中LLM调用成本高、延迟大的问题,提出组合式在线学习框架,在Cortex AISQL案例中实现约8倍的实际性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 81%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交 81%

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24763 2026-08-26 cs.CV cs.LG 新提交 81%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23834 2026-08-26 cs.AI 新提交 81%

Minima-KV: Retention-Preserving KV Cache Compression with Mixed-Format Paged Attention

Minima-KV:采用混合格式分页注意力的保留保留KV缓存压缩技术

Sergii Kozyrev, Davyd Maiboroda

机构 * Minima AI, Inc.(Minima AI公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对长上下文LLM的KV缓存瓶颈,提出Minima-KV混合格式分页注意力压缩方案,在Qwen3.6-27B模型上实现3.50倍KV压缩,性能与密集控制相当,无需密集影子。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23375 2026-08-25 cs.CR cs.AI 新提交 81%

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

针对基于Gumbel推理验证的对抗性熵膨胀

Nikita Kezins

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对基于Gumbel的LLM推理验证防御,发现控制提示分布的攻击者可扩大容许token集合,使隐蔽信道泄露能力提升,建议动态校准抖动宽恕阈值。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22854 2026-08-25 cs.LG 新提交 81%

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

合适规模的思考:跨后训练大语言模型的摊销蒸馏

Yan Zhou, Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) IST Austria(奥地利科学技术研究所)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。

Comments 8 pages, 6 figures. EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21393 2026-08-25 cs.AI 新提交 81%

Spyre-Accelerated Retrieval-Augmented Generation on IBM LinuxONE: A Cloud-Native Architecture for Secure, High-Throughput Enterprise AI Inference

基于IBM LinuxONE的Spyre加速检索增强生成:一种用于安全、高吞吐量企业AI推理的云原生架构

Sandeep Bokkasam, Pankaj D

机构 * IBM ISDL

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于IBM LinuxONE的六子系统RAG架构,利用Spyre加速器等组件实现企业AI推理,使敏感数据不离开硬件边界,延迟低于2秒,较平台外推理降低20倍,满足受监管行业的安全与吞吐量需求。

Comments 8 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20494 2026-08-24 cs.NI cs.AI cs.MA 新提交 81%

Towards Traffic Modelling of Multi-Agent Systems: The Role of Coordination Topology

面向多智能体系统的流量建模:协调拓扑的作用

Davide Lamagna, Albert Cabellos, Alberto Rodriguez-Natal, Gábor Rétvári, Berta Serracanta

机构 * UPC, BarcelonaTech(加泰罗尼亚理工大学(巴塞罗那理工)) Cisco(思科公司) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对多智能体LLM系统,通过500次重复运行的多层测量框架,揭示了协调拓扑对LLM请求到达过程的关键影响,相关框架与分析流程已公开。

Comments 7 pages, 5 figures, 4 tables. Published at the ACM SIGCOMM Workshop on Networks for AI Computing (NAIC '26)

Journal ref SIGCOMM '26: Proceedings of the ACM SIGCOMM 2026 Conference, 2060 - 2066

详情

展开后加载摘要…

URL PDF HTML 收藏