arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 633 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 112 篇

2608.15592 2026-08-18 cs.AI 新提交 87%

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义

Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15264 2026-08-18 cs.SE 新提交 87%

AgentR A Stateful and Recovery-Aware Software Architecture for LLM-based Auditable Workflows

AgentR:面向基于大语言模型的可审计工作流的有状态且故障恢复感知的软件架构

Riya Samanta, Bidyut Saha, Soumya Kanti Ghosh, Rajkumar Buyya

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 提出AgentR架构,以有状态设计结合异步编排与成本审计,实现LLM工作流的高可恢复性、可观测性与可审计性,原型在文献综述场景验证获99.2%作业完成率及最高4.3倍并行加速

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15016 2026-08-18 cs.CR cs.AI 新提交 86%

Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference

结合数字孪生验证攻击推理的分层智能体事件响应

Yiran Gao, Juntao Chen, Tao Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对网络事件响应效率低的问题,提出整合LLM攻击推理、滚动规划与数字孪生验证的分层智能体响应框架,在33组件企业网络测试台的多阶段攻击场景中,其恢复成功率较前沿LLM基线提升18%-31%。

Comments 2026 IEEE Conference on Communications and Network Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07672 2026-08-18 cs.CR cs.CL 版本更新 86%

DYNASHIELD: A Black-Box Moving Target Defense for LLMs via Dynamic Decoding Customization

DYNASHIELD:一种通过动态解码定制实现的大语言模型黑盒移动目标防御

Xiaoqun Liu, Weiming Qi, Qiben Yan

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DYNASHIELD是一种无需访问模型内部或重新训练的黑盒LLM防御框架,通过动态定制解码配置降低了4种越狱攻击的成功率,同时保持响应质量且开销极小。

Comments Accepted by The 29th International Symposium on Research in Attacks, Intrusions and Defenses (RAID) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03057 2026-08-18 cs.LG cs.AI 版本更新 86%

LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression

LACE-SVD:用于大语言模型压缩的带累积误差校正的损失感知奇异值分解

Zhuowen Liu, Longkun Hao, Shiyu Feng, Xiaowen Chang, Ruiqun Li, Changqun Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型参数规模增长需求,提出LACE-SVD框架,先依候选压缩率估算损失增加量分配秩预算,再用局部更新和误差校正优化模型,降低累积误差传播,效果优于现有方法。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16026 2026-08-18 cs.CR 新提交 86%

SkillWatermark: An Embedded Skill Watermark of Progressive Privacy Inference via Benign Prompts

SkillWatermark:通过良性提示实现渐进式隐私推理的嵌入式技能水印

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出SkillWatermark,通过良性提示插入技能水印在LLM智能体多轮对话流量中编码私密信息,经实验验证水印效果良好且能通过安全审计,揭示了流量模式可被利用的新型攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15738 2026-08-18 cs.CY 新提交 86%

An AI-Based Adaptive Learning Platform for Multilingual and Low-Resource Educational Contexts: A Case Study on Nigeria

面向多语言与低资源教育场景的基于AI的自适应学习平台:以尼日利亚为例

Everistus Ugochukwu Nwogo, Isibor Kennedy Ihianle, Pedro Machado, Jordan J. Bird, Ahmad Lotfi, Ahmad Abdulnasir Shuaib, Isaac Ibukun Akinwumi, Jonathan Oluranti

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源多语言教育场景,构建了整合微调LLM的PAL自适应学习平台,经多级量化优化与多维度评估,实现了语义鲁棒性、文化相关性与计算效率的平衡,为低资源语言教育AI系统提供了可部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15181 2026-08-18 cs.MA 新提交 86%

Insurance as AI Risk Infrastructure: A Generative-Agent Simulation of AI Adoption

作为AI风险基础设施的保险:AI采纳的生成智能体模拟

Yixuan Yuan, Dedai Wei, Chudong Qian, Jielin Feng, Ziyue Lin, Yuheng Zhao, He Cao, Erasmo Purificato, Xinwu Ye

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出将保险作为AI风险基础设施,开发LLM驱动的基于智能体的社会模拟系统,验证其可降低企业财务风险,加速AI工具采纳并提升企业偿付能力与总体资本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-08-18 cs.CV cs.RO 版本更新 86%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19310 2026-08-18 eess.SY cs.SY 版本更新 86%

Can Carbon-Aware Data Center Workload Allocation Reduce Power System Emissions? The Role of Contract Reshuffling

具有超大规模计算中心和模块化数据中心的电力市场模型

Yihsu Chen, Abel Souza, Fargol Nematkhah, Andrew L. Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种电力市场模型,允许超大规模计算中心将LLM推理任务迁移到地理分布的模块化数据中心,以优化能源利用和减少排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15567 2026-08-18 cs.LG 新提交 85%

SchurQuant: Groupwise Discrete Optimization for Layer-Wise LLM Quantization

SchurQuant:面向层大型语言模型量化的分组离散优化

Gunjun Lee, Sehwan Son, Younjoo Lee, Byungjun Kim, Jung Ho Ahn

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SchurQuant结合SCHUROPT与多种技术,在8个Llama和Qwen模型的2位量化任务中,使无反向传播PTQ的平均零样本精度比最强基线高9.65pp,提升了2位大语言模型量化的精度。

Comments 14 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15282 2026-08-18 cs.LG cs.CV physics.bio-ph 新提交 85%

Earth Observation Foundation Models for Terrestrial Ecohydrology: From Representation Learning to Process Inference

面向陆地生态水文学的地球观测基础模型:从表示学习到过程推理

Yi Yu, Jian Peng, Yucheng Lin, Trevor F. Keenan, Thomas F. A. Bishop

机构 * The University of Sydney(悉尼大学) Helmholtz Centre for Environmental Research–UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) City University of Hong Kong(香港城市大学) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究构建框架分析EOFM在生态水文学中的应用,发现其与生态水文学需求存在不匹配,推动建立过程感知框架以支撑对水、能量与碳耦合动态的可信监测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02830 2026-08-18 cs.CL cs.AI 版本更新 85%

Faster, Cheaper, More Accurate: Specialised Knowledge Tracing Models Outperform LLMs

更快、更便宜、更准确:专门知识追踪模型超越大语言模型

Prarthana Bhattacharyya, Joshua Mitton, Ralph Abboud, Simon Woodhead

机构 * Prarthana Bhattacharyya(普拉塔拉·巴特查利亚) Joshua Mitton(乔舒亚·米顿) Ralph Abboud(拉尔夫·阿布德) Simon Woodhead(西蒙·伍德赫德)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了多种LLM和KT模型在预测性能、部署成本和推理速度上的表现,发现领域特定的KT模型在准确性上优于LLM。

Comments Published as Poster at EDM 2026. Link: https://educationaldatamining.org/edm2026/proceedings/2026.EDM.poster-demo-papers.379/2026.EDM.poster-demo-papers.379.pdf. 7 pages, 6 figures. Prarthana Bhattacharyya and Joshua Mitton contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15171 2026-08-18 cs.DC 新提交 85%

P-PAS: Prefill-Pressure Adaptive Scheduling for Long-Context LLM Serving

P-PAS:面向长上下文大语言模型服务的预填充压力自适应调度

Timo Sämann

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对长上下文LLM服务中静态最大批处理令牌数(MBT)无法适配不同调度压力的问题,提出P-PAS动态调度策略,可在各类负载下维持低延迟,避免固定MBT的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07918 2026-08-18 cs.LG cs.AI cs.CL cs.CR 版本更新 85%

Efficient Safety Alignment of Language Models via Latent Personality Traits

通过潜在人格特质实现语言模型的高效安全对齐

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) McGill University(麦吉尔大学) LawZero Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。

Comments 19 pages, 6 figures. Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-18 cs.CL 新提交 84%

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交 83%

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15299 2026-08-18 cs.LG cs.AI 新提交 82%

MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation

MAPLE:MoE自适应即插即用分层专家分配

Lie Li, Wen Li, Junxiao Shen, Gusheng Hu

机构 * University of Bristol(布里斯托尔大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 MAPLE是一种即插即用框架,可在不修改预训练MoE LLM权重或重新训练的情况下,异质性分配专家预算,在75%预算下超越基线,降低延迟并提升吞吐量,同时提升多项任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15117 2026-08-18 cs.AI cs.DC cs.LG 新提交 82%

Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads

量化智能体剖析:代码合成智能体工作负载中的VRAM稳定性与预测

Anubhab Banerjee

机构 * Nokia Germany(诺基亚德国)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对基于LangGraph的AgentK智能体,在1920条轨迹上评估量化LLM的VRAM消耗,提出闭式峰值内存预测模型,发现编译成功率受LLM容量限制,且无需复杂VRAM预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14104 2026-08-18 cs.CV 版本更新 82%

CSMoE: An Efficient Remote Sensing Foundation Model with Soft Mixture-of-Experts

CSMoE:一种基于软混合专家(MoE)的高效遥感基础模型

Leonard Hackel, Tom Burgert, Begüm Demir

机构 * Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究院) Technische Universität Berlin(柏林技术大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究针对现有遥感基础模型计算复杂度高、表征能力或数据效率不足的问题,提出基于软混合专家机制的CSMoE模型及主题-气候描述符采样策略,在多任务上性能相当且浮点运算量显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16411 2026-08-18 cs.SE cs.AI 新提交 81%

Towards Risk-free AI Agent Deployment

迈向无风险的AI智能体部署

Yintong Huo, Rangeet Pan, Abhik Roychoudhury

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15817 2026-08-18 cs.AI 新提交 81%

RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning

RLCascadeRouter:基于强化学习的无质量估计器级联路由

Shihong Huang, Shengjie Wang, Hong Ma, Zhou Xu

机构 * Polytechnic Institute, Zhejiang University(浙江大学理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM路由的灵活性问题,提出RLCascadeRouter框架,将级联路由建模为马尔可夫决策过程,无需质量估计器,在LLMRouterBench基准上实现了更优的性能-成本权衡,且可纳入未见模型无需重训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15762 2026-08-18 cs.OS cs.DC cs.LG 新提交 81%

Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

面向高效多租户模型服务的全局仿真引导型动态算子调度

Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出SliceScheduler系统,通过全局映射图、全局仿真器等组件实现算子级调度,在维持SLA违规率低于9%的同时,将多租户LLM服务的令牌吞吐量提升1.10-2.29倍,有效提高GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15369 2026-08-18 cs.SD cs.AI cs.CR 新提交 81%

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

AudioTQ:一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的无数据感知6位CPU音频编解码器

Sahil Gangurde

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AudioTQ,一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的6位CPU时域音频编解码器,无需硬件加速即可实现实时执行,可将音频文件大小缩减74.4%,SQNR约30 dB。

Comments 8 pages, 1 figure, 1 table. Code is available at https://github.com/lostmartian/audioTQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14624 2026-08-18 cs.AI 新提交 81%

Learning Agent Execution for KV-Cache Management in Agentic Serving

面向智能体服务的KV缓存管理的智能体执行学习

Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Washington(华盛顿大学) University of Chicago(芝加哥大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多智能体LLM服务中KV缓存复用不足的问题,提出CacheScout,通过在线学习智能体执行转换优化缓存管理,显著提升缓存命中率、降低延迟并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21351 2026-08-18 cs.LG cs.AI 版本更新 81%

Analytical Provisioning for Attention-FFN Disaggregated LLM Serving under Stochastic Workloads

注意力-前馈网络解耦大语言模型服务的分析资源配置

Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

机构 * Dept. of Industrial Engineering and Decision Analytics HKUST(工业工程与决策分析系香港科技大学) Dept. of Computer Science and Technology Tsinghua University(计算机科学与技术系清华大学) IIIS Tsinghua University(清华大学信息学院) Huawei Hong Kong Research Center(华为香港研发中心) School of Mathematical Sciences Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在随机负载下,针对注意力-前馈网络解耦架构的分析资源配置框架,通过考虑工作负载统计量θ,确定最优注意力与前馈网络比例,减少阻塞和设备空闲时间。

Comments Submitted to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 80%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14561 2026-08-18 cs.DC cs.OS cs.PF 新提交 80%

A Biophysically-Inspired Feedback Controller for Multi-Class Cache Fairness

受生物物理启发的多类缓存公平性反馈控制器

Matt R. Flax

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24312 2026-08-18 cs.CR 版本更新 80%

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16864 2026-08-18 cs.DC cs.AR 版本更新 80%

HieraSparse: Hierarchical Semi-Structured Sparse KV Attention

HieraSparse: 分层半结构化稀疏KV注意力

Haoxuan Wang, Chen Wang

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HieraSparse,通过分层KV缓存压缩框架和GPU稀疏张量核心,提升LLM的KV缓存效率与注意力计算速度,实现稀疏性与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏