arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2608.26581 2026-08-28 cs.LG 新提交 81%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交 81%

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24588 2026-08-27 cs.LG 版本更新 81%

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO:面向多轮服务智能体信用分配的感知影响策略优化

Bo Ren, Yirong Mao, Yi Yang, Wenhui Que

机构 * Fudan University(复旦大学) WeChat, Tencent Inc.(腾讯公司微信业务)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。

Comments 12 pages, 3 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19660 2026-08-27 cs.CR cs.CL 版本更新 81%

A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

基于RAG的聊天机器人中针对提示注入的分层安全框架

Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan, Umar Mujahid

机构 * ICCK Transactions on Information Security and Cryptography(信息安全与密码学国际会议交易)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出三层防御框架,通过输入过滤、上下文指令层级和输出审计,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟开销61.2毫秒。

Comments Submitted in ICCK Transactions on Information Security and Cryptography

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09586 2026-08-27 cs.AI 版本更新 81%

EvoCurr: Self-evolving Curriculum with Behavior Code Generation for Complex Decision-making

EvoCurr:面向复杂决策的、结合行为代码生成的自演进课程框架

Yang Cheng, Weiyu Ma, Zilai Wang, Wenhui Zhu, Tangjie Lv, Yujing Hu, Mohamed Elhoseiny, Yue Deng, Jian Zhao

机构 * Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出EvoCurr这一推理时框架,协同演进课程与可执行策略,在《星际争霸II》等任务上实现高胜率,且具有通用性,无需训练LLM参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24763 2026-08-26 cs.CV cs.LG 新提交 81%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23834 2026-08-26 cs.AI 新提交 81%

Minima-KV: Retention-Preserving KV Cache Compression with Mixed-Format Paged Attention

Minima-KV:采用混合格式分页注意力的保留保留KV缓存压缩技术

Sergii Kozyrev, Davyd Maiboroda

机构 * Minima AI, Inc.(Minima AI公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对长上下文LLM的KV缓存瓶颈,提出Minima-KV混合格式分页注意力压缩方案,在Qwen3.6-27B模型上实现3.50倍KV压缩,性能与密集控制相当,无需密集影子。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23375 2026-08-25 cs.CR cs.AI 新提交 81%

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

针对基于Gumbel推理验证的对抗性熵膨胀

Nikita Kezins

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对基于Gumbel的LLM推理验证防御,发现控制提示分布的攻击者可扩大容许token集合,使隐蔽信道泄露能力提升,建议动态校准抖动宽恕阈值。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22854 2026-08-25 cs.LG 新提交 81%

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

合适规模的思考:跨后训练大语言模型的摊销蒸馏

Yan Zhou, Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) IST Austria(奥地利科学技术研究所)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。

Comments 8 pages, 6 figures. EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21393 2026-08-25 cs.AI 新提交 81%

Spyre-Accelerated Retrieval-Augmented Generation on IBM LinuxONE: A Cloud-Native Architecture for Secure, High-Throughput Enterprise AI Inference

基于IBM LinuxONE的Spyre加速检索增强生成:一种用于安全、高吞吐量企业AI推理的云原生架构

Sandeep Bokkasam, Pankaj D

机构 * IBM ISDL

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于IBM LinuxONE的六子系统RAG架构,利用Spyre加速器等组件实现企业AI推理,使敏感数据不离开硬件边界,延迟低于2秒,较平台外推理降低20倍,满足受监管行业的安全与吞吐量需求。

Comments 8 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20494 2026-08-24 cs.NI cs.AI cs.MA 新提交 81%

Towards Traffic Modelling of Multi-Agent Systems: The Role of Coordination Topology

面向多智能体系统的流量建模:协调拓扑的作用

Davide Lamagna, Albert Cabellos, Alberto Rodriguez-Natal, Gábor Rétvári, Berta Serracanta

机构 * UPC, BarcelonaTech(加泰罗尼亚理工大学(巴塞罗那理工)) Cisco(思科公司) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对多智能体LLM系统,通过500次重复运行的多层测量框架,揭示了协调拓扑对LLM请求到达过程的关键影响,相关框架与分析流程已公开。

Comments 7 pages, 5 figures, 4 tables. Published at the ACM SIGCOMM Workshop on Networks for AI Computing (NAIC '26)

Journal ref SIGCOMM '26: Proceedings of the ACM SIGCOMM 2026 Conference, 2060 - 2066

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20379 2026-08-24 cs.AI 新提交 81%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09044 2026-08-24 cs.CL 版本更新 81%

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

经验树:面向自我进化智能体的分层经验管理

Zihao Deng, Yining Zhu, Leiming Wang, Junbo Wang, Jingfei Lu

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30949 2026-08-24 cs.AI cs.AR 版本更新 81%

AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

AgRefactor:面向HLS兼容性与性能的自进化智能体工作流

Yang Zou, Zijian Ding, Yizhou Sun, Jason Cong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18092 2026-08-20 cs.AI 新提交 81%

Position: Multi-Agent Systems Should Prioritize Concurrency Control

立场:多智能体系统应优先考虑并发控制

Xin Yang, Letian Li, Zimo Ji, Terry Jingchen Zhang, Wenyuan Jiang

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究指出基于LLM的多智能体系统的故障本质是并发控制问题,提出应将显式并发控制机制作为首要设计考量,以解决系统可靠性下降的问题。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18272 2026-08-20 physics.geo-ph cs.AI cs.NE eess.SP 新提交 81%

SeisEvo: Evolution of Seismic Data Reconstruction Algorithms by Agents

SeisEvo:智能体驱动的地震数据重建算法演化

Yingjie Xu, Siwei Yu, Jianwei Ma

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出SeisEvo,以LLM驱动多智能体搜索演化地震重建算子,发现Evo-POCS、Evo-MSSA等算法,性能优于经典方法及基准,为地震数据处理提供可检查的显式算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17304 2026-08-19 cs.AR cs.AI cs.SE 新提交 81%

NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration

NeuroAbs:用于属性检查加速的神经符号RTL抽象框架

Zhiyuan Yan, Xiaofeng Zhou, Ziyue Zheng, Ziyi Yang, Wenbin Che, Wei Zhang, Yangdi Lyu, Hongce Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NeuroAbs框架,结合LLM与AST实现RTL抽象,通过SMT验证抽象正确性、CEGAR迭代精化,可加速硬件属性检查,解决现有方法人工成本高或灵活性不足的问题。

Comments Accepted at ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13840 2026-08-19 cs.CL 版本更新 81%

PrivAct: Internalizing Contextual Privacy Preservation via Multi-Agent Preference Training

PrivAct: 通过多智能体偏好训练内化上下文隐私保护

Yuhan Cheng, Hancheng Ye, Hai Helen Li, Jingwei Sun, Yiran Chen

机构 * Department of Electrical Computer Engineering, Duke University Department of Computer \& Information Science \& Engineering, University of Florida

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PrivAct通过多智能体偏好训练,内化上下文隐私保护,提升模型生成行为的隐私合规性,减少信息泄露并保持实用性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16411 2026-08-18 cs.SE cs.AI 新提交 81%

Towards Risk-free AI Agent Deployment

迈向无风险的AI智能体部署

Yintong Huo, Rangeet Pan, Abhik Roychoudhury

机构 * Singapore Management University(新加坡管理大学) IBM T.J. Watson Research Center(IBM T.J. 沃森研究中心) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15817 2026-08-18 cs.AI 新提交 81%

RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning

RLCascadeRouter:基于强化学习的无质量估计器级联路由

Shihong Huang, Shengjie Wang, Hong Ma, Zhou Xu

机构 * Polytechnic Institute, Zhejiang University(浙江大学理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM路由的灵活性问题,提出RLCascadeRouter框架,将级联路由建模为马尔可夫决策过程,无需质量估计器,在LLMRouterBench基准上实现了更优的性能-成本权衡,且可纳入未见模型无需重训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15762 2026-08-18 cs.OS cs.DC cs.LG 新提交 81%

Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

面向高效多租户模型服务的全局仿真引导型动态算子调度

Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang

机构 * Xiamen University(厦门大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出SliceScheduler系统,通过全局映射图、全局仿真器等组件实现算子级调度,在维持SLA违规率低于9%的同时,将多租户LLM服务的令牌吞吐量提升1.10-2.29倍,有效提高GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15369 2026-08-18 cs.SD cs.AI cs.CR 新提交 81%

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

AudioTQ:一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的无数据感知6位CPU音频编解码器

Sahil Gangurde

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AudioTQ,一种基于随机哈达玛旋转与劳埃德-麦克斯韦量化的6位CPU时域音频编解码器,无需硬件加速即可实现实时执行,可将音频文件大小缩减74.4%,SQNR约30 dB。

Comments 8 pages, 1 figure, 1 table. Code is available at https://github.com/lostmartian/audioTQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14624 2026-08-18 cs.AI 新提交 81%

Learning Agent Execution for KV-Cache Management in Agentic Serving

面向智能体服务的KV缓存管理的智能体执行学习

Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Washington(华盛顿大学) University of Chicago(芝加哥大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多智能体LLM服务中KV缓存复用不足的问题,提出CacheScout,通过在线学习智能体执行转换优化缓存管理,显著提升缓存命中率、降低延迟并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13547 2026-08-14 cs.AI cs.SE 新提交 81%

QuoteBench: How Matched Scores Can Hide Command-Path Failures

QuoteBench:匹配分数如何掩盖命令路径故障

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

机构 * Stony Brook University(石溪大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 QuoteBench针对LLM编码智能体的命令路径故障,通过56个任务实验发现匹配分数掩盖执行缺陷,披露边界可恢复部分性能,提出评估需报告多维度配置而非仅匹配分数。

Comments 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13420 2026-08-14 cs.AI 新提交 81%

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估

Aimilios Hadjiliasi, Louis Nisiotis

机构 * University of Central Lancashire(中央兰开夏大学)

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13076 2026-08-14 cs.AI 新提交 81%

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE:用于精确且低成本分布式边缘云推理的推测解码

Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPADE是一种集成推测解码的分布式边缘云推理框架,通过边缘草稿模型与云端验证模型的协作,减少76%云端模型调用且不损失准确率,降低了LLM部署的成本与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12026 2026-08-13 cs.LG 新提交 81%

SoftWater: Class-Aware Rate Allocation for Softmax Quantization

SoftWater:面向Softmax量化的类别感知速率分配

Joao V. Cavalcanti, Ashia C. Wilson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 针对小型LLM的Softmax层量化问题,提出类别感知速率分配方法SoftWater,在多模型上优于现有量化器,可大幅降低输出层KL散度,使输出层量化的困惑度损失可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11785 2026-08-13 cs.LG 新提交 81%

TradingMoE: Routing the Right Experts in Evolving Markets

TradingMoE:在动态市场中路由合适的专家

Chang Zhou, Xingtong Yu, Minbin Huang, Zhennan Wu, Yuan Fang, Hong Cheng, Xinming Zhang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学) Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TradingMoE是面向交易的稀疏MoE,通过Query-Key路由与稀疏专家选择更新机制优化专家选择,在股票和加密货币市场较22个基准提升累计收益超30%,且仅向前部署时优势仍存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10362 2026-08-12 cs.OS cs.AI 新提交 81%

MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

MemSpec:边缘设备上推测解码中自适应草稿调度的内存感知运行时

Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han

机构 * Kyungpook National University(庆北国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对边缘设备推测解码中内存受限导致自适应方法吞吐量提升不足的问题,提出MemSpec内存感知运行时,通过解耦草稿选择与执行等设计,使Jetson Orin Nano上的稳态生成吞吐量平均提升40.7%

Comments Published in LCTES 2026

Journal ref Proc. ACM LCTES 2026, 180-192 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10290 2026-08-12 cs.SE cs.AI cs.HC cs.PL 新提交 81%

Comprendia: AI-Augmented Code Comprehension

Comprendia:AI增强型代码理解工具

Costain Nachuma, Minhaz F. Zibran

机构 * Idaho State University(爱达荷州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出一款名为Comprendia的Eclipse插件,通过集成结构依赖可视化、LLM代码解释、克隆检测及CVE风险叠加功能,为Java程序理解提供支持,在含已知克隆与漏洞的Java项目上验证了其有效性。

Comments 5 pages, 2 figures. Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏