arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 711 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 137 篇

2605.16867 2026-05-19 cs.DC 91%

GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources

GoodServe: 向异构资源上实现高吞吐量的代理LLM推理服务

Boxiao Du, Boning Huangfu, Yizhou Luo, Chen Chen, Zijun Li, Minchen Yu, Xiaoyi Fan, Minyi Guo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GoodServe系统,通过预测和修正的方法优化异构资源上的代理LLM推理服务,提高吞吐量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18249 2026-05-19 cs.IR 91%

Dual-Tree LLM-Enhanced Negative Sampling for Implicit Collaborative Filtering

双树LLM增强的隐式协同过滤负采样

Jiayi Wu, Zhengyu Wu, Xunkai Li, Rong-Hua Li, Guoren Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出双树LLM增强负采样方法,通过无文本和无微调的结构化编码提升隐式协同过滤推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16360 2026-05-19 cs.LG cs.AI 91%

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV:跨模型代理剪枝用于高效长上下文LLM推理

Junjie Li, Jiong Lou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ProxyKV通过跨模型代理剪枝方法,解决LLM长上下文推理中的KV缓存内存瓶颈,实现高效推理与高精度的平衡,提升预填充速度和长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16480 2026-05-19 q-bio.BM cs.AI 90%

MoleCode unlocks structural intelligence in large language models

MoleCode 解锁大型语言模型中的结构智能

Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

机构 * Peking University Shenzhen Graduage School

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MoleCode 通过引入图显分子语言,使大型语言模型能直接操作分子结构,提升分子推理、编辑、生成和分析任务的性能,尤其在结构受限场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16298 2026-05-19 cs.CY cs.AI cs.MA 90%

Data-driven and distributed governance of building facilities management using decentralized autonomous organization, digital twin, and large language models

基于去中心化自治组织、数字孪生和大语言模型的建筑设施管理数据驱动与分布式治理

Reachsak Ly, Alireza Shojaei, Xinghua Gao, Philip Agee, Abiola Akanmu

机构 * School of Technology, Eastern Illinois University(东伊利诺伊大学技术学院) Myers-Lawson School of Construction, Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学迈尔斯-劳森建设学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种融合DAO、数字孪生、大语言模型和区块链的建筑管理分布式治理框架,以提升决策透明度和系统安全性。

Comments 33 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16895 2026-05-19 cs.CE cs.AI cs.CL 90%

The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

阿尔法幻觉:LLM交易代理报告的阿尔法不应被视为部署证据

Yuxuan Ye, Jun Han, Ao Hu, Juncheng Bu, Yiyi Chen, Liangjian Wen, Danilo Mandic, Danny Dongning Sun, Xu Yinghui, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Southwest University of Finance and Economics(西南财经大学) Northeastern University(东北大学) Imperial College London(伦敦帝国理工学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文指出,LLM交易代理报告的阿尔法不应被当作部署的证据,因为这些阿尔法需要通过结构有效性测试来验证其时间完整性、现实摩擦、反事实稳健性、预测校准、数值执行和多代理分解等关键指标,当前的公开证据无法区分稳健的预测能力与时间污染、未建模的摩擦、短窗口夏普不确定性、叙事拟合和参数先验等因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07799 2026-05-19 cs.CL cs.AI 90%

Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models

基于图扩散模型的多LLM代理通信拓扑动态生成

Eric Hanchen Jiang, Mengting Li, Guancheng Wan, Sophia Yin, Yuchen Wu, Xiao Liang, Xinfeng Li, Yizhou Sun, Wei Wang, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Guided Topology Diffusion框架,通过迭代构建过程生成适应任务需求的高效通信拓扑,优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18041 2026-05-19 cs.CV 90%

OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models

OmniSelect: 动态模态感知的令牌压缩用于高效多模态大语言模型

Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OmniSelect,一种无需训练的模态自适应令牌剪枝框架,通过动态选择压缩策略来提高多模态大语言模型的效率,通过轻量级AudioCLIP模型估计跨模态相关性,并根据相关性得分在不同时间组中进行细粒度令牌剪枝,从而在不增加训练成本的情况下实现高效的多模态令牌压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18672 2026-05-19 cs.AI 90%

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的

S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

机构 * CSX-AI University of Liverpool(利物浦大学) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Austrian Institute of Technology(奥地利技术研究院) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16474 2026-05-19 cs.IR cs.AI 90%

LERA: LLM-Enhanced RAG for Ad Auction in Generative Chatbots

LERA:基于大语言模型的生成聊天机器人广告拍卖

Haoran Sun, Xinrui Song, Xinyu Zhang, Zhaohua Chen, Xu Chu, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Xiaotie Deng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Shandong University(山东大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LERA提出一种两阶段检索生成拍卖框架,通过嵌入粗过滤和LLM提示生成优化广告相关性评分,提升广告选择准确性和多样性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13189 2026-05-19 cs.HC cs.RO 89%

Gesture First, LLM-Assisted Voice Complement: Exploring Multimodal Robot 'Puppeteer' Teleoperation Via Virtual Counterpart in Augmented Reality

先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控

Yuchong Zhang, Bastian Orthmann, Shichen Ji, Michael Welle, Jonne Van Haastregt, Danica Kragic

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。

Comments This work is under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22056 2026-05-19 cs.CL 89%

Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch

双空间知识蒸馏与关键-查询匹配用于具有词汇不匹配的大型语言模型

Stella Eva Tsiapali, Cong-Thanh Do, Kate Knill

机构 * University of Cambridge, Department of Engineering(剑桥大学工程系) Toshiba Europe Limited(东芝欧洲有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文研究了针对具有词汇不匹配的大型语言模型的双空间知识蒸馏与关键-查询匹配方法,通过分析注意力机制揭示其优缺点,并提出基于生成对抗学习的新方法以解决关键-查询分布不匹配问题。

Comments Copyright 2026 IEEE. Published in ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 4-8 May 2026 in Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17288 2026-05-19 cs.CR cs.AI 89%

When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

效率反噬:对抗攻击下级联LLM引发级联故障

Zehan Sun, Dingfan Chen, Songze Li

机构 * Southeast University(东南大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了级联LLM系统在对抗攻击下的脆弱性,提出了一种新的攻击框架,通过约束序列协同优化对抗后缀,在级联依赖下同时利用轻量级模型和决策机制,验证了此类攻击的有效性和严重性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16758 2026-05-19 cs.CL 89%

Language Acquisition Device in Large Language Models

大型语言模型中的语言习得装置

Masato Mita, Taiga Someya, Ryo Yoshida, Yohei Oseki

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出了一种受语言习得装置启发的预预训练方法,通过在MP-STRUCT形式语言上进行预训练,提高了大型语言模型的数据效率,并展示了其对结构不合理的语言的抗性。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 89%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18374 2026-05-19 cs.LG cs.AI 88%

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

超越推理时间搜索:强化学习合成可重用求解器

Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

机构 * ETH Zürich(苏黎世联邦理工学院) University of Maryland(马里兰大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了强化学习能否将组合优化的推理成本转移到代码LLM的权重中,从而合成可重用的求解器。通过Synergistic Dependency Selection问题,研究发现强化学习能有效生成约束感知的模拟退火模板,并在多个领域展示出更高的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10843 2026-05-19 cs.CL cs.AI cs.CY 88%

Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

通过人格分歧实现无训练的文化对齐大语言模型

Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen, Chi-Nguyen Tran, Phu-Hoa Pham, Nguyen Lam Phu Quy, The Anh Han, Long Tran-Thanh

机构 * Faculty of Information and Technology, University of Science, Vietnam National University(信息与技术学院,科学大学,越南国家大学) Department of Computer Science, University of Warwick(计算机科学系,沃里克大学) School of Computing, Engineering and Digital Technologies, Teesside University(计算、工程和数字技术学院,泰赛德大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DISCA方法,在不改变模型权重的情况下,通过人格分歧校准减少大语言模型在多任务测试中的文化偏差,为服务全球道德偏好提供了可扩展的替代方案。

Comments 57 pages, 1 figure, 6 MultiTP moral dimensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16776 2026-05-19 cs.LG cs.AI 88%

Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

可区分删除:统一知识擦除与拒绝用于大语言模型去学习

Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

机构 * Department of Natural Language Processing, MBZUAI. University of Oxford. RIKEN Center for Advanced Intelligence Project. TMLR Group, Department of Computer Science, Hong Kong Baptist University

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出D^2方法,通过限制潜在表示中的响应分布来擦除不受欢迎的知识,同时区分保留知识,从而实现安全且一致的拒绝机制,以提高大语言模型去学习的效果。

Comments ICML2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06974 2026-05-19 cs.CL 88%

Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models

重新思考利用预训练大语言模型的1位优化

Zhijun Tu, Jian Li, Yuanyuan Xi, Siqi Liu, Chuanjian Liu, Hanting Chen, Jie Hu, Yunhe Wang

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种一致的渐进式训练方法,通过将全精度权重逐步转化为二值化权重,以提高1位大语言模型的性能,并通过二进制感知初始化和双缩放补偿减少训练难度。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22510 2026-05-19 cs.CL 88%

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

我们思考,因此我们对LLMs进行对齐,使其在出错前变得有益、无害和诚实

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing Macquarie University(计算机学院麦Quarie大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AMBS框架,通过在1-to-N Transformer设置中参数化目标特定转换,解决LLM对齐中多个目标之间的干扰问题,提升HHH目标的联合满足能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18067 2026-05-19 cs.CL 87%

PPAI: Enabling Personalized LLM Agent Interoperability for Collaborative Edge Intelligence

PPAI: 促进个性化大语言模型代理在协作边缘智能中的互操作性

Zile Wang, Qianli Liu, Kaibin Guo, Haodong Wang, Jian Lin, Zicong Hong, Song Guo

机构 * Hong Kong RGC General Research Fund(香港研究资助局一般研究基金) Research Impact Fund(研究影响基金) Collaborative Research Fund(协作研究基金) NSFC/RGC Collaborative Research Scheme(国家自然科学基金/香港研究资助局协作研究计划) Areas of Excellence Scheme(卓越领域计划) InnoHK (HKGAI)(创新科技署(HKGAI))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PPAI系统,通过代理专长实现用户间协作,解决动态代理池和负载平衡问题,提升任务准确性并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11854 2026-05-19 cs.CL 87%

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models

自蒸馏轨迹感知玻尔兹曼建模:弥合扩散语言模型训练-推理差异

Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Yibing Liu, Xinyu Fu, Shi Wu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Liu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究) The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文研究了如何利用自蒸馏轨迹进行真正的知识获取,而非仅加速推理。提出TABOM框架,通过玻尔兹曼建模对推理解屏蔽偏好建模,从而在新领域中提升扩散语言模型的表现并缓解灾难性遗忘。

Comments Project website: https://tonyckc.github.io/TABOM-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09341 2026-05-19 cs.MA cs.CL 87%

SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System

SkillMAS: 基于大语言模型的多智能体系统技能共进化

Shuai Pan, Yixiang Liu, Jiaye Gao, Te Gao, Weiwen Liu, Jianghao Lin, Zhihui Fu, Jun Wang, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) OPPO

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillMAS通过耦合技能进化与多智能体系统重构,解决部署后技能优化与系统重构的分离问题,提升多智能体系统的适应性和专业化水平。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI 87%

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16359 2026-05-19 cs.CV cs.AI 87%

How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展

YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出F^3A方法,通过任务条件证据搜索优化视觉标记分配,在不训练模型的情况下实现高效的视觉标记剪枝,保留原始多模态提示和解码流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16637 2026-05-19 cs.DC 87%

HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling

HexAGenT: 通过工作流和异构性感知调度实现高效的代理LLM服务

You Peng, Youhe Jiang, Wenshuang Li, Xu Xu, Ke Zhou, Jiawei Jiang, Chen Wang, Binhang Yuan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出HexAGenT,一种异构prefill-decode推理服务的工作流感知调度器,通过动态调整预填和解码位置及队列优先级,减少工作流完成SLO需求,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19155 2026-05-19 cs.CV cs.CL 86%

Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs

稀疏到密集:一种无损加速视频理解的LLM免费午餐

Xuan Zhang, Cunxiao Du, Sicheng Yu, Jiawei Wu, Fengzhuo Zhang, Wei Gao, Qian Liu

机构 * Singapore Management University(新加坡国立管理学院) Sea AI Lab(Sea AI实验室) National University of Singapore(国立新加坡大学)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种名为Sparse-to-Dense(StD)的解码策略,通过结合稀疏top-K注意力和密集全注意力模块,实现视频大语言模型(Video-LLMs)的无损加速,从而在处理长视频序列时显著提高处理速度。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04746 2026-05-19 cs.CL cs.AI 86%

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2:朝着关闭LLMs极低比特后训练量化性能差距的目标

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma

机构 * Intel(英特尔公司) Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SignRoundV2框架,通过自适应混合精度策略和轻量稳定技术,在极低比特量化下保持高性能,实验表明在混合MXFP设置中实现接近无损性能,将性能差距缩小到约1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17707 2026-05-19 cs.CR 86%

Speed Kills: Exploring Confused Deputy Attacks Through Edge AI Accelerators

速度即杀:通过边缘AI加速器探索困惑代理攻击

Datta Manikanta Sri Hari Danduri, Aravind Kumar Machiry

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了通过边缘AI加速器(AIA)进行的困惑代理攻击(CDAs)问题,提出了一种基于大语言模型(LLM)的框架DeputyHunt,通过动态和静态分析提取相关信息,并发现六种主流AIA均存在CDAs的可行性,影响超过128个系统芯片(SOCs)和1亿台设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17613 2026-05-19 cs.AR cs.LG 85%

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache: 将损失性KV缓存转换为无损LLM推理

Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

机构 * University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司) Samsung Semiconductor(三星半导体) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出VeriCache框架,通过利用压缩的KV缓存生成token并验证其与完整KV缓存的一致性,实现了与完整KV缓存解码相同输出的同时保持高解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏