arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2410.02511 2026-06-02 cs.AI cs.MA 81%

Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exploration

停止徘徊,找到关键:LLMs 辨别关键状态以实现高效多智能体探索

Yun Qu, Boyuan Wang, Yuhang Jiang, Jianzhun Shao, Yixiu Mao, Heming Zou, Chang Liu, Cheems Wang, Meiqin Liu, Xiangyang Ji

机构 * Department of Automation, Tsinghua University, Beijing 100084, China(清华大学自动化系) College of Electrical Engineering, Zhejiang University, Hangzhou 310027, China(浙江大学电气工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学人机混合增强智能国家级重点实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LEMAE 方法,利用大语言模型辨别关键状态并设计子空间内在奖励和关键状态记忆树,引导多智能体高效探索,在 SMAC 和 MPE 基准上显著超越现有方法,实现 10 倍加速。

Journal ref SCIENCE CHINA Information Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31175 2026-06-01 cs.CL 81%

Towards Efficient LLMs Annealing with Principled Sample Selection

迈向基于原则性样本选择的高效LLM退火

Yuanjian Xu, Jianing Hao, Wanbo Zhang, Zhong Li, Guang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title_cn,abstract);分类 cs.CL

AI总结 本文通过损失景观的谱几何特性,将退火阶段的数据选择建模为有约束优化问题,提出DiReCT框架,利用Hessian谱对梯度施加方向约束,实现高效样本选择,显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31149 2026-06-01 cs.HC cs.AI 81%

Developing a UXR Point of View for Cognitive Accessibility in Mobile Learning with Generative AI

利用生成式AI在移动学习中开发认知无障碍的UXR视角

Fatima Ahmad Muazu, Festus Adedoyin, Huseyin Dogan, Abiodun Adedeji, Melike Akca, Olumuyiwa Ayorinde

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过结合UX研究原则和大语言模型支持的分析,提出认知无障碍UXR剧本,以改善面向认知障碍学习者的移动学习系统需求质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30728 2026-06-01 cs.LG cs.DC 81%

Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

通过无损压缩减少机器学习中的GPU内存瓶颈——扩展版

Aditya K Kamath, Arvind Krishnamurthy, Marco Canini, Simon Peter

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出无损压缩算法IBP,通过识别和消除张量组中的不变位,利用GPU优化的解压缩和异步PCIe传输,显著减少数据传输时间,加速GNN训练、DLRM嵌入查找和LLM推理。

Comments Extended version of paper published at 21st European Conference on Computer Systems (EUROSYS '26), April 27-30, 2026, Edinburgh, Scotland Uk

Journal ref 2026. In Proceedings of the 21st European Conference on Computer Systems. Association for Computing Machinery, 899-918

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29343 2026-06-01 cs.CL 81%

Draft-OPD: On-Policy Distillation for Speculative Draft Models

Draft-OPD:用于推测草稿模型的在线策略蒸馏

Haodi Lei, Yafu Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对推测解码中草稿模型因离线训练与在线推理不匹配导致性能瓶颈的问题,提出Draft-OPD方法,通过目标辅助展开和重放验证暴露的错误位置实现在线策略蒸馏,在多种任务上实现超过5倍的无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06453 2026-06-01 cs.AI 81%

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

ConSensus:面向多模态感知的多智能体协作

Hyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro

机构 * KAIST(韩国科学技术院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17942 2026-05-29 cs.CL 81%

Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing

通过嵌入空间探测的高效无训练多令牌预测

Raghavv Goel, Mukul Gagrani, Mingu Lee, Chris Lott

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ESP方法,利用嵌入空间中的掩码令牌进行无训练的多令牌预测,通过并行验证和轻量剪枝实现无损解码,提升吞吐量。

Comments v2: Accepted at ICML 2026. Updated experiments replaced tok/s with speedup ratio over AR baseline; improved exposition in Section 3.1 (mask token initialization) and Section 4 (ablations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06036 2026-05-29 cs.CL 81%

DFlash: Block Diffusion for Flash Speculative Decoding

DFlash:用于快速推测解码的块扩散模型

Jian Chen, Yesheng Liang, Zhijian Liu

机构 * Z-Lab

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DFlash框架,利用轻量级块扩散模型并行生成草稿,通过目标模型上下文特征条件化,实现高质量草稿和高接受率,在多种模型和任务上实现超过6倍无损加速,比最先进的推测解码方法EAGLE-3快2.5倍。

Comments Accepted at ICML 2026. Camera-ready version. Code: https://github.com/z-lab/dflash

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13519 2026-05-29 cs.CL 81%

ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding

ToolSpec: 通过模式感知与检索增强的推测解码加速工具调用

Heming Xia, Yongqi Li, Cunxiao Du, Mingbo Song, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对工具调用延迟问题,提出一种基于模式感知和检索增强的推测解码方法ToolSpec,利用预定义工具模式生成准确草稿,并通过有限状态机交替填充确定性模式令牌和推测生成可变字段,同时检索历史调用复用草稿,实现最高4.2倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-05-28 cs.LG 81%

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27591 2026-05-28 cs.LG 81%

Gradient Transformer: Learning to Generate Updates for LLMs

梯度变换器:学习为大语言模型生成更新

Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA(数据科学系,新泽西理工学院,新泽西州诺克斯维尔) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所,HBKU,多哈)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种无数据知识蒸馏框架,利用梯度变换器将微调后小语言模型的更新向量转换为大语言模型的更新向量,实现无需私有数据即可更新大模型。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27428 2026-05-28 cs.LG 81%

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

$E^3$-Agent: 一种用于边缘生成式推理资源管理的可执行且可演化智能体

Rui Bao, Yaping Sun, Zhiyong Chen, Feng Yang, Meixia Tao, Nan Li, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学合作中位网创新中心,上海,中国) Department of Broadband Communication, Pengcheng Laboratory, Shenzhen 518000, China(鹏城实验室宽带通信部门,深圳,中国) China Mobile Research Institute, Beijing 100053, China(中国移动研究院,北京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对边缘生成式推理中设备性能未知且时变的问题,提出一种可执行且可演化的智能体$E^3$-Agent,通过分离快速路径路由器和慢速路径大语言模型元控制器,实现在线学习与自适应资源管理,在动态场景下平均延迟降低65%-73%。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04295 2026-05-28 cs.CL 81%

Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Generation

面向可靠专利权利要求生成的适应性成本高效评估

Yongmin Yoo, Qiongkai Xu, Longbing Cao

机构 * Frontier AI Research Centre, Macquarie University School of Computing, FSE, Macquarie University(前沿人工智能研究中心,麦考瑞大学计算机学院,FSE,麦考瑞大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出两阶段框架ACE,利用专利错误类别结构进行不确定性感知路由,第一阶段编码器预测错误类型熵,超过阈值则交由第二阶段专家LLM执行模式约束的专利思维链协议,在降低78%成本的同时超越70B参数LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27361 2026-05-27 cs.AI cs.SY eess.SY 81%

Natural Language Query to Configuration for Retrieval Agents

面向检索代理的自然语言查询到配置

Melissa Z. Pan, Negar Arabzadeh, Mathew Jacob, Fiodar Kazhamiaka, Esha Choukse, Matei Zaharia

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Microsoft Azure Research - Systems(微软Azure研究 - 系统)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出BRANE方法,利用LLM将查询转换为工作负载特征,并训练轻量级预测器选择最优配置,在多个基准上实现成本-质量帕累托前沿的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27220 2026-05-27 cs.CL cs.IR 81%

The Coverage Illusion: From Pre-retrieval Routing Failure to Post-retrieval Cascades in a Production RAG System

覆盖幻觉:从检索前路由失败到生产RAG系统中的检索后级联

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过丹麦国家百科全书的案例研究,发现合成查询高估了LLM增强的需求(覆盖幻觉),并提出一种检索后级联策略,按成本递增顺序执行工作流,仅在无结果时升级到LLM增强,从而在无需训练开销的情况下提升质量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02192 2026-05-27 cs.LG cs.DC 81%

ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning

ECHO-2: 一种面向经济高效强化学习的大规模分布式推演框架

Jingwei Song, Meng Chen, Jie Xiao, Qingnan Ren, Jiaqi Huang, Yangshen Deng, Chris Tong, Wanyi Chen, Suli Wang, Zhisheng Chen, Ziqian Bi, Shuo Lu, Yiqun Duan, Xu Wang, Rymon Yu, Lynn Ai, Eric Yang, Tianyu Shi

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Gradient University of Edinburgh(爱丁堡大学) Soochow University(苏州大学) Technical University of Darmstadt(达姆施塔特技术大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出ECHO-2分布式强化学习框架,通过重叠推演生成、传播与训练,结合对等辅助流水线广播和成本感知异构工作节点激活,在保持奖励性能的同时显著提升成本效率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11063 2026-05-27 cs.AI cs.CR 81%

Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction

三思而后行:通过思想修正增强智能体行为安全

Changyue Jiang, Wenqi Zhang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Pudong Research Institute of Cryptology, Shanghai, China(上海浦东密码研究院,上海,中国)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Thought-Aligner,一种轻量级插件式安全模型,在动作执行前对不安全思想进行因果修正,无需修改底层智能体,通过两阶段对比学习训练,在多个基准和六种LLM上将行为安全从约50%提升至约90%,超越现有防护约23%,同时提升有用性约5%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18543 2026-05-26 cs.CR cs.AI 81%

SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models

SoK: GPT 和 DeepSeek 模型越狱鲁棒性的全面安全分析

Xiaodong Wu, Xiangman Li, Qi Li, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(女王大学) University of Waterloo(滑铁卢大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过 HarmBench 基准测试,对 DeepSeek 模型系列与 GPT-3.5、GPT-4 进行首次全面越狱分析,发现 DeepSeek 对优化驱动攻击有部分鲁棒性但易受提示工程攻击,而 GPT-4 Turbo 具有更一致的安全对齐,揭示了模型效率与对齐泛化之间的固有权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25244 2026-05-26 cs.CL 81%

Inference Time Optimization with Confidence Dynamics

基于置信度动态的推理时优化

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过观察推理轨迹中置信度的动态变化,发现正确轨迹置信度上升而错误轨迹下降,据此提出置信度动态增益投票方法,显著提升大语言模型推理性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25188 2026-05-26 cs.AI 81%

DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs

DarkForest: 少说话,多智能体LLM更高精度

Yi Li, Songtao Wei, Dongming Jiang, Zhichun Guo, Qiannan Li, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title_cn,abstract);分类 cs.AI

AI总结 提出DarkForest框架,通过保持智能体独立、结构化解析响应并基于信念分布协调,减少通信开销和错误传播,在六个推理基准上实现领先质量并大幅降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24793 2026-05-26 cs.CL 81%

Beyond the Target: From Imitation to Collaboration in Speculative Decoding

超越目标:从模仿到协作的推测解码

Jinze Li, Yixing Xu, Guanchen Li, Jinfeng Xu, Shuo Yang, Yang Zhang, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微设备公司) The University of Hong Kong(香港大学) University of North Texas(北卡罗来纳州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出协作推测解码(CoSpec),通过强化学习训练仲裁策略,在推测解码中灵活选择接受草稿或目标模型的令牌,在保持加速的同时超越仅使用目标模型的性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15759 2026-05-26 cs.CL 81%

DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory

DimMem:面向高效长期智能体记忆的维度结构化

Wentao Qiu, Haotian Hu, Fanyi Wang, Jinwei Kong, Yu Zhang

机构 * StepOS Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DimMem维度记忆框架,通过原子化、类型化、自包含的记忆单元(含时间、地点、原因等显式字段)实现维度感知检索与更新,在LoCoMo-10和LongMemEval-S上分别达到81.43%和78.20%准确率,且每查询token成本降低24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24432 2026-05-26 cs.CL 81%

Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap

在对话中发现:LLMs 自我学习弥合多轮差距

Tianlang Chen, Shirley Wu, Jure Leskovec

机构 * Stanford(斯坦福大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出 Found in Conversation (FiC) 框架,通过视图非对称自蒸馏方法,让模型从单轮视角向多轮视角迁移能力,显著缩小多轮对话与单轮性能的差距。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23931 2026-05-26 cs.AI cs.PL cs.SE 81%

BODHI: Precise OS Kernel Specification Inference

BODHI:精确的操作系统内核规范推断

Zhiming Chang, Ziyang Li

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Johns Hopkins University(约翰霍普金斯大学) Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种领域知识提示方法BODHI,通过结构化C到Python翻译指南增强少样本提示,在OSV-Bench基准上将Pass@1从55.10%提升至96.73%,缩小了通用代码生成与形式规范合成之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06404 2026-05-25 cs.AI cond-mat.mtrl-sci physics.chem-ph 81%

GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols

GENIUS: 一种用于自主设计和执行模拟协议的智能AI框架

Mohammad Soleymanibrojeni, Roland Aydin, Diego Guedes-Sobrinho, Alexandre C. Dias, Maurício J. Piotrowski, Wolfgang Wenzel, Celso Ricardo Caldeira Rêgo

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Institute of Nanotechnology(纳米技术研究所) Hamburg University of Technology(汉堡技术大学) Federal University of Paraná(帕拉纳联邦大学) University of Brasília(巴西利亚大学) Federal University of Pelotas(普拉多斯联邦大学) Institute of Physics and International Center of Physics(物理研究所和国际物理中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GENIUS框架,融合量子ESPRESSO知识图谱与分层大语言模型,通过有限状态错误恢复机器实现从自由文本到验证输入文件的自动生成,在295个基准测试中达到约80%的成功率,并大幅降低推理成本与幻觉。

Journal ref Communications Materials 7, 115 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13893 2026-05-25 cs.CL 81%

InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion

InfiGFusion:通过高效Gromov-Wasserstein进行图对逻辑蒸馏的模型融合

Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Yanggan Gu, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Daya Bay Technology and Innovation Research Institute(大亚湾技术与创新研究院)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出InfiGFusion,一种结构感知的模型融合框架,通过图对逻辑蒸馏损失显式建模词汇维度间的语义依赖,并利用排序闭式近似将Gromov-Wasserstein距离的计算复杂度从O(n^4)降至O(n log n),在多个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20519 2026-05-25 cs.SD cs.AI 81%

Codec-Robust Attacks on Audio LLMs

针对音频大语言模型的编解码鲁棒攻击

Jaechul Roh, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Qualcomm(高通)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CodecAttack,通过在神经音频编解码器的连续潜在空间中优化扰动,实现对抗Opus、MP3和AAC-LC等有损压缩的鲁棒攻击,平均目标子串攻击成功率85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22269 2026-05-22 cs.CV cs.AI cs.MM 81%

MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

MuKV:多粒度KV缓存压缩用于长流视频问答

Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MuKV,一种多粒度KV缓存压缩方法,通过半分层检索方法提升长流视频问答的效率和准确性,实验表明其在答案准确率、内存使用和在线问答效率方面均优于基线方法。

Comments To appear at CVPR'26. Code is available at https://github.com/IMBALDY/MuKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07243 2026-05-22 cs.CL 81%

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

SpecBlock:带有动态树草案的块迭代推测解码

Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) MetaX Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出了一种结合路径依赖性和低成本草案的块迭代草案方法SpecBlock,通过动态树草案和路径依赖机制提高LLM推理效率,同时在部署时利用验证器反馈进行成本感知适应,从而在速度和成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19645 2026-05-20 cs.CL 81%

K-Quantization and its Impact on Output Performance

K-量化及其对输出性能的影响

Robin Baki Davidsson, Pierre Nugues

机构 * Lund University(隆德大学)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了不同量化级别(2-6位)对大型语言模型(LLM)在MMLU-Pro、CRUXEval和MuSR等任务上的性能和准确性的影响,发现高精度量化(如8位Q8_0)能提升性能,但降维量化(如2位Q2_K)会带来性能损失,且不同模型和任务的响应差异显著。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏