arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2506.08332 2026-05-01 cs.AI 81%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21420 2026-04-30 cs.CV cs.CL 81%

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE:通过减少令牌数在MLLMs中实现更快更好的学习

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReGATE通过参考引导的自适应令牌消除方法加速MLLM训练,减少计算量同时保持模型准确性,在多个基准测试中表现出色。

Comments ACL 2026. Project page: https://people-robots.github.io/regate

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20303 2026-04-29 cs.CL 81%

Citation Failure: Definition, Analysis and Efficient Mitigation

引用失败:定义、分析与高效缓解

Jan Buchmann, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(普遍知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文研究了LLM基于RAG系统的引用失败问题,提出CITECONTROL基准以分析失败模式,并通过CITENTION框架提升引用效率。

Comments Accepted to TACL in April 2024. Paper repository: https://github.com/UKPLab/tacl2026-citation-failure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24219 2026-04-28 cs.AI 81%

Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU

自适应ToR:基于树的复杂性感知检索用于帕累托最优多意图NLU

Hee-Kyong Yoo, Wonbae Kim, Hyocheol Ahn

机构 * Data Science Lab Co., Ltd.(数据科学实验室有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出自适应ToR检索架构,通过动态配置检索拓扑结构,提升多意图NLU的准确性和效率,实验表明在NLU++基准上取得9.7%的相对提升,同时降低延迟和LLM调用次数。

Comments 17 pages, 5 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07371 2026-04-28 cs.RO cs.AI 81%

ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning

ESPADA:通过语义感知演示数据下采样提升执行速度的模仿学习

Byung-ju Kim, Jinu Pahk, Chungwoo Lee, Jaejoon Kim, Jangha Lee, Theo Taeyeong Kim, Kyuhwan Shim, Jun Ki Lee, Byoung-Tak Zhang

机构 * Tommoro Robotics(Tommoro机器人公司) Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 ESPADA通过语义和空间感知框架,利用VLM-LLM管道对演示进行分段,仅在非关键部分进行激进下采样,保持关键阶段的精度,无需额外数据或架构修改,实现约2倍的执行速度提升。

Comments project page: https://project-espada.github.io/espada/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23483 2026-04-28 cs.AI 81%

Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

代理对抗重写揭示了黑盒NLP流水线中的架构漏洞

Mazal Bethany, Kim-Kwang Raymond Choo, Nishant Vishwamitra, Peyman Najafirad

机构 * Department of Information Systems and Cybersecurity, University of Texas at San Antonio(信息系统与网络安全系,德克萨斯大学圣安东尼奥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种双代理逃逸框架,通过语义扰动空间在无梯度反馈和严格查询预算下测试NLP流水线的鲁棒性,发现架构选择影响攻击面,并通过模式指导防御降低逃逸率。

Comments Submitted to IEEE TRANSACTIONS ON INFORMATION FORENSICS AND SECURITY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22852 2026-04-28 cs.RO cs.AI 81%

SwarmDrive: Semantic V2V Coordination for Latency-Constrained Cooperative Autonomous Driving

SwarmDrive: 语义车辆间协调用于延迟受限的协同自动驾驶

Anjie Qiu, Donglin Wang, Zexin Fang, Sanket Partani, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(科布伦茨-兰道大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 SwarmDrive通过语义车辆间协调框架,在高不确定性时共享紧凑意图分布,并通过事件触发共识融合,提升协同自动驾驶性能,减少延迟并提高成功率。

Comments 6 pages, 4 figures, submitted to VTC fall 2026 workshop on W9: 2nd Workshop on Shaping Future Connectivity: Emerging and Intelligent Technologies for Sustainable Vehicular Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10180 2026-04-28 cs.CL 81%

For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs

For-Value:高效前向仅数据估值用于微调LLM和VLM

Wenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos Thrampoulidis, Boying Gong, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Meta

专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出For-Value框架,通过前向计算高效评估数据价值,无需反向传播,提升大规模模型训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 81%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20979 2026-04-27 cs.LG 81%

Toward Robust and Efficient ML-Based GPU Caching for Modern Inference

迈向鲁棒且高效的基于机器学习的GPU缓存

Peng Chen, Jiaji Zhang, Hailiang Zhao, Yirong Zhang, Shenyao Chen, Jiahong Yu, Xueyan Tang, Yixuan Wang, Hao Li, Jianping Zou, Gang Xiong, Kingsum Chow, Shuibing He, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Kuaishou(快手)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出学习增强型LRU算法,通过整合预测提升缓存性能,实现1-一致性与O(k)-鲁棒性,同时在GPU上构建LCR缓存,实验显示在LLM和DLRM任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15919 2026-04-27 cs.DC cs.AI 81%

HFX: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling

HFX:多SLO服务与快速扩展的算法与系统联合设计

Zahra Yousefijamarani, Xinglu Wang, Qian Wang, Morgan Lindsay Heisler, Taha Shabani, Niloofar Gholipour, Parham Yassini, Hong Chang, Kan Chen, Qiantao Zhang, Xiaolong Bai, Jiannan Wang, Ying Xiong, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada Co., Ltd.(华为技术加拿大有限公司) Simon Fraser University(西蒙弗雷泽大学) École de technologie supérieure(高等技术学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HFX通过联合优化请求调度与弹性扩展,满足多样化的SLO,实验显示在延迟、成本等方面优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21536 2026-04-24 cs.IR cs.AI 81%

Pre-trained LLMs Meet Sequential Recommenders: Efficient User-Centric Knowledge Distillation

预训练大语言模型遇见序列推荐者:高效的用户导向知识蒸馏

Nikita Severin, Danil Kartushov, Vladislav Urzhumov, Vladislav Kulikov, Oksana Konovalova, Alexey Grishanov, Anton Klenitskiy, Artem Fatkulin, Alexey Vasilev, Andrey Savchenko, Ilya Makarov

机构 * Independent researcher(独立研究者) Sber AI Lab(Sber AI实验室) Innopolis University(Innopolis大学) HSE University(俄罗斯高等经济大学) ITMO University(ITMO大学) AIRI

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种高效的用户导向知识蒸馏方法,利用预训练大语言模型生成的文本用户资料提升序列推荐系统对用户语义的理解,无需实时调用大语言模型,保持传统序列模型的推理效率。

Comments Accepted to ECIR 2026. 7 pages. This version of the contribution has been accepted for publication, after peer review but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections. The Version of Record is available online at: http://dx.doi.org/10.1007/978-3-032-21300-6_42

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20064 2026-04-24 cs.LG 81%

Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs

非老虎机:在推测解码中具有证明无遗憾的草案模型选择

Hongyi Liu, Jiaji Huang, Zhen Jia, Youngsuk Park, Yu-Xiang Wang

机构 * Rice University(里士大学) Amazon Web Services(亚马逊网络服务) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种在推测解码中能证明无遗憾的草案模型选择算法,通过评估所有草案模型而非仅选定模型,显著提升性能,适用于多种解码方法,并在多个领域优于现有方法。

Comments ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14170 2026-04-22 cs.CL cs.CY 81%

Comparing energy consumption and accuracy in text classification inference

在文本分类推理中比较能耗与准确性

Johannes Zschache, Tilman Hartwig

机构 * Application Lab for AI and Big Data(人工智能与大数据应用实验室)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究比较了文本分类推理中模型准确性和能耗的权衡,发现高准确度模型可能也具备能效,LLM在零样本分类中与传统模型有相似或更低的准确率,能耗受模型类型、规模和硬件影响显著。

Comments Key results in Figure 2, accepted in Nature Sci Rep, 32 pages

Journal ref Sci Rep 16, 12717 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 81%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13327 2026-04-22 cs.DC cs.LG cs.PL 81%

Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel

事件张量:一种统一的编译动态巨核抽象

Hongyi Jin, Bohan Hou, Guanjie Wang, Ruihang Lai, Jinqi Chen, Zihao Ye, Yaxing Cai, Yixin Dong, Xinhao Cheng, Zhihao Zhang, Yilong Zhao, Yingyi Huang, Lijie Yang, Jinchen Jiang, Gabriele Oliaro, Jianan Ji, Xupeng Miao, Vinod Grover, Todd C. Mowry, Zhihao Jia, Tianqi Chen

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出事件张量,一种统一的编译动态巨核抽象,通过编码 tiled 任务间的依赖关系,支持动态形状和数据依赖的动态性,从而提升大型语言模型服务的性能和减少系统预热开销。

Comments 16 pages. 18 figures. accepted in MLSys 2026. References corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03261 2026-04-22 cs.CL cs.CY cs.HC 81%

VIGIL: An Extensible System for Real-Time Detection and Mitigation of Cognitive Bias Triggers

VIGIL:一个用于实时检测和缓解认知偏差触发的可扩展系统

Bo Kang, Sander Noels, Tijl De Bie

机构 * Ghent University(根特大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 VIGIL通过浏览器扩展实时检测和缓解在线信息中的认知偏差触发,结合LLM重述和隐私分层推理,提供可扩展的插件系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23281 2026-04-22 cs.CL 81%

MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)

MCP与RAG与NLWeb与HTML:不同网页代理接口的有效性和效率比较(技术报告)

Aaron Steiner, Ralph Peeters, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了四种网页代理接口的有效性和效率,发现RAG、MCP和NLWeb在效果和效率上均优于HTML。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates. ACM, New York, NY, USA, pp. 8493-8496

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08240 2026-04-22 cs.CL 81%

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

对齐之舞:联合训练代理以安全协作

Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03828 2026-04-22 cs.LG stat.ML 81%

IMPACT: Importance-Aware Activation Space Reconstruction

IMPACT: 基于重要性的激活空间重建

Md Mokarram Chowdhury, Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出IMPACT框架,通过结合激活结构与梯度重要性,实现低秩压缩优化,实验显示在保持准确性的同时,模型大小可减少55.4%。

Comments To appear in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18296 2026-04-21 cs.CL 81%

Exploring Concreteness Through a Figurative Lens

通过隐喻视角探索具体性

Saptarshi Ghosh, Tianyu Jiang

机构 * University of Cincinnati(俄亥俄州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究探讨LLM如何区分字面与隐喻用法,发现早期层分离具体性,中后期层压缩为一维方向,该结构可提升隐喻分类和生成控制。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18159 2026-04-21 cs.CL 81%

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

FreezeEmpath: 基于冻结大语言模型的高效共情语音聊天机器人训练

Yun Hong, Yan Zhou, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 FreezeEmpath,通过冻结大语言模型参数,利用现有语音指令和情感识别数据高效训练共情语音聊天机器人,实现情感表达和对话性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02264 2026-04-21 cs.CL 81%

CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment

通过对话流程对齐构建可解释的任务导向对话系统:CoDial

Radin Shayanfar, Chu Fei Luo, Rohan Bhambhoria, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电气与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 CoDial通过将预定义任务 schema 转换为结构化异构图并生成程序化 LLM 防御代码,实现对话策略的高效可解释对齐,提升任务导向对话系统的泛化能力与可解释性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23114 2026-04-21 cs.CL 81%

Alignment Data Map for Efficient Preference Data Selection and Diagnosis

用于高效偏好数据选择与诊断的对齐数据图

Seohyeong Lee, Eunwon Kim, Hwaran Lee, Buru Chang

机构 * Sogang University(ソガン大学) Upstage(アップステージ) Korea University(韩国大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出对齐数据图,通过评估偏好数据的对齐分数,选择高质量低变异性样本,提升对齐效果并提高标注准确性。

Comments ACL 2026 Findings Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17325 2026-04-21 cs.CL 81%

Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation

对齐文档与问题:面向问题的文档重写以增强检索增强生成

Jiaang Li, Zhendong Mao, Quan Wang, Yuning Wan, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出QREAM框架,通过风格控制重写使检索文档更符合问题需求,提升检索增强生成的准确性与效率。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15728 2026-04-20 cs.CR cs.AI 81%

Privacy-Preserving LLMs Routing

隐私保护的大语言模型路由

Xidong Wu, Yukuan Zhang, Yuqiong Ji, Reza Shirkavand, Qian Lou, Shangqian Gao

机构 * Department of Electrical and Computer Engineering, University of Pittsburgh(匹兹堡大学电气与计算机工程系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Computer Science, University of Maryland(马里兰大学计算机科学系) Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PPRoute框架,通过MPC友好的操作加速编码器推理,维护路由质量,并采用无序Top-k算法降低通信延迟,实现高效隐私保护的大语言模型路由。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15357 2026-04-20 cs.AR cs.AI cs.DC 81%

Taming Asynchronous CPU-GPU Coupling for Frequency-aware Latency Estimation on Mobile Edge

平滑异步CPU-GPU耦合以实现频率感知的延迟估计

Jiesong Chen, Jun You, Zhidan Liu, Zhenjiang Li

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) INTR Thrust, System Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)系统枢纽INTR团队)

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出FLAME方法,通过分层建模量化并行性重叠,解决异步耦合导致的延迟波动问题,提升移动边缘应用的延迟估计精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05489 2026-04-20 cs.LG 81%

Self-Aligned Reward: Towards Effective and Efficient Reasoners

自对齐奖励:迈向高效且有效的推理器

Peixuan Han, Adit Krishnan, Gerald Friedland, Jiaxuan You, Chris Kong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出自对齐奖励(SAR),通过补充可验证奖励以提升推理准确性和效率,实验表明SAR在4个模型7个基准上提升了4%的准确率并降低了30%的计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08055 2026-04-17 cs.LG cs.DC 81%

From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill

从令牌到层:重新定义MoE服务中的无停滞调度

Gunjun Lee, Jiwon Kim, Jaiyoung Park, Younjoo Lee, Jung Ho Ahn

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出分层预填调度方法,通过将Transformer层组作为调度单元,减少MoE模型中的专家权重重复加载,提升TTFT和TBT性能,降低能耗和带宽需求。

Comments 24 pages, 5 figure, 12 tables, accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11465 2026-04-16 cs.AI 81%

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

三种角色,一个模型:推理时的角色编排以缩小小规模与大规模代理之间的性能差距

S. Aaron McClendon, Jorge Gallego-Feliciano, Stavros Zervoudakis, Antonios Saravanos

机构 * Aimpoint Digital Labs(Aimpoint数字实验室) New York University(纽约大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究在推理时仅使用架构支撑是否能提升小模型在复杂多步骤环境中的性能,通过三阶段推理架构使小模型在AppWorld基准测试中任务完成率提升近一倍,展示了结构化推理干预使小模型能与大模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏