arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2605.20402 2026-06-03 cs.LG cs.AI 90%

Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor

分解 MXFP4 量化误差以用于大语言模型强化学习:可约简的偏差、可恢复的死区以及不可约简的底噪

Xiaocan Li, Shiliang Wu, Zheng Shen

机构 * Huawei Canada(华为加拿大)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过将 MXFP4 量化误差分解为三个可加分量(尺度偏差、死区截断和网格噪声),并针对每个分量提出针对性修正(宏块缩放、异常值回退和自适应量化噪声),从而在 LLM 强化学习后训练中恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02355 2026-06-02 cs.AI cs.LG 90%

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

SIRI:具有内在技能的自我内化强化学习用于LLM智能体训练

Zhongyu He, Yuanfan Li, Fei Huang, Tianyu Chen, Siyuan Chen, Xingyang Li, Meng Hsuan Yu, Xiangrong Liu, Leyi Wei, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Xiamen University(厦门大学) Meituan(美团) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SIRI框架,通过自我技能挖掘、验证和内化,使LLM智能体无需外部技能生成器或推理时技能库即可提升长程任务性能,在ALFWorld和WebShop上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05395 2026-06-02 stat.ML cs.AI cs.LG 90%

Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers

用于高效推断一致LLM答案的最优贝叶斯停止

Jingkai Huang, Will Ma, Zhengyuan Zhou

机构 * Stern School of Business, New York University, New York, USA(纽约大学 Stern 商学院) Graduate School of Business, Columbia University, New York, USA(哥伦比亚大学 商学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 利用贝叶斯先验信息,通过L-聚合停止策略在达到足够一致性时提前停止采样,以最小化采样成本并高效识别最一致的LLM答案。

Comments Accepted to ICML 2026. Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22722 2026-06-01 cs.IR cs.AI cs.LG 90%

Aligning Dense Retrievers with LLM Utility via Distillation

通过蒸馏将稠密检索器与LLM效用对齐

Rajinder Sandhu, Di Mu, Cheng Chang, Md Shahriar Tasjid, Himanshu Rai, Maksims Volkovs, Ga Wu

机构 * Dalhousie University(达尔豪西大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Utility-Aligned Embeddings (UAE)框架,通过蒸馏LLM的困惑度降低效用分布来训练双编码器,在不增加测试时LLM推理开销的情况下提升稠密检索的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28827 2026-05-29 cs.CL cs.LG 90%

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

RightNow-Arabic-0.5B-Turbo: 通过词汇注入和边缘优先部署的开源子10亿参数阿拉伯语语言模型

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 针对现有阿拉伯语模型要么是多语言模型对阿拉伯语支持不足,要么是参数过大难以部署的问题,提出基于Qwen2.5-0.5B的518M参数阿拉伯语专用模型RightNow-Arabic-0.5B-Turbo,通过词汇注入、继续预训练和监督微调等方法,在三个阿拉伯语基准上达到35.9%平均准确率,与1.5B模型性能相当,并实现边缘端高效部署。

Comments 12 pages, 7 tables, 4 figures, 1 algorithm. Weights: https://huggingface.co/RightNowAI/RightNow-Arabic-0.5B-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 90%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28302 2026-05-28 cs.LG cs.AI cs.DC 90%

How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

解聚能走多远?面向高效 MoE LLM 服务的 Attention-FFN 解聚设计空间探索

Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee, Tuhin Khare, Sudarshan Srinivasan, Suvinay Subramanian, Souvik Kundu, Madhu Kumar, Midhilesh Elavazhagan, William Won, Amir Yazdanbakhsh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel(英特尔) Google(谷歌) Google DeepMind(谷歌DeepMind) Infravana

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统探索了从分块预填充、预填充-解码解聚到算子级 Attention-FFN 解聚 (AFD) 的不同解聚层次在 MoE 模型推理中的收益与局限,通过融合设备内核测量与高保真网络仿真的框架,在严格 TTFT/TPOT SLO 下 AFD 可在 DeepSeek-V3.2 上维持约 4k tokens/s 的系统吞吐量,并给出了联合优化吞吐与交互性的具体设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26731 2026-05-27 cs.AI cs.CL 90%

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

不是能力问题:LLM 智能体层级间的驾驭敏感性非单调

Yong-eun Cho

机构 * KailosLab(凯罗斯实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过 432 次实验,发现 LLM 智能体的驾驭敏感性随模型层级非单调变化,且依赖模型类型(聊天 vs. 推理),推翻了“更高能力模型需要更少结构指导”的假设。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02355 2026-05-27 cs.LG cs.AI 90%

"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization

“给我BF16,否则给我死亡”?LLM量化中的精度-性能权衡

Eldar Kurtic, Alexandre Marques, Shubhra Pandit, Mark Kurtz, Dan Alistarh

机构 * Red Hat AI(红帽AI) Institute of Science and Technology Austria(奥地利科学与技术研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过超过50万次评估,全面研究了FP8、INT8和INT4量化在Llama-3.1模型族上的精度-性能权衡,发现FP8无损、INT8精度损失低、INT4权重仅量化具有竞争力,并基于vLLM框架给出了不同部署场景下的最优量化格式建议。

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25424 2026-05-26 cs.LG cs.AI 90%

SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

SeqRoute: 通过离线强化学习实现全局预算感知的顺序LLM路由

Zhongling Xu, Shunan Zheng, Wei Wang

机构 * Department of Operations Research and Industrial Engineering(运筹学与工业工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SeqRoute框架,将多轮LLM路由建模为有限时域马尔可夫决策过程,通过离线强化学习(CQL)和事后预算重标记(HBR)学习延迟满足,在全局预算约束下优化成本与质量,降低破产率至1%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25141 2026-05-26 cs.CL cs.AI 90%

LLM Agent Based Renewable Energy Forecasting Using Edge and IoT Data A Review of Solar Wind Weather and Grid Aware Decision Support

基于LLM Agent的利用边缘和物联网数据的可再生能源预测:太阳能、风能、天气和电网感知决策支持综述

Pavan Manjunath, Thomas Pruefer

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了如何利用大语言模型代理整合异构传感器流、天气API数据、历史发电记录和电网约束,形成统一的决策支持工作流,以增强可再生能源预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06669 2026-05-22 cs.CR cs.AI cs.LG 90%

Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs

评估教育LLM导师的提示注入防御:安全-可用性-延迟的权衡

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估提示注入防御方法的框架,探讨了在教育LLM导师中安全、可用性和延迟之间的权衡,并通过实验比较了不同防御机制的性能。

Comments 19 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12610 2026-05-22 cs.DB cs.AI cs.LG 90%

ScaleDoc: Scaling LLM-based Predicates over Large Document Collections

ScaleDoc: 通过大规模文档集合进行基于大语言模型的谓词扩展

Hengrui Zhang, Yulong Hui, Yihao Liu, Huanchen Zhang

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScaleDoc系统,通过将谓词执行分为离线表示阶段和优化的在线过滤阶段,解决了大规模文档分析中大语言模型高推理成本的问题,实现了端到端速度提升和LLM调用成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18818 2026-05-20 cs.AI cs.LG cs.SE 90%

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

将文档AI operationalize:一种用于OCR和LLM流水线的微服务架构

Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种微服务架构,用于在生产环境中实现文档理解,通过整合多个模型的流水线,包括分类、OCR和LLM结构字段提取,并展示了在每小时处理数千页文档的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16895 2026-05-19 cs.CE cs.AI cs.CL 90%

The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

阿尔法幻觉:LLM交易代理报告的阿尔法不应被视为部署证据

Yuxuan Ye, Jun Han, Ao Hu, Juncheng Bu, Yiyi Chen, Liangjian Wen, Danilo Mandic, Danny Dongning Sun, Xu Yinghui, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Southwest University of Finance and Economics(西南财经大学) Northeastern University(东北大学) Imperial College London(伦敦帝国理工学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文指出,LLM交易代理报告的阿尔法不应被当作部署的证据,因为这些阿尔法需要通过结构有效性测试来验证其时间完整性、现实摩擦、反事实稳健性、预测校准、数值执行和多代理分解等关键指标,当前的公开证据无法区分稳健的预测能力与时间污染、未建模的摩擦、短窗口夏普不确定性、叙事拟合和参数先验等因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07799 2026-05-19 cs.CL cs.AI 90%

Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models

基于图扩散模型的多LLM代理通信拓扑动态生成

Eric Hanchen Jiang, Mengting Li, Guancheng Wan, Sophia Yin, Yuchen Wu, Xiao Liang, Xinfeng Li, Yizhou Sun, Wei Wang, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Guided Topology Diffusion框架,通过迭代构建过程生成适应任务需求的高效通信拓扑,优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14844 2026-05-15 cs.LG cs.AI 90%

XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference

XFP:面向LLM推理的质量导向自适应码本量化与稀疏异常分离

Thomas Witt

机构 * Gemini Stiftung(吉姆米基金会)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 XFP通过自适应码本量化和稀疏异常分离技术,实现高质量LLM推理,无需Hessian或校准数据,支持动态调整码本大小和异常预算,提升推理速度和精度。

Comments 17 pages, 3 figures, 17 tables, 1 algorithm. Code: https://github.com/flash7777/vllm/tree/multiquant

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12019 2026-05-13 cs.LG cs.AI 90%

Efficient and Adaptive Human Activity Recognition via LLM Backbones

通过LLM骨干实现高效且自适应的人体活动识别

Aleksandr Bredikhin, Philippe Lalanda, German Vega

机构 * Univ. Grenoble Alpes, France(格勒诺布尔阿尔卑斯大学,法国)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用预训练大语言模型作为通用时间骨干,用于基于传感器的人体活动识别,通过结构化卷积投影和参数高效LoRA适应,提升跨数据集迁移能力和低数据场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11999 2026-05-13 cs.DC cs.AI cs.LG cs.PF 90%

The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures

LLM解码中的功率限制幻觉:跨注意力架构的相位感知能耗分析

Bole Ma, Ayesha Afzal, Jan Eitzinger, Gerhard Wellein

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究揭示LLM解码中功率限制的表面现象,通过分析四种注意力架构发现解码实际耗能较低,内存瓶颈导致带宽饱和而非计算瓶颈,钟速锁定比功率限制更有效,可提升解码能耗32%并最小化吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 90%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11202 2026-05-13 cs.CR cs.AI cs.LG cs.SE 90%

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

在LLM服务系统中通过模糊测试连续发现漏洞

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出GRIEF模糊器,通过时间多请求追踪发现LLM服务层漏洞,包括15个漏洞,10个已确认,涉及缓存隔离失败、跨请求性能干扰和崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11019 2026-05-13 cs.LG cs.AI 90%

Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness

通过变分后验指导实现高效的LLM推理:具有效率意识

Zizhao Chen, Yuying Li, Siting Lin, Lianxi Wang

机构 * Guangdong University of Foreign Studies(广东外语外贸大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VPG-EA框架,通过变分推断和效率感知证据下界提升LLM推理效率,实验显示在不同模型规模下效率指标提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04284 2026-05-12 cs.AI cs.LG 90%

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

Agent-Omit:适应性上下文省略以提高LLM代理效率

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science(香港科学与技术大学人工智能前沿) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Agent-Omit框架,通过省略冗余思考和观察提升LLM代理效率,实验表明其在多个基准测试中表现优异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06320 2026-05-08 cs.MA cs.AI cs.CL 90%

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

通过自适应任务图提高语言代理团队的效率

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholutsky, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) MIT(麻省理工学院) New York University(纽约大学)

专题命中 效率与部署 :language agent(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LATTE框架,通过自适应任务图提升语言代理团队效率,减少资源消耗并提高协作准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05696 2026-05-08 cs.DC cs.AI cs.LG 90%

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

Irminsul:基于MLA的原生位置无关缓存用于代理LLM服务

Bole Ma, Jan Eitzinger, Harald Köstler

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Irminsul,一种基于MLA的原生位置无关缓存,通过内容哈希键和δ旋转规则提升代理LLM服务性能,实现高达83%的提示词恢复率和63%的预填能量节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05485 2026-05-08 cs.CL cs.AI 90%

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效的程序合成

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过编译推理轨迹生成符号求解器,提升程序合成效率与准确性,同时减少对LLM的依赖,适用于多个基准测试任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03379 2026-05-08 cs.LG cs.CL 90%

Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference

两次调用、两次矩与重复LLM推理的投票准确性曲线

Yi Liu

机构 * York University(约克大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究重复LLM推理的二元正确性层,在条件独立同分布调用下,通过两次调用确定第二矩和相同示例正确性相关性,从而为固定多数投票预算提供分布无关的两调用区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15954 2026-04-29 cs.LG cs.AI 90%

MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment

MobileLLM-Flash: 用于工业级部署的延迟引导设备端大语言模型设计

Hanxian Huang, Igor Fedorov, Andrey Gromov, Bernard Beckerman, Naveen Suda, David Eriksson, Maximilian Balandat, Rylan Conway, Patrick Huber, Chinnadhurai Sankar, Ayushi Dalmia, Zechun Liu, Lemeng Wu, Tarek Elgamal, Adithya Sagar, Vikas Chandra, Raghuraman Krishnamoorthi

机构 * Meta AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出MobileLLM-Flash,通过硬件循环架构搜索在移动端延迟约束下设计高效的大语言模型,支持8k上下文长度,实现更快的预填和解码速度。

Comments Accepted to ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23530 2026-04-28 cs.CL cs.AI 90%

MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings

MTRouter: 带成本意识的多轮LLM路由与历史-模型联合嵌入

Yiqun Zhang, Hao Li, Zihan Wang, Shi Feng, Xiaocui Yang, Daling Wang, Bo Zhang, Lei Bai, Shuyue Hu

机构 * School of Computer Science and Engineering, Northeastern University Shenyang 110819, China(东北大学计算机科学与工程学院,中国沈阳110819) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MTRouter,通过联合历史-模型嵌入和学习轨迹预测器,提升多轮任务的性能-成本平衡,实验显示在ScienceWorld和Humanity's Last Exam上均取得显著成本降低与性能提升。

Comments This work has accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18697 2026-04-22 cs.CR cs.CL cs.LG 90%

Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs

超越不可区分性:衡量LLM API中的提取风险

Ruixuan Liu, David Evans, Li Xiong

机构 * Emory University(埃默里大学) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出$(l, b)$-不可提取性作为衡量LLM API提取风险的新标准,通过定义提取风险上界并实验证明其在不同模型中的有效性,为模型训练、API访问和解码配置提供缓解指南。

Comments Accepted by S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏