arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2606.00756 2026-06-02 cs.AI 90%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00516 2026-06-02 cs.AI 90%

Threshold-Based Exclusive Batching for LLM Inference

基于阈值的独占批处理用于LLM推理

Weifang Zhang, Yuzhou Nie, Bowen Pang, Guangrui Ma, Shining Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用工程技术中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对混合批处理中预填充与解码干扰导致边际成本上升的问题,提出基于GPU内存带宽、模型大小和工作负载的EB-MB性能交叉条件及最优切换阈值,优化后的独占批处理在带宽受限GPU上吞吐量提升高达41.9%。

Comments 37 pages, 12 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00460 2026-06-02 cs.CL eess.AS 90%

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

SALSA: 通过学习的引导激活向量实现语音感知的LLM适配

Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng, Julia Hockenmaier, Chang D. Yoo, Mark A. Hasegawa-Johnson

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过监督学习优化逐层引导向量,在儿童语音、多语种语音和普通话-英语代码切换基准上显著提升零样本推理和语音上下文学习性能,最高相对提升46.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22813 2026-06-02 cs.LG 90%

Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation

Quartet II: 通过改进的无偏梯度估计实现 NVFP4 中准确的 LLM 预训练

Andrei Panferov, Erik Schultheis, Soroush Tabesh, Dan Alistarh

机构 * University of Waterloo(多伦多大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出一种用于微缩放格式的无偏量化方法 MS-EDEN,其量化误差比随机舍入低 2 倍以上,并集成到全 NVFP4 线性层量化方案 Quartet II 中,在 LLM 预训练中实现更准确的梯度估计和加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04791 2026-06-02 cs.LG 90%

DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing

DuetServe: 通过自适应GPU多路复用协调LLM服务的预填充与解码

Lei Gao, Chaoyi Jiang, Hossein Entezari Zarch, Daniel Wong, Mark Hill, Murali Annavaram

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM服务中预填充与解码阶段的干扰问题,提出DuetServe框架,通过自适应SM级GPU空间多路复用实现单GPU内的阶段隔离,在保证低延迟的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31097 2026-06-01 cs.DB cs.AI 90%

SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition

SpecDB: 通过面向特征的分解生成LLM定制的数据库

Yunkai Lou, Longbin Lai, Shunyang Li, Zhengping Qian, Ying Zhang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SpecDB系统,利用大语言模型通过面向特征的分解和依赖图DBGraph,从自然语言工作负载描述自动生成定制化关系数据库,在TPC-C测试中达到与PostgreSQL和MySQL相当的性能,代码量仅为它们的3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30723 2026-06-01 cs.CL 90%

Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents

技能并非一刀切:面向 LLM 智能体的模型感知技能对齐

Jianxiang Yu, Jiapeng Zhu, Bochen Lin, Qier Cui, Zichen Ding, Xiang Li

机构 * East China Normal University(华东师范大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 提出 MASA 框架,通过层次化技能进化管道和轻量级条件重写器,为不同能力的 LLM 主干网络自适应调整技能,显著提升长时交互任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18382 2026-06-01 cs.AI 90%

From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

从弱线索到真实身份:评估LLM代理中推理驱动的去匿名化

Myeongseob Ko, Jihyun Jeong, Sumiran Singh Thakur, Gyuhak Kim, Ruoxi Jia

机构 * Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机工程系) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过LLM代理结合分散的非识别线索与公开证据重建真实身份的能力,揭示了即使在没有明确标识符的情况下,代理也能以高成功率实现去匿名化,并提出了新的隐私评估维度。

Comments Accepted at ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07905 2026-06-01 cs.AI 90%

MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation

MedCoG:通过元认知调节最大化医学推理中的LLM推理密度

Yu Zhao, Hao Guan, Yongcheng Jing, Ying Zhang, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec Center, Nankai University, China 300350(南开大学计算机学院、VCIP、DISSec中心、中国300350) Generative AI Lab, College of Computing and Data Science(生成式人工智能实验室、计算与数据科学学院) Nanyang Technological University, Singapore 639798(南洋理工大学,新加坡639798)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MedCoG框架,利用元认知评估动态调节知识使用,以缓解推理扩展定律下的收益递减,提升推理效率与准确性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30218 2026-05-29 cs.LG cs.PF 90%

MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference

MarginGate: 用于批量不变LLM推理的稀疏边际触发验证

Kexin Chu, Yang Zhou, Wei Zhang

机构 * University of Connecticut(康涅狄格大学) UC Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出MarginGate方法,利用logit边际稀疏触发验证,仅对低边际步骤进行验证并修复,以低成本实现批量不变LLM推理的确定性解码。

Comments 13 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30150 2026-05-29 cs.AI 90%

Anchorless Diversification for Parallel LLM Ideation

无锚点多样化并行LLM创意生成

Fares Nabil Ibrahim, Nafis Saami Azad, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing, University of South Florida(贝尔尼人工智能、网络安全与计算学院,佛罗里达州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究无锚点方法(如语义方向分层)在并行LLM创意生成中实现候选池多样化,无需依赖种子想法,在多样性、质量和计算效率上优于有锚点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29612 2026-05-29 cs.MA cs.CL 90%

CONCAT: Consensus- and Confidence-Driven Ad Hoc Teaming for Efficient LLM-Based Multi-Agent Systems

CONCAT: 基于共识与置信驱动的即席团队协作以实现高效的基于LLM的多智能体系统

Ziyang Ma, Dingyi Zhang, Sichu Liang, Jiajia Chu, Pengfei Xia, Hui Zang, Deyu Zhou

机构 * Southeast University(东南大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种无需训练的共识与置信驱动即席团队协作框架CONCAT,通过聚类初始答案、选择高置信领导者并基于心智理论预测协作收益来动态组织多智能体交互,显著提升效率并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14241 2026-05-29 cs.LG 90%

Latency-Quality Routing for Functionally Equivalent Tools in LLM Agents

LLM 代理中功能等价工具的延迟-质量路由

Kexin Chu, Dawei Xiang, Wei Zhang

机构 * University of Connecticut(康涅狄格大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM代理中多个功能等价工具提供者的路由问题,提出LQM-ContextRoute上下文强盗路由器,通过延迟-质量匹配和查询特定质量估计,在运行时负载下实现延迟与质量的权衡,在多个基准上优于SW-UCB。

Comments 14 pages, 6 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28168 2026-05-28 cs.AI 90%

OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings

OccuReward: 面向电网交互建筑中人口公平性的LLM引导的以 occupant 为中心的奖励塑造

Shadmehr Zaregarizi, Khashayar Yavari

机构 * Politecnico di Torino(都灵理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OccuReward框架,利用大语言模型迭代塑造奖励函数,通过舒适公平指数(CEI)反馈,在CityLearn v2中提升不同人口群体的舒适公平性,同时降低能耗成本。

Comments 4 pages, 2 figures. Accepted at OccuSys 2026, co-located with ACM Sustainability Week 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27429 2026-05-28 cs.IR cs.AI 90%

Ocean4Rec: Offline LLM-Derived OCEAN Profiles for Request-Time VOD Reranking

Ocean4Rec:离线LLM生成的OCEAN画像用于请求时VOD重排序

Wonkyun Kim, Sehyun Bae, Kwanki Ahn, Mungyu Bae, Saeun Choi, Soyeon You, Chandra Prabhakar, Sehyun Kim

机构 * Samsung Electronics Republic of Korea(韩国三星电子公司) Samsung Electronics India(印度三星电子公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Ocean4Rec重排序层,利用LLM离线生成物品OCEAN画像,在请求时无需LLM调用,通过数值计算提升VOD推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26596 2026-05-27 cs.AI 90%

AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents

AGORA: 基于适配器接地观察-动作保留的LLM智能体无推理提示压缩

Haoran Zhang, Zhaohua Sun

机构 * AI Agent Technologies (Hong Kong) Limited(人工智能代理技术(香港)有限公司) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体,提出AGORA无推理步骤级压缩器,通过结构提示解析器、格式关键内容保留和125M参数相关性评分器,在9个测试单元中8个保持≥75%的无压缩性能。

Comments 10 pages, 2 figures. Code and data: https://github.com/ranranrannervous/agoracompression

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 90%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00499 2026-05-26 cs.LG 90%

Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions

具有不确定性感知输出长度预测的LLM推理调度

Haoyu Zheng, Yongqiang Zhang, Fangcheng Fu, Xiaokai Zhou, Hao Luo, Hongchao Zhu, Yuanyuan Zhu, Hao Wang, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机学院) Dameng Database Co., Ltd., Wuhan, China(达梦数据库有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Institute for Math and AI, Wuhan University, Wuhan, China(武汉大学数学与人工智能研究院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理调度,提出基于对数t分布的输出长度分布模型,并设计Tail Inflated Expectation (TIE)指标替代点估计,以降低在线推理延迟并提高离线吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10977 2026-05-26 cs.CR cs.AI 90%

PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks

PASA:一种针对语义不变攻击的LLM生成文本的原则性嵌入空间水印方法

Zhenxin Ai, Haiyun He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PASA水印算法,在潜在嵌入空间的语义簇上嵌入和检测水印,通过理论框架实现检测精度、鲁棒性和失真的基本权衡,在强释义攻击下仍保持鲁棒性和文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03955 2026-05-26 cs.AI cs.MA 90%

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk:将多智能体智能蒸馏到单个LLM智能体中

Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li, Weijie Xu, Xin Chen, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentArk框架,通过三种分层蒸馏策略将多智能体系统的交互动态蒸馏到单个模型权重中,使单个智能体具备多智能体的推理和自校正能力,同时保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11215 2026-05-25 cs.DC cs.AI 90%

ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

ReCoVer: 通过容错集合和多功能工作负载实现的弹性LLM预训练系统

Ziyue Liu, Zhengyang Wang, Ruijie Zhang, Avinash Maurya, Hui Zhou, Paul Hovland, Sheng Di, Franck Cappello, Bogdan Nicolae, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReCoVer系统,通过保持每次迭代微批次数恒定、容错集合通信、步内细粒度恢复和动态工作负载重分配,实现并行方案无关的弹性LLM预训练,在512 GPU上即使丢失256 GPU也能保持训练轨迹,有效吞吐量比检查点重启基线高2.23倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22897 2026-05-25 cs.LG 90%

From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data

从残差到原因:基于LLM的表格数据机制推断

Mohammad R. Rezaei, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出多智能体残差上下文学习框架(MARICL),通过让LLM分析基础模型残差并迭代生成修正项,在多个科学基准上提升预测性能并实现机制泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07985 2026-05-22 cs.DC cs.AI 90%

Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation

Dooly: 一种配置无关、冗余感知的LLM推理模拟器

Joon Ha Kim, Geon-Woo Kim, Anoop Rachakonda, Daehyeok Kim

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Dooly,一种能够忽略配置差异并高效处理冗余的LLM推理模拟器,通过单次推理过程和智能标签传播减少冗余 profiling 耗时,提升模拟精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 90%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21082 2026-05-21 cs.AI 90%

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19537 2026-05-21 cs.LG 90%

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

沉默的超参数:量化推理后端对LLM可重复性的影响

David Pape, Jonathan Evertz, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了推理后端对LLM基准测试结果的影响,发现不同后端可能导致基准分数变化达16.6个百分点,并引发高比例的输出分歧,强调了推理后端作为关键超参数的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18672 2026-05-19 cs.AI 90%

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的

S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

机构 * CSX-AI University of Liverpool(利物浦大学) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Austrian Institute of Technology(奥地利技术研究院) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16474 2026-05-19 cs.IR cs.AI 90%

LERA: LLM-Enhanced RAG for Ad Auction in Generative Chatbots

LERA:基于大语言模型的生成聊天机器人广告拍卖

Haoran Sun, Xinrui Song, Xinyu Zhang, Zhaohua Chen, Xu Chu, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Xiaotie Deng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Shandong University(山东大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LERA提出一种两阶段检索生成拍卖框架,通过嵌入粗过滤和LLM提示生成优化广告相关性评分,提升广告选择准确性和多样性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 90%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14249 2026-05-15 cs.LG 90%

EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization

EnergyLens: 多GPU LLM推理优化中的预测能效探索

Zhiye Song, Kyungmi Lee, Eun Kyung Lee, Xin Zhang, Tamar Eilam, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EnergyLens通过einsum接口和MoE建模优化多GPULLM推理能耗,实现9.25%-13.19%的能耗预测精度,揭示配置间能效差异并推动分布式服务。

详情

展开后加载摘要…

URL PDF HTML 收藏