arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2608.00368 2026-08-04 eess.SP 新提交 80%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 80%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31031 2026-08-04 cs.IR 版本更新 80%

GenPage: Towards End-to-End Generative Homepage Construction at Netflix

GenPage:面向Netflix主页的端到端生成式构建

Lequn Wang, Jiangwei Pan, Linas Baltrunas

专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract)

AI总结 提出GenPage,用单一Transformer替代传统多阶段推荐栈,通过自回归生成整个主页,结合预训练与后训练,在线A/B测试中核心指标提升0.24%,延迟降低20%。

Comments Accepted at ACM RecSys 2026. Author's accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29069 2026-08-03 cs.DC 新提交 80%

Rethinking AI Cloud Infrastructure for Agentic Serving Systems with the Aries Experimentation Framework

基于Aries实验框架重新思考智能体服务系统的AI云基础设施

Leonid Kondrashov, Hongrui Liu, JooYoung Park, Boxi Zhou, Zonghao Liu, Chengzhi Lu, Riccardo Mancini, Esha Choukse, Haris Javaid, German Sviridov, Tao Peng, Chen Zhao, Anastasia Avdeeva, Aleksei Gusev, Marios Kogias, Luo Mai, Dmitrii Ustiugov

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26560 2026-07-31 eess.SY cs.SY econ.GN q-fin.EC 交叉投稿 80%

Emission-Forecasting-Based Spatial-Temporal Carbon Response: A Multi-Agent Attention-Enhanced Deep Learning Framework

基于排放预测的时空碳响应:多智能体注意力增强深度学习框架

Feiyu Cai, Jing Qiu, Yi Yang, Chenxi Zhang, Xinlei Wang, Baichuan Liu, Junhua Zhao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对电力系统低碳调度延迟问题,提出多智能体注意力增强深度学习框架,可提前预测节点碳强度,在改进IEEE 33节点系统测试下减排超30%,推动主动碳管理。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26805 2026-07-30 cs.SE 新提交 80%

MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation

MRCoder:一种面向仓库级代码生成的高效上下文选择方法

Peiding Wang, Li Zhang, Fang Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。

Comments Under review in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 80%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25141 2026-07-29 cs.SE cs.LO cs.SY eess.SY 新提交 80%

Specification-Driven DevOps for Multi-Service Environments

多服务环境下基于规范驱动的DevOps

Oleg Grynets, Kyrylo Fursov, Vasyl Lyashkevych, Volodymyr Veres

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。

Comments 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21333 2026-07-24 cs.IR 新提交 80%

SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval

SHIFT:自我重建利用隐式细粒度思维进行检索

Yuxiao Luo, Da Li, Mingjie Zhang, Zhentao He, Shikun Zhang, Wei Ye

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10303 2026-07-22 cs.AR 版本更新 80%

DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration

DiffAxE:扩散驱动的硬件加速器生成与设计空间探索

Arkapravo Ghosh, Abhishek Moitra, Abhiroop Bhattacharjee, Ruokai Yin, Priyadarshini Panda

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对硬件加速器设计空间探索难题,传统方法有局限。本文提出生成方法,将硬件设计建模为基于目标性能的一维图像合成,能有效学习相关映射,在降低生成误差、提升性能及加速搜索等方面有显著贡献。

Comments Accepted at ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02690 2026-07-21 cs.IR 版本更新 80%

AnnoRetrieve: Efficient Structured Retrieval for Unstructured Document Analysis

AnnoRetrieve:面向无结构文档分析的高效结构化检索

Teng Lin, Yuyu Luo, Nan Tang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出AnnoRetrieve,通过结构化注释替代向量嵌入,实现高效精准的语义检索,降低LLM调用频率和成本,提升文档分析的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 80%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13196 2026-07-16 cs.SE 新提交 80%

From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality

从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响

Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 80%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 80%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08938 2026-07-13 cs.SE 新提交 80%

Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation

更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体

Chenyang Yang, Xinran Zhao, Tongshuang Wu, Christian Kästner

专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08529 2026-07-10 cs.IR 新提交 80%

Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis

Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化

Carlos Garcia-Hernandez, Aymane Abdali, Guangyu Wu, Mingxue Wang, Fei Shen, Zhaoyu Pang, Yanbin Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 80%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 80%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 80%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);language agent(abstract)

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 80%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19487 2026-07-08 cs.NI 版本更新 80%

Revisiting and Expanding the IPv6 Periphery: Global-Scale Measurement and Security Analysis

重新审视并扩展IPv6网络边缘:全球规模测量与安全分析

Zixuan Xie, Zitao Yang, Shurui Fang, Zhaoyang Li, Wenxing Xie, Nannan Fu, Liangyu Dong, Xiang Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文重新审视并扩展了IPv6网络边缘的研究,通过全球范围内的测量发现超过2.8亿个活跃的IPv6网络边缘,揭示了服务暴露和路由环等安全问题,并提出Hierarchical LLM Exposure Verification框架以识别未授权访问风险。

Comments 13 pages, 7 figures, 8 tables. Submitted to IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15657 2026-07-07 cs.AR 80%

Understanding Inference-Time Token Allocation and Coverage Limits in Agentic Hardware Verification

理解代理硬件验证中推理时间标记分配与覆盖限制

Vihaan Patel, Vidya Chhabria, Aman Arora

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了代理硬件验证中推理时间标记分配与覆盖限制,通过两个层级的代理框架,分析覆盖孔径并改进效率,展示领域专业化如何提升覆盖效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01607 2026-07-03 cs.AR 新提交 80%

MxGLUT: A Reconfigurable LUT-Centric Broadcast Dataflow Accelerator for Mixed-Precision GEMM

MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器

Weiyu Zhou, Chen Ding, Mingyuan Liu, Liangyu Gan, Yukun Feng, Hao Jia, Haoming Chu, Lirong Zheng, Ning Ma, Yuxiang Huan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00751 2026-07-02 cs.DB cs.CR 新提交 80%

SessionBound: Turning Enterprise Task Approval into Budgeted Database Sessions

SessionBound: 将企业任务审批转化为预算化的数据库会话

Minmin Wu

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SessionBound框架,将审批的企业任务转化为短期、预算化、可审计的数据库会话,通过控制平面和SessionBoundDB实现安全边界,无需LLM判断查询安全性。

Comments 7 pages, research prototype. Code: https://github.com/SessionBound/sessionbound

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 80%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14066 2026-07-01 cs.SE 新提交 80%

FastContext: Training Efficient Repository Explorer for Coding Agents

FastContext: 为编码智能体训练高效的仓库探索器

Shaoqiu Zhang, Maoquan Wang, Yuling Shi, Yuhang Wang, Xiaodong Gu, Yongqiang Yao, Tori Gong, Sheng Chen, Rao Fu, Anisha Agarwal, Spandan Grag, Gabriel Ryan, Colin Merkel, Yufan Huang, Shengyu Fu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 80%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 80%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 80%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏