arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2608.14561 2026-08-18 cs.DC cs.OS cs.PF 新提交 80%

A Biophysically-Inspired Feedback Controller for Multi-Class Cache Fairness

受生物物理启发的多类缓存公平性反馈控制器

Matt R. Flax

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 80%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 80%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11820 2026-08-13 cs.CV 新提交 80%

TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖

Shuangqing Zhang, Lei-Lei Ma, Zhao Wang, Wen Dong, Xinyi Xu, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10139 2026-08-12 cs.DB 新提交 80%

AI Query Compilation for Unified and Optimized Execution

用于统一且优化执行的AI查询编译

Yeounoh Chung, Helena Caminal, Fatma Ozcan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究提出统一编译执行架构范式,将SQL与LLM整合为张量计算图消除PCIe瓶颈,在SemBench数据集的TPU实验获最高5.3倍延迟、9.8倍吞吐量加速,还给出相关研究路线图。

Comments Proceedings of the VLDB Endowment, Vol. 14, No. 1 ISSN 2150-8097

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08352 2026-08-11 cs.PL 新提交 80%

SimP: Unifying Syntax- and Semantic-Guided Techniques for Efficient Program Reduction

SimP:统一语法与语义引导技术的高效程序缩减方法

Ye Xiong, Xiangyu Gao, Qiaochu Chen, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 SimP框架结合传统与LLM式缩减技术,兼顾缩减效率与质量,且LLM成本可忽略,解决编译器漏洞调试中测试程序过大的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06677 2026-08-10 cs.DB 新提交 80%

From Interpretation to Compilation: A Compilation-Based Execution Engine for Semantic Operator Systems

从解释到编译:面向语义算子系统的基于编译的执行引擎

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02909 2026-08-05 econ.EM stat.ML 新提交 80%

When Predictions Become Regressors: A Split-Sample Correction for Biases in Downstream Inference

当预测成为回归元:针对下游推断偏差的拆分样本校正方法

Nathan Canen, Ted Enamorado

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对预测生成测度用作回归元的偏差问题,提出基于独立拆分样本构建工具变量的校正方法,经模拟及两个实证案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03223 2026-08-05 cs.LG cs.AI cs.CL 新提交 80%

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

具有自提炼奖励塑造的智能体强化学习

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。

Comments 17 pages,10 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03065 2026-08-05 cs.SE 新提交 80%

Efficient Grammar-Constrained Decoding via Parser Stack Classification

基于解析器栈分类的高效语法约束解码

Yongmin Li, Yihong Dong, Jia Li, Ge Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出PSC方法,通过解析器栈分类实现高效语法约束解码,其计算掩码速度远快于基线,可提升LLM的端到端吞吐量。

Comments accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 80%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 80%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29069 2026-08-03 cs.DC 新提交 80%

Rethinking AI Cloud Infrastructure for Agentic Serving Systems with the Aries Experimentation Framework

基于Aries实验框架重新思考智能体服务系统的AI云基础设施

Leonid Kondrashov, Hongrui Liu, JooYoung Park, Boxi Zhou, Zonghao Liu, Chengzhi Lu, Riccardo Mancini, Esha Choukse, Haris Javaid, German Sviridov, Tao Peng, Chen Zhao, Anastasia Avdeeva, Aleksei Gusev, Marios Kogias, Luo Mai, Dmitrii Ustiugov

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26805 2026-07-30 cs.SE 新提交 80%

MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation

MRCoder:一种面向仓库级代码生成的高效上下文选择方法

Peiding Wang, Li Zhang, Fang Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。

Comments Under review in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 80%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25141 2026-07-29 cs.SE cs.LO cs.SY eess.SY 新提交 80%

Specification-Driven DevOps for Multi-Service Environments

多服务环境下基于规范驱动的DevOps

Oleg Grynets, Kyrylo Fursov, Vasyl Lyashkevych, Volodymyr Veres

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。

Comments 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21333 2026-07-24 cs.IR 新提交 80%

SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval

SHIFT:自我重建利用隐式细粒度思维进行检索

Yuxiao Luo, Da Li, Mingjie Zhang, Zhentao He, Shikun Zhang, Wei Ye

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 80%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13196 2026-07-16 cs.SE 新提交 80%

From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality

从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响

Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 80%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08938 2026-07-13 cs.SE 新提交 80%

Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation

更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体

Chenyang Yang, Xinran Zhao, Tongshuang Wu, Christian Kästner

专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08529 2026-07-10 cs.IR 新提交 80%

Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis

Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化

Carlos Garcia-Hernandez, Aymane Abdali, Guangyu Wu, Mingxue Wang, Fei Shen, Zhaoyu Pang, Yanbin Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 80%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01607 2026-07-03 cs.AR 新提交 80%

MxGLUT: A Reconfigurable LUT-Centric Broadcast Dataflow Accelerator for Mixed-Precision GEMM

MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器

Weiyu Zhou, Chen Ding, Mingyuan Liu, Liangyu Gan, Yukun Feng, Hao Jia, Haoming Chu, Lirong Zheng, Ning Ma, Yuxiang Huan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00751 2026-07-02 cs.DB cs.CR 新提交 80%

SessionBound: Turning Enterprise Task Approval into Budgeted Database Sessions

SessionBound: 将企业任务审批转化为预算化的数据库会话

Minmin Wu

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SessionBound框架,将审批的企业任务转化为短期、预算化、可审计的数据库会话,通过控制平面和SessionBoundDB实现安全边界,无需LLM判断查询安全性。

Comments 7 pages, research prototype. Code: https://github.com/SessionBound/sessionbound

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 80%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14066 2026-07-01 cs.SE 新提交 80%

FastContext: Training Efficient Repository Explorer for Coding Agents

FastContext: 为编码智能体训练高效的仓库探索器

Shaoqiu Zhang, Maoquan Wang, Yuling Shi, Yuhang Wang, Xiaodong Gu, Yongqiang Yao, Tori Gong, Sheng Chen, Rao Fu, Anisha Agarwal, Spandan Grag, Gabriel Ryan, Colin Merkel, Yufan Huang, Shengyu Fu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 80%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24549 2026-06-24 cs.CR 新提交 80%

FirmCure:Towards Autonomous and Adaptive Rehosting of Linux-Based Firmware

FirmCure:面向基于Linux固件的自主自适应重托管

Chuan Hong, Zheng Zhang, Lei Zhou, Laisong Li, Chenyifan Liu, Ze Huang, Xu Zhou, Peihong Lin

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出首个LLM驱动的全系统重托管框架FirmCure,通过自适应感知推理、反射合成和自主运行时干预,在10个厂商21个固件上实现100%端口开放率和90.5%服务交互性,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23255 2026-06-23 cs.NI 新提交 80%

Wireless Personal Agent: Extending Wireless Intelligence from Networks to Terminals

无线个人代理:将无线智能从网络扩展到终端

Jiedan Tan, Fang Liu, Jingwen Tong, Shengli Zhang, Jun Zhang, Wing Shing Wong

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WISPA框架,利用基于大语言模型的智能体实现终端侧资源自动化管理,通过解耦在线执行与离线反思克服终端资源限制,在校园通勤场景中验证了其学习用户偏好并自适应接入决策的能力。

Comments 7 pages, 5 figures, submit to a possible journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏