arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2603.17223 2026-03-19 cs.DB cs.IR 85%

ListK: Semantic ORDER BY and LIMIT K with Listwise Prompting

ListK: 基于列表提示的语义ORDER BY和LIMIT K

Jason Shin, Jiwon Chang, Fatemeh Nargesian

专题命中 效率与部署 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ListK框架,通过结合列表wise排序算法优化语义ORDER BY和LIMIT K,显著降低延迟且不牺牲准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 85%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 85%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13110 2026-03-16 cs.OS 85%

AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems

AgentRM: 一种受操作系统启发的LLM代理系统资源管理器

Jianshu She

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AgentRM,通过多级反馈队列调度和三级上下文生命周期管理,解决LLM代理系统中的资源调度失败和上下文退化问题,显著提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11622 2026-03-13 cs.DB 85%

Sema: A High-performance System for LLM-based Semantic Query Processing

Sema: 一种高性能的基于大语言模型的语义查询处理系统

Kangkang Qi, Dongyang Xie, Wenbo Li, Hao Zhang, Yuanyuan Zhu, Jeffrey Xu Yu, Kangfei Zhao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Sema 是一种基于 DuckDB 构建的高性能语义查询引擎,通过 SemaSQL 实现自然语言表达与 SQL 的无缝集成,提升语义查询的性能和结果质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22676 2026-03-13 cs.SE 85%

VarParser: Unleashing the Neglected Power of Variables for LLM-based Log Parsing

VarParser: 解锁变量在基于大语言模型的日志解析中的被忽视的力量

Jinrui Sun, Tong Jia, Minghua He, Ying Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 VarParser通过变量中心策略提升日志解析效率,减少LLM调用成本,保留变量信息增强结果完整性。

Comments Published as a conference paper in WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00783 2026-03-13 cs.RO cs.SY eess.SY 85%

When Semantics Connect the Swarm: LLM-Driven Fuzzy Control for Cooperative Multi-Robot Underwater Coverage

当语义连接群体:由LLM驱动的模糊控制用于协作多机器人水下覆盖

Jingzehua Xu, Weihang Zhang, Yangyang Li, Hongmiaoyi Zhang, Guanwen Xie, Jiwei Tang, Shuai Zhang, Yi Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种由LLM驱动的模糊控制框架,用于实现多机器人水下协作覆盖,通过语义引导实现高效导航和探索。

Comments Withdrawal for further improvement. The final version will be released in a few months

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17072 2026-03-13 cs.AR 85%

SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design

SnipSnap:一种联合压缩格式和数据流协同优化框架,用于高效稀疏大语言模型加速器设计

Junyi Wu, Chao Fang, Zhongfeng Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SnipSnap通过联合优化压缩格式和数据流,显著提升稀疏LLM加速器的效率,实现内存能耗降低和速度提升。

Comments To appear in the 31st Asia and South Pacific Design Automation Conference (ASP-DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10587 2026-03-12 cs.SD 85%

Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing

将LLM语义先验 distilling 到仅编码器的多说话人ASR中 with 谈者计数路由

Hao Shi, Yusuke Fujita, Roman Koshkin, Mengjie Zhao, Yuan Gao, Lianbo Liu, Yui Sudo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种仅编码器的多说话人ASR模型,通过distilling LLM语义先验并引入Talker-Count Head,实现了在三说话人条件下显著提升的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10353 2026-03-12 cs.DC 85%

S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance

S-HPLB: 通过稀疏性感知的头部并行负载平衡实现高效的LLM注意力服务

Di Liu, Yifei Liu, Chen Chen, Zhibin Yu, Xiaoyi Fan, Quan Chen, Minyi Guo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 S-HPLB通过稀疏性感知的头部并行负载平衡策略,有效提升了LLM服务中注意力计算的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09216 2026-03-11 cs.DC 85%

PIM-SHERPA: Software Method for On-device LLM Inference by Resolving PIM Memory Attribute and Layout Inconsistencies

PIM-SHERPA:一种通过解决PIM内存属性和布局不一致性的软件方法实现设备端LLM推理

Sunjung Lee, Sanghoon Cha, Hyeonsu Kim, Seungwoo Seo, Yuhwan Ro, Sukhan Lee, Byeongho Kim, Yongjun Park, Kyomin Sohn, Seungwon Lee, Jaehoon Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PIM-SHERPA通过解决PIM内存属性和布局不一致问题,实现了设备端LLM推理的高效性能和内存节省。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 85%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08745 2026-03-11 cs.AR cs.MA cs.PF 85%

ChatNeuroSim: An LLM Agent Framework for Automated Compute-in-Memory Accelerator Deployment and Optimization

ChatNeuroSim:一种用于自动计算在内存加速器部署和优化的LLM代理框架

Ming-Yen Lee, Shimeng Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ChatNeuroSim是一种基于LLM的代理框架,用于自动部署和优化计算在内存加速器,通过设计空间修剪技术提升优化效率。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08739 2026-03-11 cs.AR cs.DC 85%

Adaptive Multi-Objective Tiered Storage Configuration for KV Cache in LLM Service

自适应多目标分层存储配置用于LLM服务中的KV缓存

Xianzhe Zheng, Zhengheng Wang, Ruiyan Ma, Rui Wang, Xiyu Wang, Rui Chen, Peng Zhang, Sicheng Pan, Zhangheng Huang, Chenxin Wu, Yi Zhang, Bo Cai, Kan Liu, Teng Ma, Yin Du, Dong Deng, Sai Wu, Guoyun Zhu, Wei Zhang, Feifei Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Kareto通过自适应资源管理优化LLM服务中的KV缓存配置,提升吞吐量、降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13223 2026-03-11 cs.DC 85%

BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure

BanaServe:统一的KV缓存和动态模块迁移以平衡AI基础设施中的解耦LLM服务

Yiyuan He, Minxian Xu, Jingfeng Wu, Jianmin Hu, Chong Ma, Min Shen, Le Chen, Chengzhong Xu, Lin Qu, Kejiang Ye

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 BanaServe通过统一的KV缓存和动态模块迁移,平衡解耦LLM服务中的计算与内存资源,提升吞吐量和效率。

Comments 23 pages

Journal ref Software: Practice and Experience 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07887 2026-03-10 cs.LG cs.AI cs.CL math.ST stat.ML stat.TH 85%

Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference

拒绝、重采样、重复:理解语言模型推理中的并行推理

Noah Golowich, Fan Chen, Dhruv Rohatgi, Raghav Singhal, Carles Domingo-Enrich, Dylan J. Foster, Akshay Krishnamurthy

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07810 2026-03-10 eess.SY cs.SY 85%

Temperature-Aware Scheduling of LLM Inference in Large-Scale Geo-Distributed Edge Data Centers with Distributed Optimization

具有分布式优化的温度感知LLM推理调度在大规模地理分布边缘数据中心中的应用

Arash Khalatbarisoltani, Amin Mahmoudi, Jie Han, Muhammad Saeed, Wenxue Liu, Jinwen Li, Solmaz Kahourzade, Amirmehdi Yazdani, Xiaosong Hu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出一种温度感知方法,通过分布式优化共同优化LLM的能耗、碳排放、首次令牌时间和水资源消耗,以提升地理分布边缘数据中心的可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20982 2026-03-10 cs.DC 85%

DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving

DOPD:一种动态PD解聚架构,用于在LLM推理服务中最大化吞吐量

Junhan Liao, Minxian Xu, Wanyi Zheng, Yan Wang, Kejiang Ye, Rajkumar Buyya, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DOPD通过动态调整预填和解码实例比例,提升LLM推理服务的吞吐量和响应效率。

Comments 14 pages

Journal ref IEEE Transactions on Services Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13109 2026-03-10 cs.LG cs.AI cs.CL 85%

FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference

FreeKV: 提升KV缓存检索效率以实现高效的LLM推理

Guangda Liu, Chengwei Li, Zhenyu Ning, Jing Lin, Yiwu Yao, Danning Ke, Minyi Guo, Jieru Zhao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FreeKV通过算法与系统协同优化,提升KV缓存检索效率并保持精度,实现高达13倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05286 2026-03-10 cs.DB 85%

HEXGEN-FLOW: Optimizing LLM Inference Request Scheduling for Agentic Text-to-SQL

HEXGEN-FLOW: 优化基于代理的大型语言模型推理请求调度以实现智能文本到SQL

You Peng, Youhe Jiang, Wenqi Jiang, Chen Wang, Binhang Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HEXGEN-FLOW通过优化调度策略和参数调整,显著提升了基于代理的LLM文本到SQL系统在异构GPU集群中的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05189 2026-03-06 cs.CY 85%

Small Changes, Big Impact: Demographic Bias in LLM-Based Hiring Through Subtle Sociocultural Markers in Anonymised Resumes

微小变化,巨大影响:通过匿名简历中的微妙社会文化标记探讨基于LLM的招聘中的人口统计偏差

Bryan Chen Zhengyu Tan, Shaun Khoo, Bich Ngoc Doan, Zhengyuan Liu, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过匿名简历中的社会文化标记揭示LLM在招聘中的人口统计偏差,发现模型能通过非显性特征推断种族和性别,且提示解释会加剧偏见。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04797 2026-03-06 cs.AR 85%

Hardware-Software Co-design for 3D-DRAM-based LLM Serving Accelerator

面向3D-DRAM的LLM服务加速器的软硬件协同设计

Cong Li, Yihan Yin, Chenhao Xue, Zhao Wang, Fujun Bai, Yixin Guo, Xiping Jiang, Qiang Wu, Yuan Xie, Guangyu Sun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Helios通过软硬件协同设计,优化LLM服务加速器的动态KV缓存管理和分布式内存抽象,实现3.25倍加速和3.36倍能效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03060 2026-03-04 eess.IV eess.AS 85%

DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming

DLIOS:一种增强现实时间多模态交互增强叠加系统的大型语言模型增强系统,用于抖音直播

Shuide Wen, Sungil Seok, Beier Ku, Richee Li, Yubin He, Bowen Qu, Yang Yang, Ping Su, Can Jiao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DLIOS通过LLM增强实时多模态交互增强系统,实现抖音直播中的弹幕、礼物效果和TTS广播的高效处理与优化。

Comments 14 pages, 13 figures, 6 tables, 7 algorithms, 16 references, submitted to ACM/IEEE International Conference on Systems and Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21626 2026-03-04 cs.DC 85%

Multi-Layer Scheduling for MoE-Based LLM Reasoning

多层调度用于基于MoE的LLM推理

Yifan Sun, Gholamreza Haffari, Minxian Xu, Rajkumar Buyya, Adel N. Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出多层调度框架,针对基于MoE的LLM推理优化,通过请求、引擎和专家层面调度策略,提升吞吐量和效率,实验表明在TTFT和TPOT延迟上分别减少17.8%和13.3%。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02057 2026-03-03 cs.DC 85%

Beyond Microservices: Testing Web-Scale RCA Methods on GPU-Driven LLM Workloads

超越微服务:在GPU驱动的LLM工作负载上测试Web级RCA方法

Dominik Scheinert, Alexander Acker, Thorsten Wittkopp, Soeren Becker, Hamza Yous, Karnakar Reddy, Ibrahim Farhat, Hakim Hacid, Odej Kao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了RCA方法在GPU驱动LLM工作负载上的有效性,发现多源方法表现最佳,而基于追踪的方法大多失效,推动了定制分析技术和增强可观测性的需求。

Comments 13 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01477 2026-03-03 cs.RO 85%

SFCo-Nav: Efficient Zero-Shot Visual Language Navigation via Collaboration of Slow LLM and Fast Attributed Graph Alignment

SFCo-Nav: 通过慢LLM与快速属性图对齐的协作实现高效的零样本视觉语言导航

Chaoran Xiong, Litao Wei, Xinhao Hu, Kehui Ma, Ziyi Xia, Zixin Jiang, Zhen Sun, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与位置基于服务重点实验室,上海交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SFCo-Nav通过慢LLM与快速属性图对齐的协作,实现了高效的零样本视觉语言导航,显著提升效率并降低计算成本。

Comments Accepted by 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18931 2026-02-24 cs.DC 85%

WANSpec: Leveraging Global Compute Capacity for LLM Inference

WANSpec: 利用全球计算能力进行大语言模型推理

Noah Martin, Fahad Dogar

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WANSpec通过将LLM生成任务转移到未充分利用的数据中心,利用本地计算资源缓解容量问题并减少高需求数据中心的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16660 2026-02-19 cs.CL cs.AI cs.LG 85%

Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment

一次对齐,多语言受益:为LLM安全对齐强制多语言一致性

Yuyan Bu, Xiaohao Liu, ZhaoXing Ren, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) National University of Singapore(新加坡国立大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种资源高效的多语言一致性对齐方法,通过多语言一致性损失实现多语言同时对齐,提升跨语言安全性和泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16100 2026-02-19 cs.DC 85%

LLM-Driven Intent-Based Privacy-Aware Orchestration Across the Cloud-Edge Continuum

基于大语言模型的意图驱动的隐私意识云-边连续体协同

Zijie Su, Muhammed Tawfiqul Islam, Mohammad Goudarzi, Adel N. Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种动态管道重新配置方法,用于在云-边连续体上实现意图驱动的隐私意识协同,通过减少服务停机时间和性能损失来优化LLM推理效率。

Journal ref 24th Australasian Symposium on Parallel and Distributed Computing (AusPDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14214 2026-02-17 cs.CV 85%

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

HiVid: 基于大语言模型的视频显著性识别用于内容感知点播与直播

Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

机构 * Tsinghua University(清华大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HiVid利用大语言模型生成内容感知的视频显著性权重,提升点播和直播的QoE性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏