arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2608.08037 2026-08-11 cs.AI 新提交 86%

SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution

SkillSmith:通过自动技能构建与演进增强本地部署智能体

Xinle Jiang, Remy Xie, Ming Tang

专题命中 效率与部署 :SLM(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillSmith是云端-本地智能体协作框架,通过自动构建和演进技能增强本地智能体,使搭载Qwen3.6-27B的本地智能体任务有效性接近云端智能体,在AppWorld上平均动作数从36.1降至9.9且可泛化至其他SLM。

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 86%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05063 2026-08-06 cs.CR cs.AI cs.AR 新提交 86%

Hardware Design and Security in the Era of Chiplets and LLMs

小芯片与大语言模型时代的硬件设计与安全

Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对小芯片与LLM时代的硬件安全问题,分析了小芯片系统及LLM驱动EDA流水线的各类攻击,提出基于2.5D拆分制造与主动中介层的防御方法,还探讨了LLM对硬件安全的推动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03487 2026-08-06 cs.DB cs.AI cs.IR 交叉投稿 86%

RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

RAG-Stack:协同优化RAG服务性能与质量

Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 RAG-Stack是可高效发现RAG质量-性能帕累托前沿的框架,其含三个核心组件,在相同优化迭代下,该框架发现的帕累托前沿覆盖的归一化质量-性能空间比最先进方法多52.5%-153.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新 86%

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02641 2026-08-05 cs.SE cs.AI 新提交 86%

IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

IR2Solve:面向成本高效优化自动建模的结构化中间表示

Penglin Zhu, Linhai Zhang, Jungang Xu, Xinchi Wei, Xiuqi Wu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IR2Solve以结构化中间表示为核心构建优化自动建模流水线,仅用1次LLM语义调用,在保证目标函数正确性的同时大幅降低推理成本,性能优于Chain-of-Experts和SAC-Opt等系统。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01847 2026-08-04 cs.AI 新提交 86%

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

FOCUS:通过耦合松弛与双粒度缩放实现FP4优化

Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 FOCUS是一种后训练量化框架,通过耦合松弛与双粒度缩放优化FP4,在不增加推理开销的情况下,于MXFP4和NVFP4格式下实现了LLM的最优FP4精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00924 2026-08-04 cs.SE cs.AI 新提交 86%

RefactorAssist: Agentic Refinement for Reliable Code Refactoring

RefactorAssist:用于可靠代码重构的智能体式优化工具

Jonathan Cordeiro, Shayan Noei, Ying Zou

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM生成代码重构的错误问题,开发了RefactorAssist智能体,通过静态修复结合测试引导的智能体修复,将重构累计通过率提升至94.2%,提高了LLM重构代码的可靠性。

Comments 27 pages, 10 figures, submitting to ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05698 2026-08-04 cs.AI 版本更新 86%

AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collection Scheduling in Multi-UAV-Assisted Pipeline Monitoring

AIC-VDS:面向多无人机辅助管道监测的联合速度控制与数据采集调度的基于注意力的上下文学习

Yousef Emami, Miguel Gutierrez Gaitan, Atefeh Hajijamali Arani, Jingjing Zheng, Hao Zhou

机构 * IEEE

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多无人机辅助管道监测中丢包率高的问题,提出AIC-VDS框架,通过注意力模块压缩输入后利用LLM生成调度与速度决策,可将平均提示长度降50%并稳定丢包率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28082 2026-07-31 cs.CL 新提交 86%

GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation

GGC:面向可靠Text-to-SPARQL生成的选择性查询修正

Ziyi Yang, Thanh-Son Nguyen, Tuan Anh Nguyen, Lihui Chen

机构 * Nanyang Technological University(南洋理工大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM生成Text-to-SPARQL查询不可靠的问题,提出GGC框架,通过选择性修正高风险查询,在MCQA数据集上提升准确率并降低推理开销。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17109 2026-07-30 cs.LG 版本更新 86%

SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval

SENSE:通过隐私保护的语义检索实现高效的EEG到文本

Akshaj Murhekar, Christina Liu, Abhijit Mishra, Shounak Roychowdhury, Jacek Gwizdka

机构 * School of Information, The University of Texas at Austin(信息学院,德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SENSE通过本地语义检索和提示语言生成,实现无需微调LLM的EEG到文本转换,提升效率并保护隐私。

Comments Accepted to ACM International Conference on Multimodal Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25995 2026-07-29 cs.CR cs.AI 新提交 86%

Does Runtime Topology Context Improve LLM-Generated Kubernetes Security Patches?

运行时拓扑上下文能否改进大语言模型生成的Kubernetes安全补丁?

Farooq Shaikh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 研究Kubernetes安全补丁问题,引入KuTIE利用实时集群上下文改进大语言模型生成补丁,通过在VulnCare平台试验,发现拓扑上下文可大幅提升拓扑相关补丁正确性,远超仅依赖扫描器上下文。

Comments Accepted at the Workshop on the Use of Large Language Models for Cybersecurity (LLMSec), co-located with ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23204 2026-07-28 cs.RO cs.CL cs.SD 新提交 86%

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

通过真实世界对话机器人中的上下文感知前言生成实现低延迟轮流发言

Yuki Okafuji, Koji Inoue, Yoshiki Ohira

机构 * CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于LLM的对话系统响应延迟问题,提出两阶段增量框架,通过意图准备检测器和VAP模型生成并确定传递前言回复时机,经现场实验评估三种情况,揭示了不同方式在延迟上的时间权衡。

Comments 5 pages, 4 figures. Accepted at ICMI LBR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 86%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13093 2026-07-24 cs.CR cs.AI 版本更新 86%

Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

大语言模型的高效且隐私感知的边缘云协作推理

Cheng Li, Jiexiong Liu, Yixuan Chen, Yi Li

机构 * KunlunMeta(昆仑元)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型推理难题,提出基于端点认证键值缓存的边缘云协作推理框架,本地端点与云端分工协作,经优化支持多种设备,评估显示该框架能降延迟和载荷,性能与全云端推理相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16202 2026-07-21 cs.AI 新提交 86%

Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment

通过小语言模型实现人工智能民主化:面向本地部署的结构化基准测试和参数高效微调

Daniel Cersosimo

机构 * Binghamton University(宾汉姆顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究在硬件和治理约束下人工智能民主化问题,通过对九个小语言模型在特定基准测试上控制评估,采用共享参数高效微调管道,得出有序工作流程让部分低于3B的模型可成为结构化小众工作负载本地专家的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19938 2026-07-15 cs.LG 版本更新 86%

A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs

用于稀疏专家混合模型LLM插拔式负载平衡的复制和量化策略

Zijie Liu, Jie Peng, Jinhao Duan, Zirui Liu, Kaixiong Zhou, Mingfu Liang, Luke Simon, Xi Liu, Zhaozhuo Xu, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Minnesota Twin Cities(明尼苏达大学双城分校) North Carolina State University(北卡罗来纳州立大学) Meta AI Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Replicate-and-Quantize策略,通过动态工作量重新平衡提升稀疏混合专家模型LLM的推理效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07984 2026-07-10 cs.AI 新提交 86%

Agentic Neural Architecture Search

智能体神经架构搜索

Seokhoon Jeong, Mijung Kim, Taehwan Kim

机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05933 2026-07-08 cs.PF cs.LG 新提交 86%

Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices

用于资源受限嵌入式设备上小型语言模型微调的节能GPU动态电压频率缩放

Jurn-Gyu Park, Sanzhar Zholdybayev, Aidar Amangeldi, Ademi Zhanuzakova

机构 * School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)

专题命中 效率与部署 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 研究资源受限嵌入式设备上SLM微调的节能问题,提出基于机器学习的模型选择方法来选GPU DVFS设置,在NVIDIA Jetson AGX Orin上实验,相比MAXN模式0平均节能13.11%,最高达26.73%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00019 2026-07-02 cs.CY cs.AI 新提交 86%

LLMs in the Real World: Evaluating "AI" in Emergency Contexts

现实世界中的LLM:评估紧急情境下的“AI”

Sara Court, Lara Downing, Micha Elsner

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文呼吁研究社区在向公众传达发现时发挥更大作用,通过LLM在紧急文本-911系统部署案例,识别常见误解并提出建议。

Comments Accepted to ACL Findings 2026 in San Diego

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18224 2026-07-02 cs.DC cs.LG 版本更新 86%

FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel

FSA:原生稀疏注意力核的一种替代高效实现

Ran Yan, Youhe Jiang, Zhuoming Chen, Haohui Mai, Beidi Chen, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对现有稀疏注意力核在GQA组中查询头数较少时效率低的问题,提出Flash Sparse Attention (FSA)核实现,通过优化循环顺序,在多种流行LLM上实现平均1.6倍核延迟降低和1.09倍端到端训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30626 2026-06-30 cs.AI 86%

DOPD: Dual On-policy Distillation

DOPD:双重在线策略蒸馏

Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan

机构 * NUS(新加坡国立大学) MMLab, CUHK(香港中文大学多媒体实验室) PKU(北京大学) Explore Academy, JD(京东探索研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DOPD方法,通过优势感知的双重蒸馏范式动态分配令牌级监督,缓解特权幻觉,在LLM和VLM上优于传统在线策略蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02982 2026-06-23 cs.PF cs.DC cs.LG 版本更新 86%

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

DriftSched: 多租户GPU推理中运行时令牌漂移下的自适应QoS感知调度

Kathiravan Palaniappan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DriftSched框架,通过运行时反馈驱动的漂移补偿和自适应偏差校正,解决多租户LLM推理中令牌漂移导致的调度问题,在NVIDIA L4 GPU上实现平均38.8%的估计误差降低和42%的中位延迟改善。

Comments 19 pages, 34 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29299 2026-06-23 cs.CV cs.AI 版本更新 86%

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

机构 * The University of Auckland, New Zealand(奥克兰大学) Shandong University, China(山东大学) The University of Melbourne, Australia(墨尔本大学)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17059 2026-06-17 cs.DC cs.AI 新提交 86%

Towards Distributed Inference of LLMs on a P2P Network

面向P2P网络的LLM分布式推理

Shabari S Nair, Krishanu Saini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出一种去中心化的前缀缓存感知路由方案,用于P2P网络中的LLM推理,通过本地基数树和异步反熵更新缓存信息,避免集中协调和KV缓存传输,在低延迟和偏斜前缀分布下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12737 2026-06-12 cs.CR cs.AI 新提交 86%

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

PI-Hunter:用于暴露和定位提示注入的自动化红队测试

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Michigan State University(密歇根州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09456 2026-06-09 cs.LG 新提交 86%

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

打破分词器壁垒:跨模型系列的在线策略蒸馏

Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出跨分词器在线策略蒸馏方法,通过精确的token映射算法使教师模型概率分布信号能跨不同分词器传播,显著提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05261 2026-06-09 cs.IR cs.LG 版本更新 86%

Improving User Experience with Personalized Review Ranking and Summarization

通过个性化评论排名和摘要提升用户体验

Muhammad Jawad Mufti, Omar Hammad, MD. Mahfuzur Rahman

机构 * Information and Computer Science Dept., King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油与矿物大学) Interdisciplinary Research Center for Intelligent Secure Systems (IRC-ISS), King Fahd University of Petroleum and Minerals(智能安全系统交叉研究中心(IRC-ISS),国王法赫德石油与矿物大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出融合用户偏好建模、混合情感估计、方面级评论匹配和LLM摘要的个性化评论排名与摘要框架,在亚马逊数据集和用户研究中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05868 2026-06-05 cs.CL 86%

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi:通过自适应GQA到MLA转换实现高并发金融大语言模型

PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

机构 * Postal Savings Bank of China & Huawei LLM Team(中国邮政储蓄银行及华为LLM团队) Postal Savings Bank of China(中国邮政储蓄银行) Huawei Technologies(华为技术)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出YouZhi-LLM,通过层自适应GQA-to-MLA转换框架和基于昇腾的训练流水线,显著压缩KV缓存并提升金融领域高并发推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05864 2026-06-05 cs.CL 86%

Analysis of the Neglect-Zero Effect in Large Language Models

大型语言模型中忽视零效应的分析

Jin Tanaka, Daiki Matsuoka, Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所) Tohoku University(东北大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 本研究通过结构启动范式,探究大型语言模型是否像人类一样存在忽视零效应,即忽略使命题因空集而空洞为真的零模型。

Comments 14 pages (10 pages main text), 8 figures. To appear in the Proceedings of the ACL2026 Student Research Workshop (SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏