arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2606.21913 2026-06-23 cs.CV cs.AI 新提交 79%

Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation

重新思考视觉基础模型在高效细胞分割中的适应

Qing Xu, Xiangjian He, Wenting Duan, Jiebo Luo, Zhen Chen

机构 * School of Computer Science, University of Nottingham, UK(英国诺丁汉大学计算机科学学院) School of Computer Science, University of Nottingham Ningbo China, China(中国宁波诺丁汉大学计算机科学学院) School of Engineering and Physical Science, University of Lincoln, UK(英国林肯大学工程与物理科学学院) Department of Computer Science, University of Rochester, USA(美国罗切斯特大学计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出EffiCell-Seg框架,利用冻结的视觉基础模型中的全局显著性和局部形态先验,通过细胞结构提示编码器和协同掩码解码器实现高效细胞分割,仅需约5M可训练参数。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21212 2026-06-23 cs.LG 新提交 79%

DCD-PFN: A Decoupling-Aware Foundation Model for Causal Discovery

DCD-PFN:一种面向因果发现的解耦感知基础模型

Zhengkang Guan, Yikang Chen, Yi He, Yunze Tong, Zijing Hu, Haoyuan Qian, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出DCD-PFN基础模型,通过预训练学习样本级解耦权重实现马尔可夫边界识别,并利用并行局部发现高效重构全局因果图,在零样本泛化中表现鲁棒。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20852 2026-06-23 cs.CV cs.AI 新提交 79%

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) Stanford University School of Medicine(斯坦福大学医学院) DASA University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) Eden

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15611 2026-06-16 cs.CV cs.AI 新提交 79%

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation

双基础模型的相互蒸馏用于半监督PET/CT分割

Fuyou Mao, Beining Wu, Yanfeng Jiang, Bohan Xu, Lixin Lin, Naye Ji, Hao Zhang, Yan Tang

机构 * Central South University(中南大学) Hangzhou Dianzi University(杭州电子科技大学) Communication University of Zhejiang(浙江传媒学院) Northeastern University(东北大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出MuDuo框架,利用SAM-Med3D和SegAnyPET分别从CT和PET中蒸馏知识到轻量学生网络,实现半监督器官分割,仅用5个标注样本在AutoPET数据集上达到最优性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11836 2026-06-12 cs.SD cs.AI eess.AS 新提交 79%

Towards Data-free and Training-free Compression for Speech Foundation Models Using Parameter Clustering

面向语音基础模型的无数据无训练压缩:基于参数聚类的方法

Haoning Xu, Zhaoqing Li, Huimeng Wang, Youjun Chen, Chengxi Deng, Mengzhe Geng, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出一种基于k-means通道聚类的无数据无训练压缩方法,通过层间不同参数簇数实现细粒度混合稀疏剪枝,在HuBERT-large和Whisper-large-v3上显著降低WER。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12412 2026-06-11 cs.CV cs.AI 新提交 79%

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

重新路由,而非移除:面向视觉语言模型的可恢复视觉令牌路由

Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型中视觉令牌重要性随解码器深度变化的问题,提出无需训练的可恢复路由方法Reroute,将不可逆移除改为可恢复路由,在激进令牌缩减下提升定位能力并保持通用VQA性能。

Comments Code: https://github.com/elmma/mllm-reroute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11916 2026-06-11 cs.SE cs.AI 新提交 79%

Characterizing Software Aging in GPU-Based LLM Serving Systems

基于GPU的大语言模型服务系统中的软件老化特征分析

Domenico Cotroneo, Bojan Cukic

机构 * College of Computing and Informatics, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校计算机与信息学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 提出一种实证方法研究GPU大语言模型服务系统中的软件老化,通过216小时实验发现所有部署均存在显著内存老化,泄漏率与运行时和配置强相关,并提供了可复现框架。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10431 2026-06-10 cs.CV cs.AI 新提交 79%

Vision-Assisted Foundation Model for Solving Multi-Task Vehicle Routing Problems

视觉辅助的基础模型解决多任务车辆路径问题

Shuangchun Gui, Zhiguang Cao, Wen Song, Yew-Soon Ong

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Institute of Marine Science and Technology, Shandong University(山东大学海洋科学与技术研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所前沿人工智能研究中心)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出视觉辅助基础模型VaFM,通过将约束编码为图像并融合图节点嵌入,同时解决16种VRP变体,在复杂约束变体上超越现有方法。

Comments Accepted by TNNLS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07660 2026-06-09 cs.CV cs.LG 新提交 79%

Need We Teach Foundation Models What is a Generative Image? Gradient-Free Generative Artifact Detection via Analytic Spectral Adaptation

我们是否需要教基础模型什么是生成图像?基于解析谱自适应的无梯度生成伪影检测

Qiaoyu Chen, Bing Zhang

机构 * Harbin University of Commerce(哈尔滨商业大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出无梯度方法,将生成伪影检测重构为分布外异常度量问题,通过解析解耦统计与语义偏差,在零样本设置下显著优于梯度优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24696 2026-08-26 cs.LG cs.AI 新提交 79%

On-policy Distillation with Verifiable Reward

结合可验证奖励的在线蒸馏

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学LeapLab) Beihang University(北京航空航天大学) SMS, Peking University(北京大学SMS) NLPLab, Tsinghua University(清华大学NLPLab)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14385 2026-08-17 cs.LG cs.AI 新提交 79%

DeaMoE: Efficient MoE Structure for Fast Small-Batch Decoding

DeaMoE:用于快速小批量解码的高效MoE结构

Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Shanxi University(山西大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对小批量解码下MoE模型专家权重加载的瓶颈,提出DeaMoE架构,通过专家分组共享参数与两阶段路由策略提升效率,在多款模型及显卡上实现显著速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13966 2026-08-17 cs.LG cs.CL stat.ML 新提交 79%

QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction

QUASAR:通过损失感知重构降低量化感知训练的损失下限

Vincent Counathe, Ben Athiwaratkun, Christopher De Sa, Tianyi Zhang

机构 * Together AI Cornell University(康奈尔大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 QUASAR是一种QAT方法,通过训练循环中轻量级损失感知重构降低大语言模型量化损失下限,在2-4比特下优于现有方法,提升了低比特模型准确率。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 79%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07508 2026-08-11 cs.HC cs.AI cs.CL 新提交 79%

JaleesBench: Are AI Assistants Good Spiritual Company?

JaleesBench:AI助手能否成为良好的精神陪伴?

M. Waleed Kadous, Benjamin Olsen

机构 * Faith Family Technology Network

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。

Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06752 2026-08-10 cs.AI cs.CL 新提交 79%

Mind the Gap: A Dual Knowledge Graph Framework for Unified Multi-task User Intent Inference

弥合差距:用于统一多任务用户意图推理的双知识图谱框架

Tzu-Cheng Peng, Chien Chin Chen, Chih-Hao Ku, Yung-Chun Chang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对在线旅游评论的多任务用户意图推理,提出DKG-MTI双知识图谱框架,结合动态构建的用户特定意图知识图谱与全局酒店知识图谱,经大语言模型处理后,在相关任务上优于现有基线。

Comments Published in the PACIS 2026 Proceedings as a Completed Research Paper. AIS eLibrary: https://aisel.aisnet.org/pacis2026/ai_ml/ai_ml/12/ 17 pages, 5 figures

Journal ref Proceedings of the Pacific Asia Conference on Information Systems (PACIS 2026), Paper 12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01918 2026-08-04 cs.LG cs.CL 新提交 79%

HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

HarnessCompass:引导自动 harness 进化以生成可泛化且有效的智能体 harness

Luan Zhang, Ruochen Zhou, Dandan Song, Zhengyu Chen, Yuhang Tian, Jun Yang, Huipeng Ma, Chenhao Li, Guangyuan Feng, Xudong Li, Yizhou Jin, Yan Xu

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 HarnessCompass 是一种自动 harness 进化框架,通过约束进化、主动反馈和组件式优化,在 SWE-bench Verified 上用 GPT-5.4 使 Pass@1 提升至 66%,且泛化能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27248 2026-07-31 cs.AI cs.LG 新提交 79%

Divergence Decoding: Training-Free Capability Fusion

分歧解码:无训练的能力融合

Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

机构 * Peking University(北京大学) International Digital Economy Academy (IDEA)(国际数字经济学院) The University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交 79%

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24953 2026-07-29 cs.LG cs.AI 新提交 79%

Stable FP4 Training via Transposition-Invariant Block Quantization

通过转置不变块量化实现稳定的FP4训练

Mehdi Rahimifar, Amin Darabi, Mehran Taghian Jazi, Xing Huang, Yao Wang, Zhijun Tu, Yufei Cui, Yunke Peng, Hongliang Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决大语言模型训练从FP8降至FP4时的不稳定性问题,提出基于2D块FP4量化的低精度训练框架,结合多种策略控制量化误差,在多个模型上评估,实现稳定的端到端FP4训练,性能与BF16相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12747 2026-07-15 cs.AI cs.CL 新提交 79%

Tracing Agentic Failure from the Flow of Success

从成功流中追溯智能体失败

Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交 79%

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08662 2026-07-10 cs.CL cs.AI cs.MA 新提交 79%

WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search

WebSwarm:用于深度和广度网络搜索的递归多智能体编排

Xiaoshuai Song, Liancheng Zhang, Kangzhi Zhao, Yutao Zhu, Zhongyuan Wang, Guanting Dong, Jinghan Yang, Han Li, Kun Gai, Ji-Rong Wen, Zhicheng Dou

机构 * Kuaishou(快手)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的网络搜索任务,提出WebSwarm递归多智能体编排框架,在推理时联合构建任务分解等,动态实例化搜索节点,通过实验证明其在深度、广度等任务上优于基线,分析多种因素解释其有效性并为多智能体搜索提供见解。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23406 2026-06-23 cs.LG cs.AI 新提交 79%

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant: 面向大型语言和扩散模型的率失真最优量化流水线

Yuval Domb, Hadar Sackstein, Tomer Solberg

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出HyperQuant统一后训练量化流水线,通过随机Hadamard变换、最优格量化、无损比特剥离和近熵最优Rice编码,在权重和KV缓存上实现率失真最优,优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17383 2026-06-17 q-fin.RM cs.AI cs.LG stat.ML 新提交 79%

Model Validation of Agentic AI Systems: A POMDP-Based Framework for Belief-State, Forecast, and Policy Validation

智能体AI系统的模型验证:基于POMDP的信念状态、预测与策略验证框架

Matthew Francis Dixon

机构 * Quiota LLC(Quiota公司)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于部分可观测马尔可夫决策过程(POMDP)的智能体AI模型验证框架,将自主决策分解为信息、信念、预测、动作和效用组件独立验证,并通过投资组合管理案例展示其有效性。

Comments 28 pages, 3 figures, 6 tables. Source code available from https://github.com/mfrdixon/agentic-AI-as-POMDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17952 2026-06-17 cs.LG cs.AI 新提交 79%

SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs

SoftMoE: 用于大语言模型混合专家网络的软可微路由

Mikołaj Zasada, Łukasz Struski, Jacek Tabor, Marcin Kurdziel

机构 * AGH University of Krakow, Poland(克拉科夫AGH大学) Faculty of Mathematics(数学系) Computer Science, Jagiellonian University, Poland(计算机科学系,杰哥利安大学,波兰) Centre for Credible Artificial Intelligence, Warsaw University of Technology(可信人工智能中心,华沙技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SoftMoE,通过软top-k LapSum松弛替代离散路由,实现专家路由的梯度优化,并学习每层专家激活数量,在语言建模中激活更少专家达到相当或更优性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10385 2026-06-10 cs.LG cs.AI 新提交 79%

Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation

超越绝对模仿:基于锚定残差引导的特权在线蒸馏

Wenhao Zhang

机构 * South China University of Technology(华南理工大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出锚定残差在线蒸馏(AR-OPD),通过部分特权教师建立局部兼容锚点并注入受控残差,解决特权在线蒸馏中后见偏差导致的局部不可达问题,在推理任务上平均提升2.3个点。

Comments 17 pages, 8 figures. Project page: https://vanhowe.github.io/AR-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08382 2026-06-09 cs.LG cs.AI 新提交 79%

STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

STAR-KV:通过软阈值实现自适应秩控制的低秩KV缓存压缩

Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang, SeungJae Lee, Jungwook Choi, Mingu Kang

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出STAR-KV框架,通过可微阈值机制实现注意力头和块级别的自适应秩选择,结合混合分解和低秩感知混合精度量化,在多种LLM上达到75%的KV缓存压缩,结合量化可减少20倍,并实现6.9倍注意力模块加速和3.1倍端到端生成吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07923 2026-06-09 cs.DB cs.AI cs.LG 新提交 79%

Larch: Learned Query Optimization for Semantic Predicates

Larch: 面向语义谓词的学习型查询优化

Fuheng Zhao, Pawel Liskowski, Zihan Li, Benjamin Han, Puxuan Yu, Varich Boonsanong, Dimitris Tsirogiannis, Anupam Datta

机构 * Snowflake Inc.(Snowflake公司)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Larch框架,利用嵌入增强的图神经网络和强化学习或监督学习优化AI SQL查询中语义过滤器的执行顺序,显著降低令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07525 2026-06-09 cs.CL cs.AI 新提交 79%

Implicit Causal Graph Construction in Text via Chain Discovery

通过链发现实现文本中的隐式因果图构建

Liesbeth Allein, Marie-Francine Moens

机构 * KU Leuven(鲁汶大学) Ghent University(根特大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型从文本因果对中推断中间事件以构建隐式因果图,比较端到端构建与因果链发现方法,并探索多模型集成策略,基于1560个科学验证因果对评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01311 2026-08-04 cs.CL 新提交 78%

RH-RAG: Trustworthy Long-Form Generation for Privacy-Constrained Settings

RH-RAG:适用于隐私受限场景的可信长文本生成

Raj Shekhar Singh

机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。

Comments accepted in KDD 2026 SeT-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏