arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 345 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2601.04426 2026-08-06 cs.AI 版本更新 86%

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 86%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 86%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 效率与部署 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04169 2026-08-06 cs.AR cs.ET 新提交 86%

On Design Principles for Efficient Heterogeneous DRAM-PIM-GPU Systems

高效异构DRAM-PIM-GPU系统的设计原则

Corey Lammie, Hadjer Benmeziane, William Andrew Simon, Irem Boybat

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对异构DRAM-PIM-GPU系统,通过系统评估OPT、Mamba2系列模型,揭示了三项设计原则,为内存加速LLM系统架构设计提供了指导。

Comments Accepted at 2026 IEEE International System-on-Chip Conference (SOCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23200 2026-08-06 cs.CE 版本更新 86%

Large Language Models, Encoder Architectures and Hybrid Approaches for Patent Classification

大型语言模型在专利分类中的应用:优势、权衡与长尾效应

Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 本文比较了基于编码器和LLMs在专利分类中的表现,发现编码器在常见类别表现更好,而LLMs在罕见类别表现更优,两者互补,且编码器更高效。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 84%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23933 2026-08-06 cs.DC cs.AI cs.LG cs.PF 版本更新 81%

SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

SpecBox:用于高效大语言模型智能体服务的推测性沙盒调度

Yihui Zhang, Tianyu Wo, Jinghao Wang, Xiaoyang Sun, Menghao Zhang, Cangzhou Yuan, Li Li, Chunming Hu, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体服务中沙盒部署的资源利用与延迟矛盾,提出SpecBox,通过推测性沙盒预分配、上下文感知随机预取及相关优化,有效降低端到端延迟并削减峰值内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05104 2026-08-06 cs.LG 新提交 79%

BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning

BnBERT-iPET:基于彩票剪枝的孟加拉语稀疏少样本语言建模

Sajib Hossain, Md Kamrus Samad, Anan Ghosh, Labib Imam Chowdhury, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出BnBERT-iPET,一种基于彩票剪枝的孟加拉语稀疏少样本语言建模方法,仅保留初始模型10%边、实现90%稀疏度,在孟加拉语下游任务中性能可与多个最先进语言模型媲美。

Comments 14 pages, 9 tables, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 79%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04454 2026-08-06 cs.CV cs.LG 新提交 79%

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

超越全局路由聚合:面向MoE视觉-语言模型的阶段感知专家合并

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对MoE-VLM全局路由聚合导致专家角色混淆的问题,提出无需训练的RoleMerge方法,通过阶段归一化路由统计合并专家,在匹配专家保留比例下性能优于现有方法,六任务宏平均相对提升最高9.6%。

Comments 17 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04174 2026-08-06 cs.LG 新提交 79%

TS2TabPFN: Time Series Classification and Extrinsic Regression through Feature Extraction and a Tabular Foundation Model

TS2TabPFN:通过特征提取和表格基础模型实现时间序列分类与外生回归

Gabriel da Costa Merlin, Diego Furtado Silva

机构 * University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 TS2TabPFN框架将显式特征提取与表格基础模型TabPFN 2.5集成,在时间序列外生回归任务中显著优于现有最优模型,为时间序列分类提供了稳健高效的替代方案,建立了新的时间序列最优水平。

Comments Accepted at ECML PKDD 2026. To appear in Springer LNCS. 18 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11506 2026-08-06 cs.LG cs.AI cs.AR cs.PF 版本更新 79%

RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis

RooflineBench:通过 Roofline 分析为设备端 LLMs 提供的基准测试框架

Zhen Bi, Xueshu Chen, Luoyang Sun, Yuhang Yao, Qing Shen, Jungang Lou, Cheng Deng

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于 Roofline 模型的统一框架,通过操作强度(OI)统一架构原语和硬件约束,引入相对推理潜力作为新指标,分析不同 LLMs 在相同硬件上的效率差异,并揭示序列长度和模型深度对性能和 OI 的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 75%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04405 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Training-Free Hashing-Based Attention via Binary Principal Components

基于二元主成分的无训练哈希注意力机制

Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长上下文LLMs自注意力的解码效率瓶颈,提出无训练的BinaryPC方法,通过数据二元主成分构建哈希码,在保持精度的同时将解码吞吐量提升3.56倍。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 75%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04033 2026-08-06 cs.CR 新提交 75%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 75%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04515 2026-08-06 cs.CV cs.AI cs.CL 新提交 73%

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配

Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04330 2026-08-06 cs.CL cs.LG 新提交 73%

Right Reset: Chunking by Prefix Removal

右侧重置:通过前缀移除进行分块

Mike Vegeto

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出右侧重置(RR)方法,通过前缀移除探测将因果语言模型的上下文依赖转化为边界信号,在文本分块任务上优于基线方法,减少局部输出干扰。

Comments 12 pages, 2 figures, 4 tables. Code, data, and reproduction materials: https://github.com/ZECTBynmo/right-reset-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04074 2026-08-06 cs.LG cs.AI cs.IT eess.SP math.IT 新提交 73%

Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms

将比特分配至查询关注处:基于注意力保留变换的KV缓存向量量化

Samuel Fernández-Menduiña, Amir Ziashahabi, Eduardo Pavez, Antonio Ortega, Salman Avestimehr

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出名为NOVA-KV的KV缓存量化方法,将其建模为变换编码问题,推导闭式最优变换,在每元素2比特时可恢复标量量化方法损失的大部分长上下文检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04458 2026-08-06 cs.AI cs.AR cs.OS 新提交 70%

Architectural Implications of Agentic AI Workflows

智能体AI工作流的架构影响

Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic

机构 * Microsoft Azure(微软Azure)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过生产与受控研究分析智能体AI工作流的架构特性,揭示传统服务器的不匹配问题,提出Agora原型优化资源利用与吞吐量,为未来服务器架构指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03529 2026-08-06 cs.CL 版本更新 70%

Consensus Measures for Unstructured Biomedical Text Annotations

非结构化生物医学文本标注的一致性度量

Pascal Wullschleger, Christian Kreis, Martin A. Walter, Jennifer Foster, Marc Pouly

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对生物医学非结构化文本标注的一致性量化难题,提出基于自然语言推理的折中度量方案,经实验验证多种语义等价度量的特性及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04630 2026-08-06 eess.SP 新提交 67%

Generalizable and Computational Efficient Channel Extrapolation for 6G: A Configurable AI-Driven Framework Built from a Modular Perspective

面向6G的可泛化且计算高效的信道外推:一种从模块化视角构建的可配置AI驱动框架

Yuan Gao, Xinyi Wu, Jiang Jun, Yi Yu, Yanliang Jin, Shunqing Zhang, Zhu Han, Shugong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对6G信道外推泛化差、复杂度高的问题,提出三阶段模块化可配置AI框架,降低了信道外推误差与复杂度,性能优于混合专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04450 2026-08-06 cs.DC 新提交 67%

CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?

CommBench:大语言模型能编写正确且高效的GPU通信代码吗?

Shuang Ma, Yuyi Li, Yihan Zhang, Hezhi Xie, Danyang Chen, Shuyang Ji, Ziming Mao, Cheng Ji, Ansha Prashanth, Wenting Yang, Yiran Wang, Chihan Cui, Pei Yu Lin, Ion Stoica, Yang Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出GPU通信编程综合基准CommBench,评估发现最强代码生成模型GPT-5.5仅在30.7%任务中实现正确高效的GPU通信代码,凸显LLMs与专家水平的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04416 2026-08-06 cs.HC 新提交 67%

Preference-Driven Online Adaptation for Personalized Interaction Initiation in Proactive AI Assistants

主动式AI助手中个性化交互发起的偏好驱动在线适应

Yufeng Wang, Wei Zhang, Zhiquan Wen, Jinwu Hu, Linhui Xiao, Tianlu Pan, Qingfang Zheng, Mingkui Tan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对主动式AI助手个性化交互时机难确定的问题,提出EOPA方法,在ProPerSim基准上较最强基线提升F1分数19.80个百分点,降低推理延迟与平均每日适应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17160 2026-08-06 cs.LG cs.AI cs.CV 版本更新 62%

When Bits Break Recourse: Counterfactual-Faithful Quantization

当比特失效时的反事实:反事实忠实量化

Chaymae Yahyati, Ismail Lamaakal, Khalid El Makkaoui, Ibrahim Ouahbi

机构 * Mohammed First University(穆罕默德第一大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了量化过程中反事实可解释性的问题,提出反事实忠实量化方法,通过定义有效性下降和反事实可逆差距两个指标来评估量化对反事实可解释性的影响,并在多个数据集上验证了该方法在保持准确性的同时提升了反事实稳定性。

Comments 57 pages, 31 tables, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19418 2026-08-06 cs.CV cs.AI cs.LG 版本更新 62%

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考

Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) UCLA(洛杉矶大学) Panasonic AI Research(松下人工智能研究)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。

Comments Project page: https://wakalsprojectpage.github.io/covt-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04502 2026-08-06 cs.DC cs.AI 新提交 57%

AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

AFD-Ledger:注意力-前馈网络(FFN)拆分的部署配置

Chengyu Qiu, Xiao Fu, Fengcun Li, Yulei Qian, Yuchen Xie, Xunliang Cai, Yingdi Shan, Yongwei Wu, Mingxing Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 AFD-Ledger是离线分析配置系统,可优化AFD与同置部署的硬件分配,减少部署评估量,预测吞吐量偏差小,揭示同构/异构AFD及角色硬件改进的部署规律。

Comments 14 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02070 2026-08-06 cs.CV cs.LG 版本更新 57%

STEAM: A Spatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding

STEAM:用于EEG解码的分层预训练时空对齐混合专家模型

Zhu Chen, Dingkun Liu, Yuheng Chen, Dongrui Wu

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏