arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2607.16184 2026-07-20 cs.LG 新提交 85%

PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

PagedWeight:通过动态质量感知权重量化实现高效的混合专家语言模型服务

Yuchen Yang, Yifan Zhao, Anisha Dasgupta, Sasa Misailovic

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究KV缓存密集场景下MoE模型权重与缓存的矛盾,提出PagedWeight方法,通过动态量化权重平衡精度与缓存大小,在多个内存敏感场景中改进质量-内存权衡,实现高精度、高内存节省及吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14277 2026-07-17 cs.CL 新提交 85%

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

多头潜在控制:大语言模型智能体决策的统一接口

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada Co., Ltd.(华为加拿大技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型作智能体时的决策控制问题,提出多头潜在控制方法,通过读取冻结模型的隐藏状态轨迹生成控制信号,能在不修改模型的情况下进行事后适配,改善多模型系统质量成本权衡,减少大模型使用并提高工具使用决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交 85%

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09403 2026-07-13 cs.AI 新提交 85%

Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review

虚构世界构建:基于分层上下文压缩和迭代审查的多智能体大语言模型协作

Jingbo Chen, He Wang, Wei Yuan, Yuqiao Lai, Zhenyan Lu

机构 * National University of Defense Technology(国防科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型应用于世界构建面临的挑战,提出AutoWorldBuilder多智能体协作系统,通过五个组件应对,经实验验证,该系统在世界构建任务中有高成功率,能高效生成自洽概念,其架构模式可推广到其他知识密集型多智能体大语言模型应用。

Comments 36 pages, 7 fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09330 2026-07-13 cs.AI cs.MA 新提交 85%

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

基于计算能力网络的异构大语言模型实体代理的通信高效数字孪生协调

Nuocheng Yang, Sihua Wang, Zihan Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对异构大语言模型实体代理协作面临的通信开销大、协调质量受LLMs能力限制和行动延迟等挑战,提出基于轻量级数字孪生的LDT-Coord框架,通过特定方法减少通信开销,实现与传统方法相当的任务成功率且保持鲁棒性。

Comments 14 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08791 2026-07-13 cs.NE cs.AI 新提交 85%

LLM-Driven Evolutionary Generation of Multi-Objective Bayesian Optimization Algorithms

基于大语言模型驱动的多目标贝叶斯优化算法的进化生成

Georgios Laskaris, Reuben Brasher, Niki van Stein, Elena Raponi, Thomas Bäck, Florian Neukart

机构 * LIACS, Leiden University, Leiden, Netherlands(LIACS,莱顿大学,莱顿,荷兰)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何设计多目标贝叶斯优化算法,核心方法是将LLaMEA框架扩展到MOBO,利用大语言模型生成算法并集成超参数优化。主要贡献是生成的算法在合成和实际工程问题上表现优异,能以低成本实现帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07817 2026-07-10 cs.CV cs.AI 新提交 85%

DreamCharacter-1: From 3D Generative Foundation Models to Product-Ready Character Generation

DreamCharacter-1:从3D生成基础模型到产品就绪的角色生成

Weizhe Liu, Yunjie Wu, Xiangqian Shu, Guangwei Wang, Xiangyu Xu, Peng Li, Yujie Li, Hengkai Guo

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究提出DreamCharacter-1框架,基于3D基础主干,通过几何后期训练、纹理后期训练和推理加速三个组件,将预训练模型校准用于3D角色生成,实验证明该框架能生成高质量角色资产,超越现有方法。

Comments Official Page: https://dreamcharacter-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交 85%

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 85%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05475 2026-07-08 cs.AR cs.AI 新提交 85%

Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

你的NPU是否适用于大语言模型?剖析移动大语言模型推理中隐藏的效率瓶颈

Guanyu Cai, Ruiming Tian, Lang Yang, Zhouhong Ren, Jinliang Yuan, Lingkun Li, Jiliang Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究剖析移动大语言模型推理隐藏的效率瓶颈,通过跨层测量及PowerBench工具,发现框架性能差距在NPU上被放大、不同后端在不同阶段各有优劣及存在调度空间浪费,据此提出配置可降NPU后端能耗54.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03174 2026-07-07 cs.SE cs.AI 新提交 85%

Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study

基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究

Gabriel Almeida, Ilir Gashi, Vladimir Stankovic, João R. Campos

机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) Centre for Software Reliability(软件可靠性中心) Department of Informatics Engineering(信息工程系) Department of Computer Science(计算机科学系) City St George’s, University of London(伦敦城市圣乔治大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01678 2026-07-03 cs.LG cs.DC 新提交 85%

SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication

SCAPE:基于极端稀疏通信的高效准确大语言模型训练

Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SCAPE分布式优化器,利用AdamS的一阶矩稳定性实现高稀疏度通信,通过基于一阶矩的掩码生成、分片并行和延迟掩码策略,在90%-99%稀疏度下保持模型质量,并减少端到端训练时间达43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 85%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27866 2026-06-29 cs.LG 新提交 85%

FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

FlexMoE:面向MoE语言模型的一体化嵌套专家内剪枝方法

Fan Mo, Yuxuan Han, Geng Zhang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlexMoE方法,通过专家通道重要性排序和离散动作学习,将预训练MoE大语言模型转换为嵌套子网络族,支持跨预算部署,在Qwen2-57B-A14B上剪枝50%路由专家参数仍保留约99.8%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26861 2026-06-26 cs.CL 新提交 85%

Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT

面向工业物联网设备端大模型推理的级联多粒度剪枝

Jinghan Wang, Yanjun Chen, Wei Zhang, Xiaotong Huang, Tianchen Liu, Gaoliang Peng

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出级联多粒度剪枝框架,通过粗到细顺序移除层、注意力头和前馈通道,并利用轻量级低秩恢复重新估计重要性,在MHA+GELU架构上实现13.8倍压缩和83.82%准确率,在工业物联网设备上降低推理延迟67.2%。

Comments This work has been submitted to the IEEE Internet of Things Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23087 2026-06-23 cs.LG 新提交 85%

FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models

FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练

Zhida Jiang, Zhaolong Xing, Yang Pei, Xiaolong Chen, Yuanhang Xiao, Chengzhi Huang, Xiyu Liu, Haopeng Liu, Qingyuan Sang, Lingfeng Zhou, Jiaxing Wang, Zicheng Zhang, Wenzhe Wang, Xinyu Liu, Yan Li, Zhen Chen, Ke Zhang

机构 * Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17464 2026-06-17 cs.LG 新提交 85%

CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

CheckMIABench: 语言模型成员推理攻击的坚实基础

Jeffrey G. Wang, Jason Wang, Marvin Li, Seth Neel

机构 * Harvard University(哈佛大学) Harvard Business School(哈佛商学院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 为解决成员推理攻击评估中的分布偏移问题,提出基于训练中固定点前后数据同分布的基准框架,在Pythia和OLMo模型上评估多种攻击,并开源模块化库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16461 2026-06-16 cs.LG 新提交 85%

Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

对称性带来的隐私:用于大语言模型推理的正交等变Transformer

Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对拆分推理中隐藏表示易被近邻搜索恢复的问题,提出正交混淆方法,并设计ConjFormer架构实现O(d)-等变性,在不加噪声或重加密下将令牌恢复率从35%降至1.3%,困惑度仅增0.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16383 2026-06-16 cs.CL 新提交 85%

Surpassing Scale by Efficiency: A Compact 135M Parameter Foundational LLM Natively Adapted for the Bangla Language

通过效率超越规模:一个紧凑的135M参数基础LLM原生适配孟加拉语

Rabindra Nath Nandi

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出一个135M参数的紧凑型解码器模型bangla-smollm-135m,通过确定性交集-追加词元合并策略解决孟加拉语子词碎片化,在零样本多任务基准上匹配或超越两倍大小模型。

Comments Submitted to a Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15453 2026-06-16 cs.AR cs.LG 新提交 85%

A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

面向高效MoE大语言模型推理的时空专家预取框架

Yingnan Zhao, Razvan Bunescu, Ahmed Louri, Avinash Karanth, Ke Wang

机构 * George Washington University(乔治华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Ohio University(俄亥俄大学)

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对MoE大模型推理中专家加载延迟问题,通过分析专家选择行为的时空相关性,提出ST-MoE框架,结合轻量级运行时预测和可重构硬件设计,实现专家预取以重叠计算与加载,提升性能与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08476 2026-06-09 cs.DC cs.AI 新提交 85%

FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training

FlashCP: 面向LLM训练的负载均衡且通信高效的上下文并行

Zheng Wang, Eric Liu, Linan Jiang, Zhongkai Yu, Zaifeng Pan, Yue Guan, Yuke Wang, Yufei Ding

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出FlashCP框架,通过分片感知通信消除冗余KV传输,并设计Whole-Doc分片策略与启发式算法,实现负载均衡与通信高效,在多种数据集上取得最高1.63倍加速。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20390 2026-08-24 cs.CL cs.AI cs.CY 新提交 85%

Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations

Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训

M Waleed Kadous, Amr Elsayed, Abdullah Al Nahas, Ashraf Haress

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。

Comments 10 pages, 1 figure, 3 tables. Live system: this https URL (https://askansari.ai). Code: this https URL (https://github.com/ansari-project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10939 2026-08-12 cs.CL cs.AI 新提交 85%

A Cost-Efficient Routing Pipeline for Multilingual Short-Text Classification Using Small Language Models

使用小型语言模型的低成本多语言短文本分类路由流水线

Wajdi Ben Saad, Safa Madiouni

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.CL、cs.AI

AI总结 本研究提出一种使用小型语言模型的多语言短文本分类路由流水线,通过选择性翻译低资源语言提升分类性能,在两个基准上验证了该策略的有效性。

Comments Accepted for publication at the 16th International Conference on Advanced Computer Information Technologies (ACIT 2026), https://acit.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29602 2026-08-03 cs.CL cs.AI cs.CV cs.HC 新提交 85%

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

FriendBench:人类与多模态大语言模型的二元熟悉度推理基准

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

机构 * Fluid Concepts Research(流体概念研究机构)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28319 2026-07-31 cs.CL cs.CY cs.LG 新提交 85%

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

公平剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Fairness Pruning方法,通过最小对比提示对与激活捕获定位LLM的GLU-MLP层中人口统计偏差神经元,经实验验证该方法可针对性调控偏差且对模型能力影响极小。

Comments 15 pages, 3 figures, 9 tables. Code and datasets publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15525 2026-07-20 cs.LG cs.AI 新提交 85%

Kolmogorov--Arnold Networks for Small Language Models

用于小型语言模型的柯尔莫哥洛夫-阿诺德网络

Felippe Alves, Renato Vicente

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.AI、cs.LG

AI总结 研究探讨柯尔莫哥洛夫-阿诺德网络(KANs)能否替代变压器前馈网络。通过在特定KAN中重建边缘、修剪等测试其特性,还评估多种网络在BabyLM等上的表现。结果表明小基KANs可用于审计标量变换,但替代方案未展现优于MLP基线的一致优势。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08754 2026-07-10 cs.LG cs.AI 新提交 85%

SLORR: Simple and Efficient In-Training Low-Rank Regularization

SLORR:简单高效的训练中低秩正则化

David González-Martínez, Shiwei Liu

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对神经网络低秩正则化难题,提出简单无状态的SLORR框架,基于霍耶尔稀疏性度量和核范数有两个变体,通过GPU友好近似正则化权重矩阵,在ImageNet-1K及LLM预训练中验证其能在低开销下诱导可压缩性并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交 85%

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12876 2026-06-12 cs.LG cs.CL cs.IT math.IT 新提交 85%

Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

使用加性码本的大语言模型多比特宽度量化

Liza Babaoglu, Shuangyi Chen, Ashish Khisti

机构 * University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出Drop-by-Drop框架,基于信息论和逐次细化理论,利用加性码本和Matryoshka监督实现单个模型在推理时支持多精度权重控制,降低存储开销并保持性能。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 85%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏