arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 78 篇

2608.26004 2026-08-27 cs.AI cs.CL 新提交 73%

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec:面向智能体大语言模型的上下文非对称投机解码

Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 AsymSpec是面向智能体大语言模型的非对称投机解码框架,通过轻量级草稿读全输入、大型验证模型用压缩视图,实现近90%完整上下文准确率,获1.3-1.7倍吞吐量加速且计算成本仅0.2-0.3倍。

Comments EMNLP Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25542 2026-08-27 cs.LG cs.CL 新提交 73%

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference

反射引导:在激活空间中解耦反射与推理以实现高效令牌推理

Jiarui Hu, Zhiyuan Wen, Xiaoyun Liu, Jiaxing Shen, Yu Yang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院) School of Data Science, Lingnan University(岭南大学数据科学学院) Centre for Learning, Teaching and Technology, The Education University of Hong Kong(香港教育大学学习、教学与技术中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出无需训练的Reflection Steering框架,通过解耦反射与推理的激活实现高效令牌推理,可减少16.9%推理令牌,还引入参数α平衡令牌节省、准确率与生成稳定性。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25116 2026-08-27 cs.LG cs.AI stat.ML 新提交 73%

GRAPE: Gradient Refinement and Progress-Aware Exploitation for Query-Efficient High-Dimensional Bayesian Optimization

GRAPE:面向查询高效性的高维贝叶斯优化的梯度细化与感知进展利用

Richard Cornelius Suwandi, Feng Yin

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对高维黑箱函数优化的查询效率问题,提出GRAPE两阶段框架,经理论与实验验证,在黑箱对抗攻击和大语言模型提示优化任务中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-27 cs.LG cs.AI cs.HC 版本更新 73%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-08-27 cs.LG cs.AI 版本更新 73%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Nanxin Zeng, Peisong Wang, Zhilei Liu, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 19 pages, 8 figures

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing, Main Conference (EMNLP 2026 Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22733 2026-08-27 cs.CL cs.AI cs.IR 版本更新 73%

E2Rank: Unifying Text Embedding and Listwise Reranking for Effective and Efficient Search

E2Rank:统一文本嵌入与列表式重排序以实现高效且有效的搜索

Qi Liu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Pengjun Xie, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 E2Rank是统一文本嵌入与列表式重排序的框架,通过将列表式提示视为伪相关反馈查询,在单一模型内实现高效检索与重排序,在BEIR等基准上性能优异且延迟更低。

Comments Accepted by EMNLP 2026 main conference. Code and models are avaliable at https://alibaba-nlp.github.io/E2Rank

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25941 2026-08-27 cs.LG 新提交 70%

When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs

当剪枝遇上可解释性:在大语言模型中保留稀疏自编码器的鲁棒性

Suchit Gupte, Xueru Zhang, Mohammad Mahdi Khalili

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究探讨剪枝对大语言模型稀疏自编码器的影响,提出扰动能量理论,指出激活感知剪枝方法更鲁棒,发现中间层更敏感,提出分层稀疏策略并经多模型实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25583 2026-08-27 cs.CL 新提交 70%

GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning

GRIP:用于高效推理的粒度奖励引导参数插值

Lam So, Canhui Wu, Han Lin

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对推理模型与指令模型的准确性-效率不匹配问题,提出GRIP框架,通过优化同架构两模型模块的可学习插值比例,实现更优的准确性-效率权衡。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25575 2026-08-27 cs.CV cs.AI 新提交 70%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25115 2026-08-27 cs.CL cs.IR 新提交 70%

Less can be More: Relieving RAG Bottlenecks via Evidence Frontloading and Pressure-Adaptive Budgeting

少即是多:通过证据前置和压力自适应预算缓解RAG瓶颈

Weibin Cai, Reza Zafarani

机构 * Syracuse University(雪城大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对RAG系统瓶颈转移问题,提出无训练框架PACE,结合证据前置与压力自适应预算,在多跳问答数据集及模拟中提升了证据召回率并降低了重排序密集型负载的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25091 2026-08-27 cs.AI cs.CR 新提交 70%

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

自动策略,而非自动技能:面向物理世界的编译智能体技能

Zhonghao Zhan, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对恶意智能体技能造成物理伤害的问题,提出位于技能制品内部的类型化权限层Edge Skillguard,可高效拒绝借用权限请求,验证了其在多场景下的防护效果。

Comments Presented at the 1st Workshop on Agent Skills (Agent Skills '26), ACM CAIS 2026, San Jose, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26070 2026-08-27 cs.CL cs.AI cs.LG 新提交 67%

Prefix Sliding for efficient test-time scaling

用于高效测试时缩放的前缀滑动

Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis

机构 * Stanford University(斯坦福大学) University of California at Santa Barbara(加州大学圣巴巴拉分校) Prime Intellect University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对测试时推理内存成本过高问题,提出Prefix Sliding方法,通过丢弃非关键标记限制内存,无需训练可提速3倍,结合强化学习训练后性能更优且优于其他基线

Comments 28 pages (9 main), 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交 67%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25936 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

一种症状,三个杠杆:对在线策略自蒸馏的批判性综述

Justin Robert, Raheel Qader

机构 * OVHai LLM(OVHai大模型)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述针对在线策略自蒸馏(OPSD)存在的推理路径崩溃问题,从信号加权、特权信息性质、指导衰减三个杠杆展开分析,以数学推理为范围,提供统一术语并区分已确定与争议内容。

Comments 30 pages, 4 figures. Survey / critical review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 67%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25356 2026-08-27 cs.CV 新提交 67%

Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

关注何处至关重要:面向长视频理解的策略内自蒸馏

Kaishen Wang, Dongdi Zhao, Yijun Liang, Dingqiang Ye, Ruibo Chen, Heng Huang, Di Fu

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与部署 :language model(abstract);post-training(abstract)

AI总结 该研究针对长视频理解中全视频冗余干扰问题,提出Clue-OPSD线索特权策略内自蒸馏框架,无需线索标注,可提升模型准确率并优于相关基线。

Comments 15 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20803 2026-08-27 cs.CV 版本更新 67%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25190 2026-08-27 cs.CL cs.LG 新提交 62%

BanglaMamba: Exploring State Space Models for Bangla Fake News Detection

BanglaMamba:探索用于孟加拉语假新闻检测的状态空间模型

M. K. Khalidi Siam

机构 * BRAC University(BRAC大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出BanglaMamba,将基于Mamba的状态空间模型用于孟加拉语假新闻检测,其性能与从头训练的CustomBERT相当,且推理效率优于BERT模型,凸显了该模型在资源受限场景的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25114 2026-08-27 cs.LG cs.AI 新提交 62%

Flower Hub: A Reproducible Benchmarking Platform for Federated Learning in Simulation and Deployment

Flower Hub:用于联邦学习仿真与部署的可复现基准测试平台

Yan Gao, Mohammad Naseri, Javier Fernandez-Marques, Dimitris Stripelis, Lorenzo Sani, Davide Eynard, Fan Zhang, Hong Jia, Ting Dang, D. B. Emerson, Fatemeh Tavakoli, Ole Werger, Lars Wulfert, Petros Demetrakopoulos, Sofia Tsekeridou, InSeo Song, KangYoon Lee, Honghao Li, Lingjuan Lyu, John P Dickerson, Daniel Janes Beutel, Nicholas D. Lane

机构 * Flower Labs University of Cambridge(剑桥大学) University of Auckland(奥克兰大学) University of Melbourne(墨尔本大学) Vector Institute Fraunhofer IMS(弗劳恩霍夫应用固体物理与材料力学研究所) NetCompany Gachon University(嘉泉大学) Owkin Sony AI(索尼人工智能)

专题命中 效率与部署 :instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 Flower Hub是一款联邦学习基准测试平台,可将基准打包为可执行应用,支持跨仿真与部署运行,涵盖多领域任务,推动联邦学习基准测试向可复用方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25088 2026-08-27 cs.LG cs.AI q-bio.NC 新提交 62%

The Von-Neumann State-Space Transformer for neural decoding

用于神经解码的冯·诺依曼状态空间Transformer

Morteza Sarafyazd

机构 * BrainCo(脑聚科技)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出VN-SST模型,其前馈模块为低维指令库,在神经解码任务中样本与参数效率优于现有模型,且在语言建模任务中也展现出通用高效性。

Comments 14 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24973 2026-08-27 cs.LG cs.AI cs.ET 新提交 62%

Resource-Efficient Pruning for Transformer via Low-Rank Importance Estimation

基于低秩重要性估计的Transformer资源高效剪枝

Peng Liu, Huibing Zeng, Yiqun Zhang, Yang Yi, Jigang Wu

机构 * School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对Transformer模型部署的高资源消耗问题,提出基于LoRA低秩梯度的REP-LIE剪枝方法,结合稳定性分数迭代剪枝,在LLaMA-7B等模型上实现高效剪枝并保持竞争力性能。

Comments 15 pages, 9 figures

Journal ref IEEE Transactions on Emerging Topics in Computational Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-27 cs.CL cs.LG 版本更新 62%

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-27 cs.CV cs.AI cs.LG 版本更新 62%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25774 2026-08-27 cs.LG 新提交 57%

EXAONE Tabular 1.0 : Technical Report

EXAONE Tabular 1.0:技术报告

Moonjung Eo, Min-Kook Suh, Hye-Seung Cho, Jiwon Kim, Seoyoon Kim, Sangjun Nam, Soonyoung Lee

机构 * LG AI Research(LG AI研究院)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 EXAONE Tabular 1.0 是一款紧凑表格基础模型系列,通过重新设计架构实现高效表格上下文学习,在多个公开基准测试中展现出优于同类模型的预测性能与推理效率。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25572 2026-08-27 cs.RO cs.AI 新提交 57%

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models

ConfAL-WM:用于动作条件世界模型的置信度引导主动学习

Xiang Liu, Sen Cui, Changshui Zhang

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 针对动作条件世界模型在新场景下的局部错误问题,提出ConfAL-WM框架,基于EVAC和UNet实现置信度引导的高效数据选择与局部训练增强,在RoboTwin2.0上验证了其提升训练效率与预测质量的效果。

Comments Project page: https://ConfAL-WM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 57%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25019 2026-08-27 astro-ph.SR astro-ph.GA astro-ph.IM cs.LG 新提交 57%

EncoTESS: Age-Sensitive Encodings from Raw TESS Light Curves

EncoTESS:基于原始TESS光变曲线的年龄敏感编码

Phil R. Van-Lane, Joshua S. Speagle, Ryan Cloutier, Christopher A. Theissen, Gwendolyn M. Eadie, Ilay Kamai

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 EncoTESS是针对TESS数据特性开发的小型时间序列基础模型,可将光变曲线编码为潜在参数空间,用于恒星年龄推断等任务,性能优于传统年龄指标,框架与编码库公开可用。

Comments 36 pages, 23 figures (including appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22322 2026-08-27 cs.LG 版本更新 57%

Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers

超越密集Adam状态:用于内存高效优化器的自适应对数空间量化

Yan Wang

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对内存高效优化器的状态异质性提出自适应对数空间量化,在AdamW、CAME等模型的语言模型预训练实验中,可显著降低优化器存储并保持良好困惑度表现。

Comments 17 pages, 5 figures, 7 tables. Clarified the experimental setup, notation, reporting scope, and limitations; completed the Adafactor block-size/grouping ablation; added the public reproducibility artifact. Code: https://github.com/yanfeiwong/adafactor-8bit. Artifacts: https://github.com/yanfeiwong/al-quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02118 2026-08-27 cs.LG cs.CV 版本更新 57%

BRIDLE: Generalized Self-supervised Learning with Quantization

BRIDLE:基于量化的广义自监督学习

Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本研究提出BRIDLE框架,将残差量化融入双向训练,可泛化用于多模态预训练,在音频分类等任务上取得最优结果,优于传统向量量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25780 2026-08-27 cs.IR 新提交 50%

PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval

PUMA:用于高效检索的通用多模态嵌入的事后稀疏化

Matteo Attimonelli, Alessandro De Bellis, Franco Maria Nardini, Claudio Pomo, Cosimo Rulli, Rossano Venturini, Tommaso Di Noia

专题命中 效率与部署 :pretraining(abstract)

AI总结 针对通用多模态嵌入的高存储与推理成本问题,提出无需微调主干网络的PUMA稀疏自编码器方案,在五个基准上验证其可实现8-16倍存储压缩与最高25倍检索加速,且多数数据集性能与密集检索相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏