arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22456 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22456 篇

2607.00908 2026-07-02 cs.LG 新提交 83%

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡

Fei Wang, Chao Xue, Taoran Liu, Li Shen, Ye Liu, ChangXing Ding

机构 * South China University of Technology(华南理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Ocean University of China(中国海洋大学) Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21397 2026-07-02 cs.CV cs.LG 版本更新 83%

MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

MMLoP: 多模态低秩提示用于高效视觉-语言适配

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :prompting(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31903 2026-07-01 cs.CV cs.AI 新提交 83%

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃

Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Sun Yat-sen University(中山大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08761 2026-06-30 cs.DC cs.AI 新提交 83%

APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

APEX4: 通过SM内计算重平衡实现高效纯W4A4 LLM推理

Hong Guo, Nianhui Guo, Weixing Wang, Jona Otholt, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institute(霍普夫-普拉特纳研究所) GreenBit.AI German University of Digital Science(德国数字科学大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对W4A4量化中CUDA核心反量化瓶颈,提出基于SM内计算平衡的ρ感知粒度自适应方法,设计纯INT4 GEMM内核,在多种GPU上实现最高2.09倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16856 2026-06-30 cs.CL 83%

Online Experiential Learning for Language Models

在线经验学习用于语言模型

Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出在线经验学习框架OEL,使语言模型能持续从自身部署经验提升,通过经验知识提取与参数固化实现在线学习循环,提升任务准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16908 2026-06-16 cs.CL 新提交 83%

LESS Is More: Mutual-Stability Sampling for Diffusion Language Models

LESS Is More: 扩散语言模型的互稳定采样

Amr Mohamed, Guokan Shang, Michalis Vazirgiannis

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Ecole Polytechnique(巴黎综合理工学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 针对扩散语言模型固定步数采样效率低的问题,提出无训练的自适应采样器LESS,通过互稳定规则动态决定掩码位置何时解码,在7个基准上平均准确率提升且步数减少72.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22827 2026-06-16 cs.SE cs.AI 版本更新 83%

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy:基于大语言模型的代码执行效率优化框架

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computer Science, Central China Normal University(中央中国师范大学计算机学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FasterPy框架,结合检索增强生成(RAG)和低秩适应(LoRA)技术,利用大语言模型自动优化Python代码执行效率,在PIE基准上超越现有方法。

Comments 38 pages, 5 images, 14 tables, Manuscript revision submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13322 2026-06-12 cs.CL 新提交 83%

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

基于LLM并行文本生成的低延迟实时音频游戏解说系统

Ryota Kawamatsu, Anum Afzal, Yuki Saito, Shinnosuke Takamichi, Graham Neubig, Katsuhito Sudoh, Hiroya Takamura, Tatsuya Ishigaki

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology(产业技术综合研究所) Technical University of Munich(慕尼黑工业大学) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学) Nara Women’s University(奈良女子大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种并行文本生成与语音播放的低延迟实时游戏解说系统,将平均句间静默从9.6秒降至0.3秒,显著提升解说节奏。

Comments Accepted at IJCAI-ECAI 2026 (Demonstrations Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11576 2026-06-11 cs.CV cs.AI 新提交 83%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11106 2026-06-10 cs.CV cs.AI 新提交 83%

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

FADA: 可访问的胎儿超声解读与标注——基于选择性蒸馏的统一视觉-语言模型

Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) HMC(哈马德医疗公司) Advanced AlRazi Diagnostic Center(高级阿尔拉齐诊断中心) Sidra Medicine(锡德拉医学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出统一视觉-语言模型FADA,通过选择性蒸馏从四个领域基础模型提取知识,实现胎儿超声的解读、分类、检测和分割,在单个消费级GPU上训练,无需外部标签,可在智能手机上离线运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08635 2026-06-09 cs.LG cs.DC 新提交 83%

SpectrumKV: Per-Token Mixed-Precision KV Cache Transfer for Prefill-Decode Disaggregated LLM Serving

SpectrumKV: 面向预填充-解码分离式LLM服务的逐令牌混合精度KV缓存传输

Yang Pengju

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对预填充-解码分离架构中KV缓存传输开销大的问题,提出SpectrumKV,通过为每个令牌分配不同精度(FP16/INT8/INT4)实现混合精度传输,并设计轻量部署探测自适应选择精度策略,在相同传输预算下显著提升模型质量并降低TTFT。

Comments 28 pages,13 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 83%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19662 2026-06-09 cs.AI 版本更新 83%

When Tabular Foundation Models Meet Strategic Tabular Data: A Prior Alignment Approach

当表格基础模型遇见策略性表格数据:一种先验对齐方法

Xinpeng Lv, Yunxin Mao, Renzhe Xu, Chunyuan Zheng, Yikai Chen, Haoxuan Li, Jinxuan Yang, Kun Kuang, Yuanlong Chen, Mingyang Geng, Wanrong Huang, Shixuan Liu, Shaowu Yang, Wenjing Yang, Zhouchen Lin, Haotian Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文研究了表格基础模型在策略性表格数据上的泛化能力,提出了一种策略感知的先验对齐框架SPN,以提高模型在策略性环境中的鲁棒性和预测性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23640 2026-06-09 cs.DC cs.LG 版本更新 83%

LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load

边缘侧的大语言模型推理:移动、NPU和GPU在持续负载下的性能效率权衡

Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan

机构 * Conscious Engines

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究评估了在持续负载下不同设备上大语言模型的性能效率,发现移动端受热管理限制,专用硬件受电池和内存带宽限制,展示了不同平台的推理表现和能效差异。

Comments 14 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07345 2026-06-08 cs.LG 新提交 83%

TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention

TabSwift: 一种高效的基于行注意力的表格基础模型

Si-Yang Liu, Han-Jia Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出TabSwift,通过门控注意力稳定和可学习注册令牌增强轻量级行注意力骨干,实现高效表格上下文学习,在保持竞争力的同时降低推理成本。

Comments Accepted to ICML 2026, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 83%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00846 2026-06-02 cs.LG 83%

CUPID in the Model Zoo: Online Matchmaking for Selecting Your Dream LLM

模型动物园中的丘比特:在线匹配以选择你的梦想大语言模型

Son Nguyen, Xinyuan Liu, Ransalu Senanayake

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 提出一种基于决斗老虎机算法的主动学习框架,通过迭代选择大语言模型对并收集用户反馈,高效匹配用户偏好与模型能力。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26292 2026-06-02 cs.CV cs.CL 83%

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Concordia University(康科迪亚大学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.CL

AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。

Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12741 2026-06-02 cs.AI 83%

Language Model Networks: Supervision-Efficient Learning through Dense Communication

语言模型网络:通过密集通信实现监督高效学习

Shiguang Wu, Yaqing Wang, Quanming Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出LMNet,一种密集可微的语言模型网络,通过可训练的序列到序列模块作为通信边,实现节点间密集向量交换,支持端到端梯度优化和高效信息传递,在有限监督下实现有效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09566 2026-06-02 cs.CV cs.AI 83%

Hot-Start Chinese Language Modeling:Visual Glyphs Accelerate Sample-Efficient Learning

热启动中文语言建模:视觉字形加速样本高效学习

Shuyang Xiang, Hao Guan

机构 * Independent Researcher(独立研究者) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文通过将汉字渲染为视觉字形图像,研究其对字符级语言建模的归纳偏置,发现视觉输入产生显著的热启动效应,但最终精度与基于索引的方法一致。

Comments 15 pages, 5 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27703 2026-05-28 cs.AI 83%

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

面向资源受限智能体语言模型的分层提示域控制与学习

Joan Vendrell Gallart, Russell Bent, Michael Grosskopf

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出分层控制与学习框架,通过蒸馏学习输出模式、在线监控与提示域控制,解决资源受限下智能体语言模型的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26636 2026-05-27 cs.CV cs.AI 83%

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai

机构 * MIT(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(NVIDIA公司) Physical Intelligence(物理智能)

专题命中 效率与部署 :post-training(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26489 2026-05-27 cs.LG 83%

The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

奇异分布的稳定性:语言模型预训练两阶段动力学的谱视角

Hongtao Zhang, Wenjie Zhou, Chenxi Jia, Wei Chen, Xueqi Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of Mathematics, Southeast University, Nanjing, China(东南大学数学学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文发现语言模型预训练中奇异值谱的早期稳定现象(SoSD),并证明该现象与慢下降阶段同步,通过理论分析揭示了权重范数增长导致SoSD阈值,从而限制后续损失下降速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18908 2026-05-26 cs.AI 83%

Characterizing Linear Alignment Across Language Models

表征语言模型间的线性对齐

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究独立训练的大语言模型间是否存在线性对齐,并探索其在文本生成、嵌入分类、分布外检测及隐私保护跨孤岛推理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25250 2026-05-26 cs.AI 83%

LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design

LipoAgent: 协调微调的大语言模型智能体以实现更安全的脂质设计

Leshu Li, An Lu, Haiyu Wang, Zhibin Feng, Conghui Duan, Qing Bao, Zongmin Zhao, Sai Qian Zhang

机构 * New York University(纽约大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出LipoAgent,一种安全感知的多智能体大语言模型框架,通过条件预测目标强制毒性作为效率预测的前提,并结合多智能体验证,在mRNA转染效率预测上平均相对提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22720 2026-05-22 cs.AI cs.HC 83%

Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

AI 是否会加剧冲突?在冲突情境下LLM部署中的对齐失败

Andrii Kryshtal

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了AI模型在冲突情境下可能产生的对齐失败问题,通过测试九种模型配置,发现其在处理冲突相关场景时存在错误等价、否认种族灭绝和未能识别种族歧视术语等问题,提出了首个评估框架以提高AI在冲突情境下的安全性。

Comments Preprint. 8 pages, 2 figures. Code and evaluation framework: https://github.com/akryshtal/conflict-sensitivity-eval-bloom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20813 2026-05-21 cs.CL 83%

PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models

PulseCol: 周期性刷新的列稀疏注意力用于加速扩散语言模型

Yanyi Lyu, Letian Chen, Futing Sun, Miao Zhang, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出PulseCol,一种周期性刷新的列稀疏注意力方法,通过更细粒度的稀疏化策略提升扩散语言模型的计算效率和加速性能,同时保持模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20179 2026-05-20 cs.CL 83%

TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload

TIDE: 一种高效且无损的MoE扩散大语言模型推理方法

Zhiben Chen, Youpeng Zhao, Yang Sui, Jun Wang, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) Rice University(Rice大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TIDE,一种基于扩散过程块内专家激活时间稳定性的新推理系统,通过引入基于区间的专家刷新策略,优化I/O和CPU计算,实现无损加速,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19929 2026-05-20 cs.CV cs.AI 83%

Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

打破大视觉-语言模型低比特量化中的模态异质性

Yi Zhong, Haotong Qin, Xindong Zhang, Lei Zhang, Guolei Sun

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) D-ITET, ETH Zürich(苏黎世联邦理工学院D-ITET) OPPO Research Institute(OPPO研究院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SplitQ框架,通过通道分割和自适应跨模态校准模块,解决大视觉-语言模型在低比特量化中因模态异质性导致的精度下降问题,显著提升了在多种多模态数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI 83%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏