arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2511.18721 2026-08-11 cs.LG cs.AI 版本更新 79%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21257 2026-08-10 cs.LG cs.AI 版本更新 79%

An Empirical Study of openPangu Quantization on Ascend NPUs

OpenPangu在昇腾NPU上量化的实证研究

Tong Shi, Jiacheng Wang, Hui Xie, Ying Li, Aishan Liu, Jinyang Guo, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文在昇腾910B1 NPU上系统评估了OpenPangu 1B和7B模型在多种后训练量化方法下的表现,发现8-bit权重量化无损,4-bit对7B模型可行但对1B模型有显著损害,极低比特量化仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12617 2026-08-07 cs.LG cs.AI 版本更新 79%

When Drafts Evolve: Speculative Decoding Meets Online Learning

当草稿进化:推测解码与在线学习的交汇

Yu-Yang Qian, Hao-Cong Wu, Yichao Fu, Hao Zhang, Peng Zhao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OnlineSpec框架,利用交互反馈持续进化草稿模型,通过动态遗憾最小化建立在线学习性能与推测系统加速率的联系,实现24%的加速提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02551 2026-08-07 cs.LG cs.AI 版本更新 79%

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

CUDA-L2:通过强化学习超越cuBLAS在矩阵乘法上的性能

Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

机构 * DeepReinforce Team(DeepReinforce 团队)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究提出CUDA-L2系统,结合大语言模型与强化学习自动优化HGEMM的CUDA内核,以CUDA执行速度为奖励,在多种配置上优化。实验表明其在离线和服务器模式下均超越主要基线,证明可通过该方法改进关键内核。

Comments Project code: github.com/ornith-ai/CUDA-L2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11506 2026-08-06 cs.LG cs.AI cs.AR cs.PF 版本更新 79%

RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis

RooflineBench:通过 Roofline 分析为设备端 LLMs 提供的基准测试框架

Zhen Bi, Xueshu Chen, Luoyang Sun, Yuhang Yao, Qing Shen, Jungang Lou, Cheng Deng

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于 Roofline 模型的统一框架,通过操作强度(OI)统一架构原语和硬件约束,引入相对推理潜力作为新指标,分析不同 LLMs 在相同硬件上的效率差异,并揭示序列长度和模型深度对性能和 OI 的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00955 2026-08-05 cs.LG cs.AI cs.IR 版本更新 79%

From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model

从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。

Comments Accepted to IEEE Transactions on Multimedia (T-MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02599 2026-08-04 cs.LG cs.AI 版本更新 79%

RAP: KV-Cache Compression via RoPE-Aligned Pruning

基于RoPE对齐的KV缓存压缩(RAP)

Jihao Xin, Tian Lyu, David Keyes, Hatem Ltaief, Marco Canini

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RAP通过RoPE对齐剪枝技术,有效压缩KV缓存、注意力参数和FLOPs,同时保持模型精度,显著降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04215 2026-08-03 cs.LG cs.AI 版本更新 79%

Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs

预测后扩散:面向扩散大语言模型的自适应响应长度计算

Michael Rottoli, Subhankar Roy, Stefano Paraboschi

机构 * IEEE

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Predict-then-Diffuse框架,通过自适应响应长度预测器和安全机制,实现计算预算下的高效推理,减少计算成本并保持输出质量。

Comments Accepted for publication in IJCNN 2026 (International Joint Conference on Neural Networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 79%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22465 2026-07-28 cs.AI cs.LG cs.MA 版本更新 79%

TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

TRACE-ROUTER:用于智能AI的任务一致且自适应的在线路由

Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel(英特尔公司) Texas A&M University(德克萨斯农工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对企业AI中现有路由决策与智能应用任务级结果不匹配问题,提出TRACE-Router任务级路由框架,利用上下文博弈、终端奖励更新策略,在多基准测试中改善准确性-延迟权衡,取得较好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00078 2026-07-21 eess.AS cs.CL cs.LG cs.SD 版本更新 79%

ChipChat: Low-Latency Cascaded Conversational Agent in MLX

ChipChat:MLX 中的低延迟级联对话代理

Tatiana Likhomanenko, Richard He Bai, Zijin Gu, Zakaria Aldeneh, Shiladitya Dutta, Luke Carlson, Han Tran, Yizhe Zhang, Ruixiang Zhang, Huangjie Zheng, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 探讨实时设备语音代理最佳架构问题,介绍低延迟级联系统 ChipChat,它通过架构创新和流优化克服传统瓶颈,集成多种技术,用 MLX 实现亚秒级响应延迟,为实用语音 AI 代理发展提供新路径。

Comments best demo paper award ASRU 2025

Journal ref ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02668 2026-07-16 cs.CL cs.AI cs.MA 版本更新 79%

Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems

过于礼貌而不反驳:理解多智能体系统中的趋炎附势传播

Vira Kasprova, Amruta Parulekar, Abdulrahman AlRabah, Krishna Agaram, Ritwik Garg, Sagar Jha, Nimet Beyza Bozdag, Dilek Hakkani-Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨多智能体系统中趋炎附势行为的影响,通过实验发现提供趋炎附势先验信息可减少影响、缓解错误连锁反应并提升讨论准确性。

Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), pages 795-814, Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18231 2026-07-16 cs.LG cs.AI 版本更新 79%

NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache

NSNQuant:一种用于KV缓存无校准低比特向量量化的双重归一化方法

Donghyun Son, Euntae Choi, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型KV缓存内存密集问题,NSNQuant提出一种无校准向量量化技术,通过三步变换结合哈达玛变换使令牌分布与标准正态分布对齐,在1比特和2比特设置下优于先前方法,提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25184 2026-06-09 cs.LG cs.AI 版本更新 79%

Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

在移动边缘训练:一种在线验证的提示选择方法用于大型推理模型的高效强化学习训练

Jiahao Wu, Ning Lu, Shengcai Liu, Kun Wang, Yanting Yang, Bailong Lin, Chen Jason Zhang, Li Qing, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学理工大学) Nanyang Technological University(南洋理工大学) Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州))

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HIVE方法,通过历史奖励轨迹和实时提示熵实现高效RL训练,提升提示选择效率而不牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01740 2026-06-08 cs.AI cs.CV cs.LG 版本更新 79%

MACD: Model-Aware Contrastive Decoding via Counterfactual Data

MACD:基于反事实数据的模型感知对比解码

Qixin Xiao, Kun Zhou

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12875 2026-08-20 cs.MA cs.SE 版本更新 78%

MetaInfer: A Knowledge Only LLM Inference Engine Generator SKILL Toolbox

MetaInfer:一个仅基于知识的大语言模型推理引擎生成器SKILL工具包

Zhenwen Miao, Honglin Wang, Mingheng Mi, Pu Wang, Chen Hu, Hai Zhang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对大语言模型推理框架代码复杂、维护成本高的问题,提出MetaInfer方法,通过用户指定运行时约束,利用大语言模型驱动多智能体协作系统结合契约知识库自动生成定制推理框架,并从多视角评估,实现从显式知识生成可运行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12499 2026-08-19 cs.RO 版本更新 78%

Action-Effect Memory Pretraining for Robot Manipulation

动作-效应记忆预训练用于机器人操作

Yijing Zhou, Qiwei Liang, Sitong Zhuang, Jiaxi Li, Xianpeng Wang, Boyang Cai, Yunyang Mo, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学)

专题命中 效率与部署 :pretraining(title,abstract)

AI总结 提出AEM框架,通过视觉-动作历史掩码建模学习紧凑时间表征,提升机器人操作在部分可观测环境下的性能,优于单帧预训练和帧堆叠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23782 2026-08-18 eess.IV cs.CV 版本更新 78%

VesselBridge3D: A Foundation Model Adaptation Framework for Label-Efficient 3D Vessel Segmentation

突破数据壁垒:利用基础模型实现鲁棒的少样本3D血管分割

Kirato Yoshihara, Yohei Sugawara, Yuta Tokuoka, Lihang Hong

机构 * The University of Osaka(大阪大学) Preferred Networks, Inc.(Preferred Networks公司)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出利用预训练视觉基础模型实现鲁棒的少样本3D血管分割,通过3D适配器和多尺度聚合器提升分割性能,在极端少样本情况下取得显著提升。

Comments Accepted at SWITCH+ MICCAI 2026. Code is available at https://github.com/pfnet-research/vesselbridge3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23132 2026-08-17 cs.CV 版本更新 78%

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导

Jaehyuk Jang, Minseok Seo, Seungju Cho, Kangwook Ko, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)

专题命中 效率与部署 :language model(title,abstract)

AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23204 2026-08-14 cs.CV 版本更新 78%

Pathryoshka: Compressing Pathology Foundation Models via Multi-Teacher Knowledge Distillation with Nested Embeddings

Pathryoshka: 通过多教师知识蒸馏与嵌套嵌入压缩病理基础模型

Christian Grashei, Christian Brechenmacher, Rao Muhammad Umer, Jingsong Liu, Carsten Marr, Peter J. Schüffler, Ewa Szczurek

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(马克斯·普朗克研究所慕尼黑分部) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 Pathryoshka通过多教师知识蒸馏与嵌套嵌入技术,显著压缩病理基础模型规模,同时保持性能和精度,提升模型的可部署性与普及性。

Comments Author list in metadata corrected to match the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 78%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01067 2026-08-11 cs.CV 版本更新 78%

ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models

ReACT-CLIP:面向视觉-语言模型的响应感知测试时防御

Hashmat Shadab Malik, Toluwani Aremu, Samuele Poppi, Muzammal Naseer, Salman Khan

专题命中 效率与部署 :language model(title,abstract)

AI总结 ReACT-CLIP是无需训练的响应感知测试时防御,通过跨噪声特征漂移与预测不稳定性得分动态调整修正强度,在多数据集上提升了CLIP类模型的对抗鲁棒性且保留干净准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16854 2026-08-11 cs.CV 版本更新 78%

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

CATP:基于置信度的令牌修剪用于伪装目标检测

Yuhan Gao, Shuhao Kang, Xin He, Bing Li, Ming-Ming Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新 78%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18141 2026-08-07 cs.DC 版本更新 78%

A CXL Memory Rack for Multi-Turn LLM Serving

HyMCache:一种用于多轮大语言模型服务的基于CXL混合内存的键值缓存框架

Hakbeom Jang, Inho Song, Hoshik Kim, Sam H. Noh, Jongryool Kim

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对多轮大语言模型服务中键值缓存重用问题,提出HyMCache框架集成CXL混合内存。利用多轮缓存访问特性优化DRAM管理,通过请求级前缀预取等技术,在真实原型上评估,相比其他方案有性能优势且节省DRAM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23335 2026-08-04 cs.CV 版本更新 78%

DeCLIP: Decoupled Prompting for Multi-Label Class-Incremental Learning with CLIP

DeCLIP:基于CLIP的多标签类增量学习的解耦提示

Kaile Du, Zihan Ye, Junzhou Xie, Yixi Shen, Yuyang Li, Fuyuan Hu, Ling Shao, Guangcan Liu, Joost van de Weijer, Fan Lyu

机构 * School of Automation, Southeast University, China(东南大学自动化学院) University of the Chinese Academy of Sciences, China(中国科学院大学) Suzhou University of Science and Technology, China(苏州科技大学) Computer Vision Center, Spain(西班牙计算机视觉中心)

专题命中 效率与部署 :prompting(title,abstract)

AI总结 DeCLIP通过解耦CLIP表示和引入适应性相似度温控策略,有效提升了多标签类增量学习中的分类性能和抑制假阳性率的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02258 2026-07-30 cs.CV 版本更新 78%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22568 2026-07-29 cs.CV 版本更新 78%

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型

Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin

机构 * SeFi Team(SeFi 团队)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03291 2026-07-29 cs.CV 版本更新 78%

DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers

DopQ-ViT:面向视觉Transformer的分布友好型和离群值感知的模型后训练量化

Lianwei Yang, Haisong Gong, Haokun Lin, Yichen Wu, Caifeng Shan, Zhenan Sun, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 效率与部署 :post-training(title,abstract)

AI总结 针对视觉Transformer高计算成本及后训练量化性能易降问题,提出DopQ-ViT方法,通过引入Tan量化器保留幂律分布、MAD引导的最优缩放因子选择,在分类和检测任务上优于先前PTQ方法。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12839 2026-07-28 cs.DC cs.AR 版本更新 78%

HeteroMosaic: Exposing and Exploiting Heterogeneous Execution Opportunities for Energy-Efficient Edge LLM Inference

HeteroMosaic:为高效能边缘大语言模型推理揭示并利用异构执行机会

Gregory Hyegang Jun, Wesley Pang, Eddie Richter, Mehdi Saeedi, Aporva Amarnath, Pallavi Ferrao, Deming Chen

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对边缘大语言模型推理中异构资源利用不足问题,提出HeteroMosaic框架。通过异构屋顶线模型确定组合iGPU和NPU执行的时机,分解推理为微批次并进行跟踪引导协同优化。在多平台评估中取得显著加速和能耗降低,性能优于现有方案。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏