arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 151 篇

2601.06199 2026-06-02 eess.AS cs.AI cs.SD 70%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18115 2026-06-02 cs.LG cs.DS math.OC 70%

Robust Learning of a Group DRO Neuron

群体分布鲁棒优化神经元的鲁棒学习

Guyang Cao, Shuyao Li, Sushrut Karmalkar, Jelena Diakonikolas

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft Research, Cambridge(微软研究院,剑桥)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对任意标签噪声和群体级分布偏移,提出一种计算高效的原对偶算法,学习一个单神经元,使其在最小化最坏情况群体加权损失时达到常数因子竞争比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06906 2026-06-02 cs.SE cs.CR cs.DB cs.LG 70%

MINES: Explainable Anomaly Detection through Web API Invariant Inference

MINES:通过Web API不变式推断实现可解释的异常检测

Wenjie Zhang, Yun Lin, Chun Fung Amos Kwok, Xiwen Teoh, Xiaofei Xie, Frank Liauw, Hongyu Zhang, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Shanghai Jiao Tong University(上海交通大学) Singapore Management University(新加坡管理学院) GovTech Singapore(新加坡政府科技局) Chongqing University(重庆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出MINES方法,通过从模式级别推断可解释的API不变式来检测Web应用异常,显著降低误报率并提高召回率。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12354 2026-06-02 cs.IR 67%

An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking

用于领英信息流排序的工业级序列推荐系统

Lars Hertel, Gaurav Srivastava, Syed Ali Naqvi, Satyam Kumar, Yue Zhang, Borja Ocejo, Benjamin Zelditch, Adrian Englhardt, Hailing Cheng, Andy Hu, Antonio Alonso, Daming Li, Siddharth Dangi, Chen Zhu, Mingzhou Zhou, Wanning Li, Tao Huang, Fedor Borisyuk, Ganesh Parameswaran, Birjodh Singh Tiwana, Sriram Sankar, Qing Lan, Julie Choi, Souvik Ghosh

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出基于Transformer的序列排序模型Feed SR,在满足严格生产约束下替代DCNv2排序器,在12亿成员规模上部署,在线A/B测试显著提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00991 2026-06-02 cs.DC 67%

An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters

大规模GPU训练集群中高效、可靠且可观测的集合通信库

Mingjun Zhang, Xiaohe Hu, Menghao Zhang, Ziteng Chen, Yanmin Jia, Yan Zhang, Da Liu, Qing Chen, Fangzheng Jiao, Jun Chen, He Liu, Aohan Zeng, Shuaixing Duan, Ruya Gu, Yang Jing, Bowen Han, Wei Chen, Wenqi Xie, Jinlong Hou, Yuan Cheng, Hongzhou Zhang, Bohua Xu, Mingwei Xu, Chunming Hu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对NCCL在SM竞争、链路故障重启成本高和瞬态异常可观测性不足的问题,提出VCCL,通过将节点内数据传输和流依赖强制转移到CPU线程和GPU拷贝引擎、主备QP机制以及窗口监控器,实现高效、可靠和可观测的集合通信,提升训练吞吐量并减少GPU资源浪费。

Comments 19 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02483 2026-06-02 cs.CR cs.AI cs.CL 62%

Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools

幽灵工具调用:投机性智能体工具的发布时隐私保护

Bardia Mohammadi, Lars Klein, Akhil Arora, Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) EPFL(苏黎世联邦理工学院) Aarhus University(阿arhus大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对工具增强型语言智能体投机性预发调用泄露用户意图的问题,提出投机性工具隐私契约,在发布时而非提交后保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01503 2026-06-02 cs.CV cs.AI cs.CL 62%

On the Limits of Token Reduction for Efficient Unified Vision Language Training

论高效统一视觉语言训练中令牌缩减的极限

Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

机构 * University of Michigan(密歇根大学) Sony AI(索尼人工智能)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析层注意力分配,发现视觉理解与视觉生成在令牌冗余上存在不对称性,设计任务特定加速器,但统一训练中任务特定令牌丢弃导致协同损失,表明高效统一建模需保留共享跨任务结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01039 2026-06-02 cs.LG cs.AI 62%

OPD+: Rethinking the Advantage Design for On-Policy Distillation

OPD+: 重新思考在线策略蒸馏中的优势设计

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Meta Capital One

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPD+,通过修正在线策略蒸馏中因停止梯度操作导致的奖励目标偏差,并支持多种f-散度,在数学推理和工具使用基准上提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25143 2026-06-02 cs.AI cs.LG 62%

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

超越前沿:用于高效测试时扩展的随机回溯

Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19496 2026-06-02 cs.CV cs.AI cs.LG 62%

CARES: Context-Aware Resolution Selector for VLMs

CARES: 面向视觉语言模型的上下文感知分辨率选择器

Moshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz

机构 * Technion(技术ion大学) IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Ben-Gurion University(本· Gurion大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CARES轻量级预处理模块,通过紧凑型VLM预测图像-查询对的最小足够分辨率,在保持任务性能的同时最多减少80%计算量。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) Accepted to ACL 2026 (Oral presentation). Code available at https://github.com/mkimhi/CARES

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19919 2026-06-02 cs.CL cs.AI cs.SD 62%

ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition

ASKD-Whisper: 自适应自知识蒸馏用于高效低延迟自动语音识别

Junseok Lee, Nahun Kim, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Co., Ltd(OKESTRO公司) Sejong University(世宗大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应自知识蒸馏(ASKD)动态课程框架,通过逐步减少对教师模型的依赖并引入自知识蒸馏阶段,在压缩Whisper模型时实现5倍推理加速和1.07%词错误率降低。

Comments Title and content have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10982 2026-06-02 cs.LG cs.AI 62%

Catch-Only-One: Non-Transferable Examples for Model-Specific Authorization

仅捕获一个:用于模型特定授权的不可迁移样本

Zihan Wang, Zhiyong Ma, Zhongkui Ma, Shuofeng Liu, Akide Liu, Derui Wang, Minhui Xue, Guangdong Bai

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出不可迁移样本(NTEs),通过将数据编码为仅能被指定模型解码的“密文”,在无需训练的情况下利用模型特定低敏感子空间实现授权模型保真度与未授权模型性能退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02142 2026-06-02 cs.LG cs.DB 57%

TimeBlocks: Foundational and Continual Time-Series Blockbase -- Extended Version

TimeBlocks: 基础与持续时间序列块库——扩展版本

David Campos, Bin Yang, Tung Kieu, Lei Chen, Chenjuan Guo, Christian S. Jensen

机构 * Aalborg University, Denmark(奥尔堡大学,丹麦) University of Amsterdam Netherlands(阿姆斯特丹大学,荷兰) East China Normal University China(华东师范大学,中国) Aalborg University Denmark(奥尔堡大学,丹麦) Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出TimeBlocks方法,通过可互换的模块化模型块和路由策略,构建轻量级、多任务的时间序列模型,并引入StreamCore实现持续校准,在多个数据集上优于现有基线。

Comments 15 pages. An extended version of "TimeBlocks: Versatile and Continual Time-Series Blockbase" accepted at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02068 2026-06-02 cs.CV cs.AI 57%

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

基于可微多平面图像的快速轻量级新视角合成

Kaidi Zhang, Guanxu Zhu

机构 * Universiti Malaya(马来大学) Wuhan University(武汉大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 针对现有方法在速度、模型大小和稀疏视角下的不足,提出基于可微多平面图像(MPI)的快速轻量级新视角合成方法,利用点图进行几何初始化并引入一步扩散处理空洞和伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01813 2026-06-02 cs.CL 57%

Cost-Aware Diffusion Draft Trees for Speculative Decoding

用于推测解码的成本感知扩散草稿树

Shuai Zhang, Huachuan Qiu, Hongliang He, Yong Dai

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 提出CaDDTree方法,通过联合优化树结构和节点预算直接最大化令牌吞吐量,并证明在凸验证成本下吞吐量函数是单峰的,从而无需离线预算搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00390 2026-06-02 cs.CV cs.AI 57%

Zamba2-VL Technical Report

Zamba2-VL 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00047 2026-06-02 cs.CY cs.AI 57%

Comprehensive AI governance requires addressing non-model gains

全面的人工智能治理需要解决非模型增益问题

Arthur Goemans, Dan Altman, Noemi Dreksler, Jonas Freund, Milan Gandhi, Zhengdong Wang, Sarah Cogan, Sebastien Krier, Demetra Brady, Lewis Ho, Allan Dafoe

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Open Philanthropy(开放哲学基金会)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。

Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31490 2026-06-02 cs.CL 57%

Are Full Rollouts Necessary for On-Policy Distillation?

在线策略蒸馏是否必须完整展开?

Yaocheng Zhang, Jiajun Chai, Yuqian Fu, Songjun Tu, Xiaohan Wang, Wei Lin, Guojun Yin, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Meituan(美团) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL

AI总结 本文针对在线策略蒸馏(OPD)中完整展开计算成本高且早期训练时教师反馈不可靠的问题,提出渐进式OPD(POPD)和截断式OPD(TOPD)两种展开长度控制策略,在数学推理任务上实现高达3倍训练效率提升,并显著减少内存占用。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29977 2026-06-02 cs.CV cs.LG 57%

EVL-ECG: Efficient ECG Interpretation With Multi-Aspect Heterogeneous Knowledge Distillation

EVL-ECG:面向多视角异构知识蒸馏的高效心电图解读

Dang Nguyen Hong, Nhi Ngoc-Yen Nguyen, Huy-Hieu Pham

机构 * University of Notre Dame(诺丁汉大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出EVL-ECG框架,通过多头交叉注意力对齐、最优传输视觉特征匹配和几何结构关系匹配三种创新方法,实现跨架构知识蒸馏,在资源受限环境下高效解读心电图。

Comments 7Accepted at the SD4H Workshop at ICML 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19532 2026-06-02 cs.SD cs.AI 57%

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

BEAT: 通过均匀时间步对符号音乐进行分词和生成

Lekai Qian, Haoyu Gu, Jingwei Zhao, Ziyu Wang

机构 * South China University of Technology(南方科技大学) National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) New York University(纽约大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出一种以均匀节拍为基本单元的分词方法,将同一时间步内相同音高的所有事件编码为一个令牌,并在音乐续写和伴奏生成任务中验证其相比传统事件基方法能提升音乐质量和结构连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04430 2026-06-02 cs.LG 57%

Flowers: A Warp Drive for Neural PDE Solvers

Flowers: 神经PDE求解器的曲速引擎

Till Muser, Alexandra Spitzer, Matti Lassas, Maarten V. de Hoop, Ivan Dokmanić

机构 * ETH Zurich(苏黎世联邦理工学院) University of Helsinki(赫尔辛基大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出Flowers架构,通过多头扭曲场实现线性代价的自适应全局交互,在2D/3D时变PDE基准上超越傅里叶、卷积和注意力基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14411 2026-06-02 cs.LG 57%

Byte Pair Encoding for Efficient Time Series Forecasting

用于高效时间序列预测的字节对编码

Leon Götz, Marcel Kollovieh, Stephan Günnemann, Leo Schwinn

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出基于频繁模式的字节对编码方法,通过自适应压缩时间序列为令牌,显著提升预测性能与效率。

Comments 32 pages in total, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04512 2026-06-02 cs.AI 57%

Safety Must Precede the Deployment of Open-Ended AI

安全必须优先于开放式AI的部署

Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi, Ruta Binkyte, Mario Fritz

机构 * CISPA-Helmholtz Center of Information Security(CISPA-海德堡信息安全中心) MPI for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(智能系统Max Planck研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出开放式AI系统因自主无限生成新行为而带来预测性丧失、新兴错位和控制困难等独特安全挑战,需在部署前主动研究,并给出挑战分类和研究方向。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01513 2026-06-02 cs.DC cs.AI cs.CL cs.LG 56%

Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense

基于合规评分的Best-of-N护栏编排用于支付争议防御中的多模态文档生成

Nataraj Agaram Sundar, Tejas Morabia

机构 * eBay Inc.(eBay公司)

专题命中 效率与部署 :分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 提出一种结合多候选生成与合规评分早退机制的护栏编排层,通过并行生成、加权评分和最佳输出选择,在支付争议防御场景中实现高合规率与低延迟。

Comments 8 pages, 7 figures, 4 tables. Preprint. Applied systems paper on compliance-scored guardrail orchestration for multimodal LLM document generation. Contains aggregate operational readouts; not a randomized A/B test

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 50%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00999 2026-06-02 cs.CV 50%

SWARD: Stochastic Window-Attention-Based Relational Distillation for Cross-Architectural Semantic Segmentation

SWARD:基于随机窗口注意力的关系蒸馏用于跨架构语义分割

Aditya Makineni, Qing Tian

机构 * Department of Computer Science University of Alabama at Birmingham(计算机科学系阿拉巴马大学伯明翰分校)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出SWARD框架,通过多尺度窗口注意力蒸馏和原型判别正则化,弥合Transformer教师与CNN学生之间的表征差距,实现跨架构语义分割的知识蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00957 2026-06-02 cs.CV 50%

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化

Yiming Zhao

机构 * Yiming Zhao(赵毅铭)

专题命中 效率与部署 :post-training(abstract)

AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。

Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21421 2026-06-02 cs.CV 50%

AIGaitor: Privacy-preserving and cloud-free motion analysis for everyone, using edge computing

AIGaitor: 面向所有人的隐私保护与无云端运动分析——基于边缘计算

Lauhitya Reddy, Trisha M. Kesar, Hyeokhyen Kwon

机构 * Department of Biomedical Informatics, Emory University(埃默里大学生物医学信息学系) Department of Rehabilitation Medicine, Emory University(埃默里大学康复医学系) The Wallace H. Coulter Department of Biomedical Engineering, Emory University and Georgia Institute of Technology(埃默里大学和佐治亚理工学院的Wallace H. Coulter生物医学工程系)

专题命中 效率与部署 :language model(abstract)

AI总结 提出AIGaitor系统,在智能手机上利用边缘计算实现无标记单目运动捕捉与深度学习分析,解决成本、隐私和易用性问题。

Comments 18 pages 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09503 2026-06-02 cs.CV 50%

PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

PermuQuant:通过重新排列通道降低扩散模型每组量化误差

Yongsen Cheng, Kai Liu, Kaiwen Tao, Junxian Li, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出PermuQuant框架,通过基于联合二阶矩的通道重排序和校准接受规则,降低低比特扩散模型每组量化误差,实现显著加速和内存压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19848 2026-06-02 cs.CV 50%

DerMAE: Improving skin lesion classification through conditioned latent diffusion and MAE distillation

DerMAE: 通过条件潜在扩散和MAE蒸馏改进皮肤病变分类

Francisco Filho, Kelvin Cunha, Fábio Papais, Emanoel dos Santos, Rodrigo Mota, Thales Bezerra, Erico Medeiros, Paulo Borba, Tsang Ing Ren

机构 * Universidade Federal do Pernambuco(佛罗里达州帕尔马大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 针对皮肤病变分类中恶性样本不足导致的类别不平衡问题,提出使用类别条件扩散模型生成合成图像,结合自监督MAE预训练学习鲁棒特征,并通过知识蒸馏将大模型知识迁移至轻量级ViT学生模型,在提升分类性能的同时实现高效设备端推理。

Comments 4 pages, 2 figures, 1 table, Published in: 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏