arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2509.06415 2026-03-05 cs.CV cs.AI cs.CL 81%

Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models

保持索引的轻量级标记修剪用于视觉-语言模型中的高效文档理解

Jaemin Son, Sujin Choi, Inyong Yun

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级标记修剪方法,通过过滤非信息性背景区域来降低视觉-语言模型在文档理解任务中的计算成本,同时保持较高的准确性。

Comments Accepted to ICLR 2026 Workshop MM Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22935 2026-03-05 cs.LG cs.AI 81%

EnECG: Efficient Ensemble Learning for Electrocardiogram Multi-task Foundation Model

EnECG:用于心电图多任务基础模型的高效集成学习

Yuhao Xu, Xiaoda Wang, Jiaying Lu, Sirui Ding, Defu Cao, Huaxiu Yao, Yan Liu, Xiao Hu, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Center for Data Science, School of Nursing, Emory University(埃默里大学护理学院数据科学中心) Bakar Computational Health Sciences Institute, UCSF(旧金山大学巴卡计算健康科学研究所) Department of Computer Science, USC(美国南加州大学计算机科学系) Department of Computer Science, UNC(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 EnECG通过集成多个专门基础模型,高效处理多种ECG任务,降低计算成本并提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02599 2026-03-04 cs.AI cs.LG 81%

SUN: Shared Use of Next-token Prediction for Efficient Multi-LLM Disaggregated Serving

SUN: 为高效多LLM解耦服务实现下一个token预测的共享使用

Sunghyeon Woo, Ahreum Seo, Jaegwang Lee, Jaeeun Kil, Hanbae Seo, Joonghoon Kim, Baeseong Park, Se Jung Kwon, Dongsoo Lee

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 SUN通过共享解码模块提升多LLM服务效率,实现高吞吐量与低TPOT,支持低精度解码。

Comments Preprint, 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00176 2026-03-03 cs.LG cs.AI 81%

Bridging Policy and Real-World Dynamics: LLM-Augmented Rebalancing for Shared Micromobility Systems

弥合政策与现实动态:基于LLM的共享微出行系统再平衡

Heng Tan, Hua Yan, Yu Yang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AMPLIFY框架,通过结合LLM与基础策略,提升共享微出行系统在突发事件下的再平衡效率与收益。

Comments 8 pages, 7 figures, accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21283 2026-03-02 cs.LG cs.AI 81%

DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher

DUET:基于高效上下文化教师的蒸馏式大语言模型去学习

Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu

机构 * George Mason University(乔治·玛森大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 DUET通过结合上下文化和蒸馏方法,实现高效大语言模型去学习,提升遗忘控制与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22231 2026-02-27 eess.SP cs.AI cs.LG 81%

FM-RME: Foundation Model Empowered Radio Map Estimation

FM-RME:基于基础模型的无线电地图估计

Dong Yang, Yue Wang, Songyang Zhang, Yingshu Li, Zhipeng Cai, Zhi Tian

机构 * Department of Computer Science, Georgia State University(乔治亚州立大学计算机科学系) Department of Electrical and Computer Engineering, University of Louisiana at Lafayette(路易斯安那大学拉弗奈分校电气与计算机工程系) Department of Electrical and Computer Engineering, George Mason University(乔治·梅森大学电气与计算机工程系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FM-RME,一种基于基础模型的多维无线电地图估计方法,通过自监督预训练实现零样本泛化,有效结合几何特征提取与注意力机制,提升复杂频谱环境下的估计性能。

Comments 7 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13359 2026-02-27 cs.AI cs.CL 81%

Cost-of-Pass: An Economic Framework for Evaluating Language Models

Cost-of-Pass:语言模型生产力评估的经济框架

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种经济框架,用于评估语言模型的生产力,通过结合准确性和成本,揭示了不同模型在不同任务中的成本效益,并探讨了创新对成本效率的影响。

Comments Code is available at: https://github.com/mhamzaerol/Cost-of-Pass

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10953 2026-02-26 cs.CL cs.AI 81%

Search or Accelerate: Confidence-Switched Position Beam Search for Diffusion Language Models

搜索或加速:基于置信度切换的位置束搜索用于扩散语言模型

Mingyu Cao, Alvaro H. C. Correia, Christos Louizos, Shiwei Liu, Lu Yin

机构 * University of Surrey(塞拉利昂大学) Qualcomm AI Research. Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.(高通人工智能研究) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SOAR通过置信度切换机制优化扩散语言模型的解码过程,提高生成质量并保持推理效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04205 2026-02-24 cs.CL cs.AI 81%

STaRR: Spatial-Temporal Token-Dynamics-Aware Responsive Remasking for Diffusion Language Models

STaRR: 基于空间-时间令牌动态的响应性重掩码以提升扩散语言模型

Xinhao Sun, Huaijin Zhao, Maoliang Li, Zihao Zheng, Jiayu Chen, Yun Liang, Xiang Chen

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 STaRR通过动态调整重掩码策略,提升扩散语言模型的推理速度和输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06106 2026-02-24 cs.CL cs.LG 81%

Efficient Context Propagating Perceiver Architectures for Auto-Regressive Language Modeling

高效上下文传播感知架构用于自回归语言建模

Kaleel Mahmood, Shaoyi Huang

机构 * Department of Computer Science and Statistics, University of Rhode Island, Kingston, RI, USA(计算机科学与统计学系,罗德岛大学,金斯敦,罗德岛州,美国) Department of Computer Science, Stevens Institute of Technology, Hoboken, New Jersey, USA(计算机科学系,史蒂文斯理工学院,霍博肯,新泽西州,美国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ECP架构,通过结合上下文和潜在序列提升自回归语言建模性能,实现高效计算和更优的语言建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19269 2026-02-23 cs.LG cs.CL 81%

CDLM: Consistency Diffusion Language Models For Faster Sampling

CDLM:一致性扩散语言模型用于更快的采样

Minseo Kim, Chenfeng Xu, Coleman Hooper, Harman Singh, Ben Athiwaratkun, Ce Zhang, Kurt Keutzer, Amir Gholami

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CDLM通过一致性建模和块状因果注意力掩码,显著降低扩散语言模型的推断延迟,同时保持在数学和编码任务上的准确性。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03628 2026-02-20 cs.IR cs.AI cs.LG 81%

LLMDistill4Ads: Using Cross-Encoders to Distill from LLM Signals for Advertiser Keyphrase Recommendations at eBay

LLMDistill4Ads: 使用交叉编码器从LLM信号中蒸馏以实现eBay广告商关键词推荐

Soumik Dey, Benjamin Braun, Naveen Ravipati, Hansi Wu, Binbin Li

机构 * eBay Inc(eBay公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 LLMDistill4Ads通过交叉编码器从LLM信号中蒸馏,旨在提升eBay广告商关键词推荐的多样性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14406 2026-02-19 cs.DC cs.AI cs.LG cs.NI 81%

Adaptive Rank Allocation for Federated Parameter-Efficient Fine-Tuning of Language Models

自适应秩分配用于联邦参数高效语言模型微调

Fei Wu, Jia Hu, Geyong Min, Shiqiang Wang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FedARA通过自适应秩分配提升联邦参数高效语言模型微调的性能与通信效率

Journal ref IEEE Transactions on Computers, Jan 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14073 2026-02-18 cs.CL cs.AI 81%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00565 2026-02-18 cs.AI cs.LG 81%

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

迈向更安全的扩散语言模型:发现和缓解提示漏洞

Shojiro Yamabe, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文发现扩散语言模型存在因迭代去噪过程导致的提示漏洞,并提出针对性的安全对齐方法以缓解该问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20293 2026-02-18 cs.LG cs.AI 81%

Beacon: Post-Training Quantization with Integrated Grid Selection

Beacon:集成网格选择的后训练量化

Shihao Zhang, Rayan Saab

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 Beacon 提出了一种无需手动调优的后训练量化方法,通过利用标量量化几何特性自动确定最优缩放因子,实现高效的模型压缩。

Journal ref IEEE Signal Processing Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11695 2026-02-18 cs.LG cs.AI math.OC 81%

Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization

Qronos:通过塑造未来修正过去……在训练后量化中

Shihao Zhang, Haoyu Zhang, Ian Colbert, Rayan Saab

机构 * Department of Mathematics University of California, San Diego(数学系加州大学圣地亚哥分校) Software Architecture Advanced Micro Devices, Inc.(软件架构先进微器件公司) Department of Mathematics & HDSI University of California, San Diego(数学系及HDSI加州大学圣地亚哥分校)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 Qronos通过迭代优化框架在训练后量化中显式纠正误差并超越现有方法,提升模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04942 2026-02-17 cs.LG cs.AI 81%

Privileged Information Distillation for Language Models

特权信息蒸馏用于语言模型

Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste, Laurent Charlin, Massimo Caccia

机构 * McGill University(麦吉尔大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出π-Distill和OPSD两种方法,通过特权信息蒸馏提升语言模型在复杂代理环境中的表现,优于传统监督微调加强化学习的方法。

Comments Abstract border should have been purple

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14301 2026-02-17 cs.LG cs.AI cs.MA 81%

DeepFusion: Accelerating MoE Training via Federated Knowledge Distillation from Heterogeneous Edge Devices

DeepFusion: 通过异构边缘设备的联邦知识蒸馏加速MoE训练

Songyuan Li, Jia Hu, Ahmed M. Abdelmoniem, Geyong Min, Haojun Huang, Jiwei Huang

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦女王玛丽大学电子工程与计算机科学学院) Department of Computer Science, Faculty of Environment, Science and Economy, University of Exeter(埃克塞特大学环境、科学与经济学院计算机科学系) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Beijing Key Laboratory of Petroleum Data Mining, China University of Petroleum(北京石油数据挖掘重点实验室,中国石油大学)

专题命中 效率与部署 :large language model(abstract,comments);language model(abstract,comments);LLM(abstract);分类 cs.AI、cs.LG

AI总结 DeepFusion通过联邦知识蒸馏融合异构边缘设备的LLM知识,实现高效MoE训练,减少通信成本并提升模型性能。

Comments Index Terms: Large language models, Mixture-of-experts, Federated knowledge distillation, Edge device heterogeneity

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 81%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14093 2026-02-17 cs.AI cs.LG 81%

GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training

GUI-GENESIS: 自动合成具有可验证奖励的高效环境以实现GUI代理训练

Yuan Cao, Dezhi Ran, Mengzhou Wu, Yuzhe Guo, Xin Chen, Ang Li, Gang Cao, Gong Zhi, Hao Yu, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE SCS, Peking University, Beijing, China Tencent Inc., Shenzheng, China Hong Kong University of Science Department of Computer Science, University of Texas at Dallas, Richardson, USA School of Computing Science, Simon Fraser University, Burnaby, BC, Canada

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 GUI-GENESIS通过自动合成高效GUI训练环境并提供可验证奖励,显著提升了GUI代理的训练效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12470 2026-02-16 cs.LG cs.AI 81%

Designing RNAs with Language Models

用语言模型设计RNA

Milan Gautam, Ning Dai, Tianshuo Zhou, Bowen Xie, David Mathews, Liang Huang

机构 * School of EECS Dept. of Biochemistry \& Biophysics , Oregon State University , USA Center for RNA Biology Computational Biology , University of Rochester Medical Center , USA

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出用自回归语言模型进行RNA设计,通过监督学习和强化学习优化,实现高效生成目标结构的序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11287 2026-02-16 cs.LG cs.AI cs.AR 81%

HiFloat4 Format for Language Model Inference

HiFloat4格式用于语言模型推断

Yuanyong Luo, Jing Huang, Yu Cheng, Ziwei Yu, Kaihua Tang, Xinda Ma, Xin Wang, Anping Tong, Guipeng Hu, Yun Xu, Mehran Taghian, Peng Wu, Guanglin Li, Yunke Peng, Tianchi Hu, Minqi Chen, Michael Bi Mi, Hu Liu, Xiping Zhou, Junsong Wang, Qiang Lin, Heng Liao

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 HiFloat4通过优化块浮点格式提升语言模型推断的精度与效率,减少硬件资源消耗。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18868 2026-02-12 cs.LG cs.AI 81%

KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits

KernelBand: 通过硬件感知的多臂老虎机实现基于LLM的核优化

Dezhi Ran, Shuxiao Xie, Mingfang Ji, Anmin Liu, Mengzhou Wu, Yuan Cao, Yuzhe Guo, Hao Yu, Linyi Li, Yitao Hu, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(北京大学)) SCS, Peking University, Beijing, China(SCS,北京大学,北京,中国) Hong Kong University of Science(香港科学大学) East China Normal University, Shanghai, China(华东师范大学,上海,中国) Department of Computer Science, Tianjin University, Tianjin, China(天津大学计算机科学系,天津,中国) School of Computing Science, Simon Fraser University, Burnaby, BC, Canada(Simon Fraser大学计算机科学学院,Burnaby,BC,加拿大) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校,美国) Beijing Tongming Lake Information Technology Application Innovation Center, China(北京同铭湖信息技术应用创新中心,中国) Fudan University Institute of Systems for Advanced Computing, China(复旦大学高级计算系统研究所,中国) Shanghai Institute of Systems for Open Computing, China(上海开放计算系统研究所,中国)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 KernelBand通过硬件感知的多臂老虎机框架,实现基于LLM的核优化,显著提升性能。

Comments 19 pages (9 pages main text), 4 figures. v2: Full revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16054 2026-02-11 cs.CL cs.AI 81%

Learning Tractable Distributions Of Language Model Continuations

学习可 tractable 的语言模型延续分布

Gwen Yidou-Weng, Ian Li, Anji Liu, Oliver Broadrick, Yuchen Cui, Guy Van den Broeck, Benjie Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 LTLA通过结合神经网络和隐马尔可夫模型,提高语言模型延续的可 tractable 性,实现更高效的解码和更强的约束控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07397 2026-02-10 cs.LG cs.AI 81%

Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference

在参加之前侦察:Sketch-and-Walk稀疏注意力用于高效的LLM推理

Hoang Anh Duy Le, Sahil Joshi, Zeyu Yang, Zhaozhuo Xu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系, Rice大学) Department of Computer Science, Stevens Institute of Technology(计算机科学系, Stevens理工学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 Sketch&Walk通过无需训练的稀疏注意力方法,在高效LLM推理中实现高精度和速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07051 2026-02-10 cs.CV cs.AI cs.LG cs.NE 81%

Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning

神经哨兵:用于车牌识别的统一视觉语言模型(VLM)与人类在循环持续学习

Karthik Sivakoti

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Neural Sentinel利用视觉语言模型实现车牌识别与多任务学习,提升准确率并减少系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 81%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20125 2026-02-10 cs.LG cs.AI 81%

Membership Inference Attacks Against Fine-tuned Diffusion Language Models

针对微调扩散语言模型的成员推断攻击

Yuetian Chen, Kaiyuan Zhang, Yuntao Du, Edoardo Stoppa, Charles Fleming, Ashish Kundu, Bruno Ribeiro, Ninghui Li

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Cisco Research(思科研究)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAMA方法,通过稳健聚合解决稀疏信号挑战,显著提升对微调扩散语言模型的成员推断攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04341 2026-02-09 stat.ML cs.AI cs.LG 81%

Efficient Perplexity Bound and Ratio Matching in Discrete Diffusion Language Models

离散扩散语言模型中的高效困惑度界与比率匹配

Etrit Haxholli, Yeti Z. Gurbuz, Ogul Can, Eli Waxman

机构 * MetaDialog Research(MetaDialog研究)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种改进的离散扩散语言模型框架,通过比率匹配和新的定理推导,提升了模型的生成性能和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏