arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2510.05709 2026-06-05 cs.CR cs.AI cs.CL 81%

Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering

纠正大语言模型基准测试中的提示依赖:一种具有嵌入空间聚类的贝叶斯分层模型

Mary Llewellyn, Isobel Thornton, James Bishop, Annie Gray

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种贝叶斯分层模型,通过嵌入空间聚类来纠正大语言模型基准测试中的提示依赖问题,在数据有限的情况下提供更稳健的性能指标,并在对抗鲁棒性基准测试中实现了性能指标的显著提升。

Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03026 2026-06-03 cs.NE cs.AI cs.LG 81%

Spike-Aware C++ INT8 Inference for Sparse Spiking Language Models on Commodity CPUs

面向稀疏脉冲语言模型在商用CPU上的脉冲感知C++ INT8推理

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种脉冲感知的C++推理运行时,利用稀疏二进制脉冲状态作为执行原语,结合混合布局、AVX2/FMA内核和INT8量化,在商用CPU上实现脉冲语言模型的高效解码,吞吐量优于同等规模稠密模型但质量略逊。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00722 2026-06-02 cs.CL cs.AI 81%

EPIC: Efficient and Parallel Inference under CFG Constraints for Diffusion Language Models

EPIC: 扩散语言模型在上下文无关文法约束下的高效并行推理

Hyundong Jin, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出EPIC框架,通过词法记忆化、Earley解析验证和松弛兼容子集选择,解决扩散语言模型在CFG约束解码中的低效和并行性损失问题,推理时间降低67.5%,额外开销减少90.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29233 2026-06-02 cs.LG cs.AI 81%

BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference

BlockBatch: 面向高效扩散语言模型推理的多尺度共识解码

Xiaoyou Wu, Cheng-Jhih Shih, Binfei Ji, Yong Liu, Yingyan Celine Lin

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出BlockBatch框架,通过多分支并行解码和置信度门控合并,在不训练的情况下加速扩散语言模型推理,平均减少26.6%的去噪步数并实现1.33倍端到端加速。

Comments 23 pages, including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19066 2026-06-02 cs.LG cs.AI 81%

IDLM: Inverse-distilled Diffusion Language Models

IDLM:逆蒸馏扩散语言模型

David Li, Nikita Gushchin, Dmitry Abulkhanov, Eric Moulines, Ivan Oseledets, Maxim Panov, Alexander Korotin

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型推理慢的问题,提出逆蒸馏方法(IDLM),通过理论保证唯一解和梯度稳定松弛,实现4倍至64倍推理加速并保持生成质量。

Comments ICML 2026. We provide the code at: https://david-cripto.github.io/idlm-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31170 2026-06-01 cs.CL cs.AI 81%

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

语言模型智能体群体中的涌现语言:从令牌效率到监督规避

Stine Lyngsø Beltoft, William Brach, Federico Torrielli, Jacob Nielsen, Annemette Brok Pirchert, Filippo Tonini, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学) Slovak University of Technology in Bratislava(布拉迪斯拉发技术大学) University of Turin(都灵大学) Ordbogen A/S(Ordbogen公司)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型智能体群体中涌现的语言,通过规则启发式和零样本分类识别出令牌效率、新自然语言和监督规避三类,发现监督规避语言更难对齐且可被上下文学习,表明仅监控表面行为可能不足以控制智能体群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29626 2026-05-29 cs.CL cs.AI 81%

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

DLM-SWAI: 在扩散语言模型去掩码之前引导它们

Hyeseon An, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的引导方法DLM-SWAI,通过预计算的词级风格分数在去噪步骤中偏置词分布,实现扩散语言模型的可控生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-05-29 cs.LG cs.AI cs.CV 81%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 效率与部署 :language model(title);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Under Review for Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22347 2026-05-29 cs.LG cs.AI 81%

Pushing the Limits of Block Rotations in Post-Training Quantization

推动后训练量化中块旋转的极限

Sai Sanjeet, Ian Colbert, Pablo Monteagudo-Lago, Giuseppe Franco, Yaman Umuroglu, Nicholas J. Fraser

机构 * Advanced Micro Devices, Inc. (AMD)(Advanced Micro Devices公司) State University of New York at Buffalo(纽约州立大学布法罗分校) Norwegian University of Science(挪威科学与技术大学)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PeRQ框架,通过置换和旋转重新分布激活值,以克服块旋转在抑制异常值时的几何限制,显著提升后训练量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09986 2026-05-28 stat.ML cs.CL cs.LG 81%

Federated Language Models Under Bandwidth Budgets: Distillation Rates and Conformal Coverage

带宽预算下的联邦语言模型:蒸馏率与共形覆盖

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究带宽受限节点间分布式语言模型的统计保证,提出联邦探针-对数蒸馏(FPLD)和联邦共形RAG(FC-RAG)两种协议,分别给出训练时的KL一致性率和推理时的无分布边际覆盖界,首次将带宽作为一阶统计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01807 2026-05-28 cs.CL cs.LG 81%

Sentence Curve Language Models

句子曲线语言模型

DongNyeong Heo, Taehwan Kim, Heeyoul Choi

机构 * Ulsan National Institute of Science and Technology(全南国立科学研究所) Handong Global University(翰昂全球大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出句子曲线表示,将扩散语言模型扩展为预测句子曲线而非静态词嵌入,以增强全局结构建模,并在IWSLT14和WMT14上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07190 2026-05-27 cs.CY cs.AI cs.LG 81%

The ATOM Report: Measuring the Open Language Model Ecosystem

ATOM报告:衡量开放语言模型生态系统

Nathan Lambert, Florian Brand

机构 * Interconnects AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过分析约1500个主流开放语言模型(如阿里巴巴的Qwen、DeepSeek、Meta的Llama)的下载量、衍生模型、推理市场份额和性能指标,揭示了2025年夏季中国模型超越美国模型并持续扩大差距的趋势。

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24957 2026-05-26 cs.AI cs.CV cs.LG 81%

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

通过区域感知注意力重校准减轻视觉语言模型中的对象幻觉

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Sixue Lin, Yuteng Xiao

机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) China Telecom Digital Intelligence Technology Co, Ltd(中国电信数字智能技术有限公司) Shenyang Aerospace University(沈阳航空航天大学) Qilu Institute of Technology(齐鲁理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的区域感知自适应加权机制,通过计算注意力头的稳健统计中点并利用跨头分歧动态调整干预预算,以连续惩罚调制抑制幻觉路径,有效纠正视觉语义错位,同时保持生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02544 2026-05-26 cs.LG cs.AI 81%

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

SPA-Cache: 扩散语言模型中的自适应缓存奇异代理

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore, Singapore(数据科学,南洋理工大学,新加坡,新加坡)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型因非因果特性无法使用标准KV缓存导致计算开销大的问题,提出SPA-Cache方法,通过低维奇异代理识别关键令牌并自适应分配缓存预算,实现高达8倍吞吐量提升和2-4倍加速。

Comments Accepted by ICML 2026.The code repository is available at https://github.com/wenhao728/spa-cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23065 2026-05-25 cs.CV cs.AI cs.LG 81%

Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

抖动防御:通过多级 Floyd-Steinberg 抖动实现视觉基础模型的对抗鲁棒性

Yury Belousov, Brian Pulfer, Vitaliy Kinakh, Slava Voloshynovskiy

机构 * Department of Computer Science, University of Geneva, Switzerland(日内瓦大学计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级 Floyd-Steinberg 误差扩散抖动作为轻量级、模型无关的输入变换,以破坏对抗扰动同时保留语义内容,在多个任务和模型上超越或匹配包括基于扩散的去噪在内的基线方法。

Comments Paper accepted at the IEEE International Conference on Image Processing (ICIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21442 2026-05-21 cs.LG cs.AI 81%

torchtune: PyTorch native post-training library

torchtune: 一种基于PyTorch的后训练库

Mark Obozov, Maxime Griot, Joseph Cummings, Evan Smothers, Felipe Mello, Rafi Ayub, Philip John Bontrager, Salman Mohammadi, Ariel Kwiatkowski, Nathan Azrak, Mircea Mironenco

机构 * PyTorch Meta Stanford(斯坦福) Meta-FAIR

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了torchtune,一种基于PyTorch的后训练库,旨在简化大语言模型的后训练生命周期,提供高效的微调、实验和部署流程,通过模块化和可扩展性提升性能和灵活性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16813 2026-05-21 cs.CL cs.AI 81%

Flow Map Language Models: One-step Language Modeling via Continuous Denoising

流映射语言模型:通过连续去噪实现一步语言建模

Chanhyuk Lee, Jaehoon Yoo, Manan Agarwal, Sheel Shah, Jerry Huang, Aditi Raghunathan, Seunghoon Hong, Nicholas M. Boffi, Jinwoo Kim

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于连续流的流映射语言模型,通过在one-hot token嵌入上构建连续流,实现了在质量和速度上优于离散扩散模型的性能,展示了连续流在离散模态生成建模中的潜力。

Comments 58 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16513 2026-05-21 cs.LG cs.AI 81%

FEAT: A Linear-Complexity Foundation Model for Extremely Large Structured Data

FEAT: 一个线性复杂度的超大规模结构化数据基础模型

Zhenghang Song, Tang Qian, Lu Chen, Yushuai Li, Zhengke Hu, Bingbing Fang, Yumeng Song, Junbo Zhao, Sheng Zhang, Tianyi Li

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Aalborg University(奥尔堡大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FEAT,一种线性复杂度的基础模型,用于处理超大规模结构化数据,通过多层双轴编码架构和自适应融合双向状态空间模型,实现线性时间内的跨元组上下文化,同时支持排列不变的表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18702 2026-05-19 cs.LG cs.AI 81%

Distilling Tabular Foundation Models for Structured Health Data

为结构化健康数据 distilling 表格基础模型

Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了如何通过知识蒸馏将表格基础模型的预测行为转移到轻量级表格模型中,通过分层出折教师标签解决上下文泄露问题,在19个医疗数据集上验证了蒸馏学生模型在保持高AUC的同时显著提升了推理速度,并展示了多教师平均法并不总能超越最佳单教师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18654 2026-05-19 cs.LG cs.AI 81%

Pocket Foundation Models: Distilling TFMs into CPU-Ready Gradient-Boosted Trees

口袋基础模型:将TFMs压缩成CPU可用的梯度提升树

Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种将高性能表格基础模型(TFMs)压缩成CPU原生梯度提升树的方法,以解决实时欺诈评分需求与现有模型性能之间的差距,同时在多个数据集上验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18635 2026-05-19 cs.LG cs.AI 81%

Data Presentation Over Architecture: Resampling Strategies for Credit Risk Prediction with Tabular Foundation Models

数据呈现与架构:用于表格基础模型的信用风险预测重采样策略

Aditya Tanna, Mitul Solanki, Mohamed Bouadi, Nassim Bouarour, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在信用风险预测中,通过不同的上下文构建策略对表格基础模型性能的影响,发现上下文构建策略比模型架构对AUC-ROC指标的贡献更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24208 2026-05-19 cs.CL cs.LG 81%

Beyond Neural Incompatibility: Cross-Scale Knowledge Transfer in Language Models through Latent Semantic Alignment

超越神经不兼容:通过潜在语义对齐实现语言模型中的跨尺度知识转移

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SemAlign方法,通过潜在语义对齐实现跨尺度知识转移,解决了不同架构和参数化模型间参数重用受限的问题,通过激活值作为转移介质,利用语义分解与重组稳定地实现知识迁移。

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17653 2026-05-19 cs.LG cs.AI 81%

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge: 多后端硬件感知的神经架构搜索与无限头注意力用于边缘语言模型

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMForge,一种多后端硬件感知的神经架构搜索框架,通过无限头注意力扩展了每层注意力配置空间,并结合Forge-Former和Forge-DSE实现了高效的边缘语言模型架构搜索,最终在不同硬件子系统上获得了不同形状的架构,展示了在不同性能指标上的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16975 2026-05-19 cs.LG cs.AI 81%

Extending Pretrained 10-Second ECG Foundation Models to Longer Horizons

扩展预训练的10秒ECG基础模型以适应更长的时域

Wei Tang, Jinpei Han, Kangning Cui, Mattia Carletti, Fredrik K. Gustafsson, Shreyank N Gowda, Patitapaban Palo, Anshul Thakur, Lei Clifton, Jean-michel Morel, Raymond H. Chan, David A. Clifton, Xiao Gu

机构 * City University of Hong Kong(香港城市大学) Imperial College London(伦敦帝国学院) Wake Forest University(威克森林大学) University of Nottingham(诺丁汉大学) Lingnan University(岭南大学) University of Oxford(牛津大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种参数高效的框架,通过在不重新训练基础模型的情况下扩展预训练的10秒ECG基础模型,使其能够处理更长和可变长度的ECG信号,解决了结构不兼容和语义挑战问题,实验表明其在多个长时域ECG任务中优于滑动窗口和池化基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16378 2026-05-19 cs.LG cs.AI 81%

Mixing Times of Glauber Dynamics on Masked Language Models

掩码语言模型上Glauber动力学的混合时间

Suvadip Sana, Sami Wolf, Neer Mehta, Alina Shah, Aitzaz Shaikh, Janna Goodman, Lionel Levine

机构 * Department of Statistics and Data Science(统计与数据科学系) Cornell University(康奈尔大学) Department of Mathematics(数学系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究掩码语言模型迭代生成时的全局分布行为,通过Glauber动力学马尔可夫链分析其混合时间,揭示在不同温度下混合行为的相变现象。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18134 2026-05-18 cs.AI cs.CL cs.CV 81%

VideoGameBench: Can Vision-Language Models complete popular video games?

VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

机构 * Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。

Comments 10 pages, 38 pages including supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04289 2026-05-15 cs.CL cs.LG 81%

Proxy Compression for Language Modeling

代理压缩用于语言建模

Lin Zheng, Xinyu Li, Qian Liu, Xiachong Feng, Lingpeng Kong

机构 * University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出代理压缩方法,通过联合训练原始字节序列和压缩视图,提升语言模型训练效率,并在代码建模中显著优于纯字节级基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14227 2026-05-15 cs.LG cs.CL 81%

DT-Transformer: A Foundation Model for Disease Trajectory Prediction on a Real-world Health System

DT-Transformer:一种用于真实世界健康系统中疾病轨迹预测的基础模型

Yunying Zhu, Andrew R Weckstein, Kueiyu Joshua Lin, Jie Yang

机构 * Division of Pharmacoepidemiology and Pharmacoeconomics, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(药理流行病学与药效学部,医学部,布里奇沃特医院,哈佛医学院) Harvard T.H. Chan School of Public Health, Harvard University(哈佛大学T.H. 陈公共卫生学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学) Broad Institute of MIT and Harvard, Cambridge, MA, USA(MIT与哈佛大学Broad研究所,剑桥,马萨诸塞州,美国) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出DT-Transformer模型,基于大规模多医院健康数据预测疾病轨迹,验证了其在不同场景下的预测能力,展示了在896种疾病类别上的高AUC表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14360 2026-05-15 cs.LG cs.AI 81%

M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling

M$^2$RNN:基于矩阵值状态的非线性RNN用于可扩展的语言建模

Mayank Mishra, Shawn Tan, Ion Stoica, Joseph Gonzalez, Tri Dao

机构 * MIT-IBM Watson Lab(MIT-IBM沃森实验室) Princeton University(普林斯顿大学) Together AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出M$^2$RNN,通过矩阵值状态和非线性状态转移提升语言建模性能,实验证明其在长序列泛化和大规模语言建模中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09579 2026-05-12 cs.LG cs.AI 81%

Biosignal Fingerprinting: A Cross-Modal PPG-ECG Foundation Model

生物信号指纹:一种跨模态PPG-ECG基础模型

Zhangdaihong Liu, Chang Liu, Fenglin Liu, Yixuan Chen, Yang Yang, David A. Clifton, Xiao Gu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津苏浙先进研究中心) School of Public Health, Shanghai Jiao Tong University(上海交通大学公共卫生学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出生物信号指纹,通过跨模态基础模型M2AE生成紧凑且可迁移的心血管状态表示,实现无需重新训练的多任务应用,在多个任务中表现出色。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏