arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2603.26556 2026-07-20 cs.CL cs.AI 版本更新 62%

When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

当困惑度谎言:面向生成的混合序列模型蒸馏

Juan Gabriel Kostelec, Qinghai Guo

机构 * Huawei Zurich Research Center(华为苏黎世研究中心) ACS Lab, Huawei Technologies(华为技术有限公司ACS实验室)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Hybrid-KDA架构与GenDistill蒸馏流程,通过生成导向评估揭示传统困惑度评估的局限性,并展示改进后的模型在知识基准上的高准确率与内存效率提升。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15927 2026-07-20 cs.LG cs.AI 版本更新 62%

DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone

DiffuMamba:基于Mamba架构的高吞吐量扩散语言模型

Vaibhav Singh, Oleksiy Ostapenko, Pierre-André Noël, Eugene Belilovsky, Torsten Scholak

机构 * ServiceNow Research, Montreal, Canada(ServiceNow研究机构,加拿大蒙特利尔) Concordia University(Concordia大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 DiffuMamba基于Mamba架构,通过结合扩散目标与线性序列建模,实现了高吞吐量的扩散语言模型,在长序列任务中表现出色。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12466 2026-07-16 cs.CV cs.AI cs.LG 版本更新 62%

Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

Inverse-LLaVA:通过文本到视觉映射重新思考多模态对齐

Xuhui Zhan, Tyler Derr

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究重新审视多模态学习中传统映射方向,提出Inverse-LLaVA架构,通过文本到视觉映射反转方向。该架构无需对齐预训练,在多模态基准测试中展现强大学习效率,为多模态架构设计开辟新方向,解耦表示结构与监督方式。

Comments 19pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27321 2026-07-15 cs.LG cs.AI 版本更新 62%

Beyond the Hard Budget: Sparsity Regularizers for More Interpretable Top-k Sparse Autoencoders

超越硬预算:用于更可解释的Top-k稀疏自编码器的稀疏正则化器

Nathanaël Jacquier, Maria Vakalopoulou, Mahdi S. Hosseini

机构 * Université Paris-Saclay, CentraleSupélec, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,法国) Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, QC, Canada(计算机科学与软件工程系,康科迪亚大学,加拿大) Mila–Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所,加拿大) Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,路易·德·鲁斯医院,国家医学研究院,PRISM机构,癌症数据科学单位,法国) Université Paris-Saclay, CentraleSupélec, MICS Laboratory, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,MICS实验室,法国)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对Top-k稀疏自编码器固定预算k和过拟合问题,提出两种稀疏正则化器(ℓ1惩罚和ℓ1/ℓ2比例惩罚),在不损失重构质量的前提下提高单语义性,并增强对推理时k选择的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06763 2026-07-14 cs.LG cs.CL 版本更新 62%

Trees from Marginals: Autoregressive drafting with factorized priors

基于边际的树:具有因式先验的自回归草稿生成

Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究自回归语言模型中推测性解码的局限性,提出用Weaver适配器从因式草稿生成器边际构建提议树,恢复条件依赖,还推导算法并实现内核,结合模型与系统贡献,相比自回归解码加速4.37倍,性能超DFlash基线24.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00620 2026-07-14 cs.LG cs.AI 版本更新 62%

Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference

重新思考零样本时间序列分类:从特定任务分类器到上下文推理

Juntao Fang, Shifeng Xie, Shengbin Nie, Yuhui Ling, Yuming Liu, Zijian Li, Keli Zhang, Lujia Pan, Themis Palpanas, Ruichu Cai

机构 * Guangdong University of Technology, Guangzhou, China(广东工业大学) Paris Descartes University, Paris, France(巴黎笛卡尔大学) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学) Huawei Noah’s Ark Lab, Paris, France(华为诺亚实验室) Huawei Noah’s Ark Lab, Shenzhen, China(华为诺亚实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对时间序列基础模型零样本分类中存在的问题,提出TIC-FM上下文学习框架,将训练集作上下文,单次前向传播预测标签,无需参数更新,经实验验证其在多数据集上表现良好,实现无训练迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13563 2026-07-09 cs.LG cs.AI 版本更新 62%

ButterflyMoE: Compression-Scalable Ternary Experts via Structured Butterfly Orbits

ButterflyMoE: 通过结构化的蝴蝶轨道实现子线性三次专家

Aryan Karmore

机构 * Indian Institute of Information Technology, Nagpur(印度纳格浦信息科技学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 ButterflyMoE通过结构化的蝴蝶轨道实现子线性三次专家,有效降低内存消耗并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 62%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04805 2026-07-07 cs.LG cs.AI 版本更新 62%

PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference

PuzzleMoE:通过稀疏专家合并和位打包推理对大型专家混合模型进行高效压缩

Yushu Zhao, Zheng Wang, Minjia Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对专家混合模型内存开销大难题,提出PuzzleMoE方法。通过识别权重冗余与专业化进行稀疏专家合并,用双掩码捕获参数,引入位打包编码避免存储开销,实现高效推理,大幅压缩模型且保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15438 2026-06-25 cs.LG cs.AI stat.ML 版本更新 62%

Logit Distance Bounds Representational Similarity

Logit距离界限表征相似性

Beatrix M. G. Nielsen, Emanuele Marconato, Luigi Gresele, Andrea Dittadi, Simon Buchholz

机构 * IT University of Copenhagen, Denmark(丹麦IT大学) University of Trento, Italy(意大利特伦托大学) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究判别模型在分布接近时内部表征是否线性相似,提出基于logit差异的距离度量,证明其能保证线性相似性,并用于蒸馏实验提升学生模型表征相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 62%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10178 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新 62%

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

从马尔可夫到拉普拉斯:Mamba如何通过上下文学习马尔可夫链

Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

机构 * EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Télécom Paris(巴黎电信学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究Mamba在马尔可夫链上的上下文学习能力,发现单层Mamba能高效学习最优的拉普拉斯平滑估计器,并理论上揭示了卷积在其中的关键作用。

Comments Oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05985 2026-06-23 cs.LG cs.AI cs.NE 版本更新 62%

LAYUP: Asynchronous decentralized gradient descent with LAYer-wise UPdates

LAYUP: 基于逐层更新的异步去中心化梯度下降

Cabrel Teguemne Fokam, Marcel Nieveler, Lukas König, Khaleelulla Khan Nazeer, David Kappel, Anand Subramoney

机构 * Center for Cognitive Interaction Technology, Universität Bielefeld, Germany(认知交互技术中心,比勒菲尔德大学,德国) Bielefeld University(比勒菲尔德大学) Department of Computer Science, Royal Holloway, University of London, United Kingdom(计算机科学系,伦敦大学皇家霍洛威学院,英国)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出异步去中心化SGD方法LayUp,通过逐层更新和随机gossip通信减少参数漂移,理论证明收敛性,实验显示比同步训练快32%,比同类算法快27%。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15707 2026-06-19 cs.MM cs.CL cs.LG 版本更新 62%

Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU

基于音频和IMU的主动式程序性任务对话助手

Rehana Mahfuz, Yinyi Guo, Erik Visser, Phanidhar Chinchili

机构 * Qualcomm Technologies, Inc.(高通技术公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出首个仅使用音频和IMU模态的实时对话助手,通过微调语言模型减少不必要对话并提升问答准确性,在边缘设备上实现无云依赖。

Comments 5 figures. 5 more in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07048 2026-06-10 cs.SD cs.AI cs.LG eess.AS 版本更新 62%

Whisfusion: Parallel ASR Decoding with Masked Diffusion

Whisfusion: 基于掩码扩散的并行ASR解码

Taeyoun Kwon, Junhyuk Ahn, Taegeun Yun, Heeju Jwa, Yoonchae Choi, Siwon Park, Jongchan Kim, Hyungon Ryu, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Whisfusion,在冻结的Whisper音频嵌入上训练专用掩码扩散解码器,通过并行扩散解码实现非自回归ASR,在多种语言基准上超越Whisper-large-v3,速度提升4-5倍。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09967 2026-06-09 cs.LG cs.AI 版本更新 62%

Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning

Muon²:通过自适应二阶矩预条件提升穆隆

Ziyue Liu, Ruijie Zhang, Zhengyang Wang, Yequan Zhao, Yupeng Su, Zi Yang, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣巴巴拉分校) University at Albany, SUNY(阿尔巴尼大学,SUNY)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 Muon²通过引入Adam风格的自适应二阶矩预条件改进了穆隆的效率与质量,提升了极化近似中的收敛速度和实际正交化质量,实验表明其在参数规模达13B的预训练任务中表现更优。

Comments Preprint, subject to update

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25054 2026-06-08 cs.LG cs.AI 版本更新 62%

Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

按需扩展:自适应神经元级混合精度量化感知训练

Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas, Adam Orucu, Aneta Vulgarakis Feljan

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维) University of Cambridge(剑桥大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出神经元级混合精度量化感知训练(NMP-QAT),通过可微代理和直通估计器让每个神经元独立学习离散精度,实现按需扩展位宽,在MLP和表格基础模型上取得更优的压缩-精度权衡。

Comments Accepted at ICML - GlobalSouthML workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09222 2026-08-24 cs.CL q-bio.NC 版本更新 57%

Reading Cognition as Decisions Unfold in Words: A Factorized Inverse Decision Model

将决策过程的阅读认知解读为文字展开过程:一种因子化解码策模型

Jiawen Kang, Dongrui Han, Xixin Wu, Helen Meng

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 该研究针对现有逆决策建模未覆盖言语化认知任务响应动态的问题,提出FIDM模型,在400名老年人的杂货购物对话任务数据上验证其可选择性估计因子、保留动作差异,且能提升认知状态分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01281 2026-08-24 eess.AS cs.LG 版本更新 57%

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

适用于跨声调与非声调语言的数据高效音素级多语种自动语音识别的潜在Softmax方法

Saierdaer Yusuyin, Nanling Jiang, Hao Huang, Zhijian Ou

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 该研究针对多语种ASR中声调与非声调语言监督粒度不匹配的问题,提出Latent Softmax方法,在多语种语音识别实验中显著降低音素与混合错误率,提升了跨语言语音识别性能。

Comments Add Proof of Equations for CTC Likelihood with Latent Softmax

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17886 2026-08-24 cs.CV cs.CL 版本更新 57%

When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA

当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用

Pume Tuchinda, Parinthapat Pengpun, Romrawin Chumpu, Patomporn Payoungkhamdee, Sarana Nutanong, Peerat Limkonchotiwat

机构 * VISTEC Bangkok Christian International School(巴吞普林国际学校) AI Singapore(AI新加坡)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18853 2026-08-21 eess.SY cs.LG cs.SY 版本更新 57%

Learn for Variation: Efficient AAV Trajectory Learning through a Differentiable Wireless World Model

为变化学习:在可微环境中变分引导的AAV轨迹学习

Xiucheng Wang, Zhenye Chen, Nan Cheng, Zhisheng Yin, Xuemin Shen

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院) School of Aerospace Science and Technology, Xidian University(航天学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本文提出L4V框架,通过变分引导解决AAV轨迹规划中的奖励驱动强化学习问题,利用密集政策梯度提升任务完成效率和传输速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19997 2026-08-21 cs.CL 版本更新 57%

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

当情境推理失效时:交互指令跟随中的可取消性

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL

AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16873 2026-08-19 cs.LG 版本更新 57%

A Data-Efficient Analytical Prior Machine Learning Framework for Sound Reduction Frequency Prediction in Helmholtz Resonators

用于矩形侧支亥姆霍兹消声器降噪频率数据高效预测的分析先验框架

Jiaming Li

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本研究提出分析先验学习框架,复用低成本分析模型提升有限高保真模拟数据下的预测效率,在矩形侧支亥姆霍兹消声器降噪频率预测中,其性能优于直接学习方法,可满足不同部署需求。

Comments 13 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09520 2026-08-19 cs.CV cs.AI 版本更新 57%

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

眼见无需耗能,言语却要代价:揭示边缘视觉语言模型推理中的真正能量瓶颈

Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, Tengjiao He

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Jinan University(暨南大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 研究边缘VLM推理的能量瓶颈,通过系统能量分析发现平均推理功率恒定,输出令牌耗时多是关键,图像复杂度因输出长度影响能量,揭示视觉令牌修剪局限,控制输出长度能大幅节能。

Comments Accepted to ACM MM 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08642 2026-08-19 cs.CL 版本更新 57%

DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

DominoTree:使用Domino进行条件树结构草稿的推测性解码

Saw S. Lin, Jyh-Shing Roger Jang

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。

Comments 32 pages, 2 figures, 16 tables. Code: https://github.com/slin-zhq/Domino-Tree

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22556 2026-08-19 cs.LG 版本更新 57%

ImplicitTerrainV2: Wavelet-Guided Spatially Adaptive Neural Terrain Representation

ImplicitTerrainV2: 基于小波引导的时空自适应神经地形表示

Haoan Feng, Xin Xu, Leila De Floriani

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文提出ImplicitTerrainV2,通过结合频谱控制机制、小波引导的空间自适应性、导数感知监督和训练后模型压缩,实现了紧凑高效的神经地形数据格式,提升了地形分析的精度和效率。

Comments 14 pages, 8 figures; https://fengyee.github.io/implicitterrainv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13387 2026-08-18 cs.CL 版本更新 57%

CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation

CROP:基于反事实的任务相关性用于选择性在线策略蒸馏

Enhan Li, Junhao He, Hongyang Du

机构 * The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 针对选择性在线策略蒸馏中任务相关性表征不足的问题,提出基于反事实的CROP方法,可识别更有用的监督位置,在两种师生设置中分别提升性能1.92和2.96个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新 57%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-08-18 cs.CL 版本更新 57%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06452 2026-08-17 cs.CL 版本更新 57%

Learning to Interrupt in Language-based Multi-agent Communication

语言基多智能体通信中的中断学习

Danqing Wang, Da Yin, Ruta Desai, Lei Li, Asli Celikyilmaz, Ansong Ni

机构 * CMU(卡内基梅隆大学) Meta FAIR

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种可中断的通信框架,通过学习预测合适的中断点,减少通信成本,提升多智能体任务性能。

Comments Accepted in CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏