Compressing Streaming Neural Audio Encoders via Latent-Space Distillation
通过潜在空间蒸馏压缩流式神经音频编码器
机构 * Apple(苹果公司)
AI总结 本研究提出通过潜在空间蒸馏压缩流式神经音频分词器,以预量化潜在为监督目标,在2.8倍压缩下保持低WER偏差,性能优于同等规模独立训练的分词器。
Comments 15 pages
大厂专区
通过潜在空间蒸馏压缩流式神经音频编码器
机构 * Apple(苹果公司)
AI总结 本研究提出通过潜在空间蒸馏压缩流式神经音频分词器,以预量化潜在为监督目标,在2.8倍压缩下保持低WER偏差,性能优于同等规模独立训练的分词器。
Comments 15 pages
SimpleDesign:用于蛋白质序列与结构联合设计的模型
机构 * Mila, Université de Montréal(蒙特利尔大学Mila研究所) ; Apple(苹果公司)
AI总结 SimpleDesign是直接在数据空间训练的单阶段多模态蛋白质设计模型,采用混合Transformer架构,在超200万对序列-结构对训练后,在相关基准测试中性能优异。
Comments Published in Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=wPfw7GkMns
Journal ref Transactions on Machine Learning Research, 08/2026
B2B客户转化预测:一种基于文档表示、图论与CatBoost的方法
机构 * Purdue University(普渡大学) ; Apple(苹果公司) ; Amazon(亚马逊公司) ; HP Inc.(惠普公司)
AI总结 针对B2B客户转化预测问题,该研究提出结合文档表示、图论与CatBoost的方法,实现91%的预测准确率,并探讨了个性化营销活动推荐方案。
Comments 10 pages, 6 figures. Presented at the 2nd Workshop on End-End Customer Journey Optimization at KDD 2023
DiscoSign:篇章感知的文本到手语 gloss 翻译
机构 * Apple(苹果公司) ; Northeastern University(东北大学) ; Gallaudet University(加劳德特大学)
AI总结 本研究提出基于LLM的DiscoSign框架,解决手语翻译中的空间共指等三个篇章现象,配套新评估指标,在数据集上显著提升空间一致性,建立首个篇章级手语gloss翻译系统框架
Comments Accepted at EMNLP 2026 Main Conference
REFACTOR-VLA:类型化运动程序的无监督库学习
机构 * Apple(苹果公司)
AI总结 REFACTOR-VLA 是用于学习可复用技能的醒/睡系统,在 LIBERO 数据集上,其改进的训练目标提升了聚类性能,生成了首个 real-LIBERO 任务-语言库,性能优于现有基线。
Comments 30 pages, 5 figures
匹配需双方协作:通过强化学习协同进化生成式检索器
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Apple(苹果公司)
AI总结 本文提出CoGR框架,通过两阶段训练与GRPO强化学习协同优化查询、项侧生成器,在多基准数据集上较最强基线F1值提升10.9%与36.1%,实现更优检索效果。
无高斯性假设的多视图因果发现:可识别性与算法
机构 * Inria(法国国家信息与自动化技术研究院) ; CEA(法国国家科学研究中心) ; University of Paris-Saclay(巴黎-萨克勒大学) ; University of Carnegie Mellon(卡内基梅隆大学) ; Apple(苹果公司) ; University of Helsinki(赫尔辛基大学)
AI总结 该研究针对因果发现需强非高斯性假设的问题,利用多视图结构提出多视图线性结构方程模型及相关算法,可估计脑区因果图,在模拟与神经影像数据中验证有效。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
PaperGym:以评分标准为中心的研究计划生成演化框架
机构 * Zhejiang University(浙江大学) ; Apple(苹果公司)
AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。
Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model
CaRGo-T:因果推理思维图提升多模态幽默理解能力
机构 * Microsoft Research India(微软研究院印度分部) ; LinkedIn(领英公司) ; Nutanix(Nutanix公司) ; Indian Institute of Science(印度科学学院) ; Apple(苹果公司) ; Fujitsu Research India(富士通印度研究院) ; Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)
AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。
Comments 18 pages, 5 figures
IndicQE-APE:印度语言质量估计与自动后编辑基准
机构 * IIT Bombay(印度理工学院孟买分校) ; University of Oslo(奥斯陆大学) ; Lancaster University(兰卡斯特大学) ; INESC-ID ; Instituto de Telecomunicações(电信研究所) ; Instituto Superior Técnico(高等技术学院) ; University of Lisbon(里斯本大学) ; Sword Health ; Tilburg University(蒂尔堡大学) ; Zoom Communications(Zoom通信公司) ; Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) ; Apple(苹果公司) ; Bodhan AI ; IIT Madras(印度理工学院马德拉斯分校) ; University of Surrey(萨里大学)
AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。
Comments Submitted to WMT 2026 for review
Agent Seer:基于规范理解的场景合成
机构 * Apple(苹果公司)
AI总结 Agent Seer仅用单个MCP规范,无需示例、实时工具访问或领域调优,即可合成高质量测试场景,在7个不同领域的MCP规范上实现完整工具覆盖,为AI智能体评估提供了可扩展方案。
Luce:用于3D资产生成的可重光照高斯模型
机构 * Apple(苹果公司)
AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。
Comments 27 pages, 19 figures, 5 tables
PROOF-Gen:从优化数据到更好的蒸馏
机构 * Apple(苹果公司)
AI总结 PROOF-Gen通过每场景提示优化从教师工具调用失败中恢复93%的错误轨迹,微调后提升了Qwen3-4B等模型的工具调用性能及部署流程的轨迹质量。
从偏好到原则:基于评分规则的接地知识答案对齐
机构 * Apple(苹果公司)
AI总结 本研究针对开放域问答的奖励信号设计难题,提出基于检索证据生成查询特定多维评分规则的奖励框架,经实验验证其比基线方法有显著性能提升,为复杂开放域问答提供更有效的奖励监督。
Comments 18 pages, 5 figures, 3 tables
MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架
机构 * Apple(苹果公司)
AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。
Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox
SESSE:草图、扩展、排序、总结、评估——通过结构化分解的大模型作为评判者的评估
机构 * Apple(苹果公司)
AI总结 该研究针对大模型作为评判者评估无法分离质量维度等问题,提出无需训练的SESSE框架,在RewardBench上实现与基线近乎相当的性能,且可提供可解释的审计跟踪。
通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Apple(苹果公司) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。
Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: https://github.com/UWMILab/UniWM
倒排索引遍历的$\mathbf{P}$-完备性:关于布尔查询DAG评估的复杂性
机构 * Apple Inc.(苹果公司)
AI总结 本文证明基于DAG的布尔查询评估问题是$\mathbf{P}$-完备的,并提出一种稀疏感知算法ComputePN,通过正负对偶表示和DAG记忆化,将评估时间严格限制在$O(|Q| \cdot |U_{\mathit{active}}|)$,避免指数爆炸和全量扫描。
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
基于解耦时间深度扩散变换器的内存高效音频合成
机构 * Apple(苹果公司)
AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。
Comments 11 pages, ICASSP
绝非数字:将答案作为事实使用的AI系统的结构弃权
机构 * Apple Inc.(苹果公司)
AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。
Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics
超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究
机构 * Apple(苹果公司) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; ELLIS Unit Potsdam(波茨坦ELLIS单元)
AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。
将线性注意力改造融入扩散语言模型
机构 * Apple(苹果公司) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。
基于得分的生成模型的各向异性研究
机构 * Imperial College London(伦敦帝国学院) ; Apple(苹果公司)
AI总结 该研究针对基于得分的生成模型,引入依赖架构的得分各向异性方向(SADs),通过合成数据和图像基准验证其可捕获模型行为并关联下游性能,为预测生成模型泛化能力提供新方法。
作为特权信息的评分规则:面向开放式生成
机构 * Apple(苹果公司)
AI总结 该研究将在线策略自蒸馏扩展至开放式生成,提出以评分规则作为特权信息(RuPI),在Qwen、Llama等模型上,其性能优于评分规则作为奖励的RL及参考完成PI蒸馏方法。
Comments Preprint, under review
权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人
机构 * San Jose State University(圣何塞州立大学) ; Meta ; Apple(苹果公司) ; Pragya Lab, BITS Pilani Goa(毕拉尼戈亚分校普拉gya实验室)
AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。
Comments 40 pages, 11 figures, 11 tables
降维与网络科学相遇:UMAP的kNN图上的意义建构
机构 * Apple(苹果公司)
AI总结 研究探索UMAP内部kNN图的潜力,应用PageRank、k核分解和聚类系数等标准图算法增强数据意义建构,经对MNIST和Fashion MNIST评估,证明这些基于图的分析实用且与专门方法有竞争力或互补。
Comments Accepted to IEEE Workshop on Topology meets Artificial Intelligence (TopoInVis Connect) at IEEE VIS 2026. Code and demo: https://apple.github.io/embedding-atlas/
NarrativeTrack: 评估实体中心推理在叙事理解中的表现
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。
Comments Project Page: https://github.com/apple/ml-NarrativeTrack
用于STEM课堂环境中实时测量个体学生参与度的生物传感器网络
机构 * J.B. Speed School of Engineering(J.B. 斯皮德工程学院) ; Apple(苹果公司)
AI总结 本研究针对STEM课堂学生参与度测量的侵入性问题,提出由学生处理单元构成的生物传感器网络,支持设备端实时分析与隐私保护,可实现非侵入式的学生参与度实时测量。
Comments Thesis
一种用于MaNGA星系速度弥散建模的新型可解释人工智能(XAI)增强量子对抗网络
机构 * Oracle Financial Services Software Ltd.(Oracle金融服务软件有限公司) ; Indian Institute of Information Technology Dharwad(德瓦德信息学院) ; NVIDIA ; Google AI(谷歌人工智能) ; Apple AI(苹果人工智能)
AI总结 该研究针对量子机器学习精度、鲁棒性与可解释性难以平衡的问题,提出XAI增强的量子对抗网络,经实验验证其在MaNGA星系速度弥散建模中表现稳定,可推动量子机器学习应用发展。