arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Apple(苹果)

共收录 604
2609.04102 2026-09-04 cs.SD 新提交

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

通过潜在空间蒸馏压缩流式神经音频编码器

Prasanth Yadla, Mohammad Samragh, Dongseong Hwang, Mingbin Xu, Yuanyuan Zhang, Chung-Cheng Chiu, Yongqiang Wang, Yuan Liu, Zhen Huang, Xiaodan Zhuang

机构 * Apple(苹果公司)

AI总结 本研究提出通过潜在空间蒸馏压缩流式神经音频分词器,以预量化潜在为监督目标,在2.8倍压缩下保持低WER偏差,性能优于同等规模独立训练的分词器。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03377 2026-09-04 cs.LG q-bio.BM 新提交

SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign

SimpleDesign:用于蛋白质序列与结构联合设计的模型

Jiarui Lu, Yuyang Wang, Yizhe Zhang, Jiatao Gu, Navdeep Jaitly, Joshua M. Susskind, Miguel Ángel Bautista

机构 * Mila, Université de Montréal(蒙特利尔大学Mila研究所) Apple(苹果公司)

AI总结 SimpleDesign是直接在数据空间训练的单阶段多模态蛋白质设计模型,采用混合Transformer架构,在超200万对序列-结构对训练后,在相关基准测试中性能优异。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=wPfw7GkMns

Journal ref Transactions on Machine Learning Research, 08/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03239 2026-09-04 cs.LG 新提交

B2B Customer Conversion Prediction: A Document Representation, Graph Theory, and CatBoost Driven Methodology

B2B客户转化预测:一种基于文档表示、图论与CatBoost的方法

Tianqi Wang, Sheikh Shams Azam, Wan Eih Huang, Anton Wiranata, Christopher G. Brinton, Jan P. Allebach

机构 * Purdue University(普渡大学) Apple(苹果公司) Amazon(亚马逊公司) HP Inc.(惠普公司)

AI总结 针对B2B客户转化预测问题,该研究提出结合文档表示、图论与CatBoost的方法,实现91%的预测准确率,并探讨了个性化营销活动推荐方案。

Comments 10 pages, 6 figures. Presented at the 2nd Workshop on End-End Customer Journey Optimization at KDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02796 2026-09-03 cs.CL 新提交

DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation

DiscoSign:篇章感知的文本到手语 gloss 翻译

Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater, Colin Lea

机构 * Apple(苹果公司) Northeastern University(东北大学) Gallaudet University(加劳德特大学)

AI总结 本研究提出基于LLM的DiscoSign框架,解决手语翻译中的空间共指等三个篇章现象,配套新评估指标,在数据集上显著提升空间一致性,建立首个篇章级手语gloss翻译系统框架

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01215 2026-09-02 cs.LG cs.AI cs.RO 新提交

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLA:类型化运动程序的无监督库学习

Riyaaz Shaik, Chandru Venkataraman

机构 * Apple(苹果公司)

AI总结 REFACTOR-VLA 是用于学习可复用技能的醒/睡系统,在 LIBERO 数据集上,其改进的训练目标提升了聚类性能,生成了首个 real-LIBERO 任务-语言库,性能优于现有基线。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00638 2026-09-02 cs.IR cs.CL 新提交

It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

匹配需双方协作:通过强化学习协同进化生成式检索器

Runpeng Dai, Kaili Huang, Changsung Kang, Ciya Liao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司)

AI总结 本文提出CoGR框架,通过两阶段训练与GRPO强化学习协同优化查询、项侧生成器,在多基准数据集上较最强基线F1值提升10.9%与36.1%,实现更优检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20115 2026-09-02 cs.LG stat.ML 版本更新

Multi-View Causal Discovery without Non-Gaussianity: Identifiability and Algorithms

无高斯性假设的多视图因果发现:可识别性与算法

Ambroise Heurtebise, Omar Chehab, Pierre Ablin, Alexandre Gramfort, Aapo Hyvärinen

机构 * Inria(法国国家信息与自动化技术研究院) CEA(法国国家科学研究中心) University of Paris-Saclay(巴黎-萨克勒大学) University of Carnegie Mellon(卡内基梅隆大学) Apple(苹果公司) University of Helsinki(赫尔辛基大学)

AI总结 该研究针对因果发现需强非高斯性假设的问题,利用多视图结构提出多视图线性结构方程模型及相关算法,可估计脑区因果图,在模拟与神经影像数据中验证有效。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31119 2026-09-01 cs.CL 新提交

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的研究计划生成演化框架

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司)

AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。

Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-09-01 cs.CL cs.CV 版本更新

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16344 2026-09-01 cs.CL 版本更新

IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages

IndicQE-APE:印度语言质量估计与自动后编辑基准

Diptesh Kanojia, Archchana Sindhujan, Sourabh Deoghare, Daria Sokova, Shenbin Qian, Girish Koushik, Tharindu Ranasinghe, Constantin Orăsan, Chrysoula Zerva, Ricardo Rei, Frédéric Blain, André F. T. Martins, Marco Turchi, Matteo Negri, Anoop Kunchukuttan, Mitesh M. Khapra, Pushpak Bhattacharyya

机构 * IIT Bombay(印度理工学院孟买分校) University of Oslo(奥斯陆大学) Lancaster University(兰卡斯特大学) INESC-ID Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) University of Lisbon(里斯本大学) Sword Health Tilburg University(蒂尔堡大学) Zoom Communications(Zoom通信公司) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) Apple(苹果公司) Bodhan AI IIT Madras(印度理工学院马德拉斯分校) University of Surrey(萨里大学)

AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。

Comments Submitted to WMT 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26133 2026-08-28 cs.CL 新提交

Agent Seer: Synthesizing Scenarios from Specification Understanding

Agent Seer:基于规范理解的场景合成

Harish Karumuri, Mahesh Vemula, David Lopes Pegna

机构 * Apple(苹果公司)

AI总结 Agent Seer仅用单个MCP规范,无需示例、实时工具访问或领域调优,即可合成高质量测试场景,在7个不同领域的MCP规范上实现完整工具覆盖,为AI智能体评估提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23943 2026-08-26 cs.CV cs.AI cs.GR 新提交

Luce: Relightable Gaussians for 3D Asset Generation

Luce:用于3D资产生成的可重光照高斯模型

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

机构 * Apple(苹果公司)

AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。

Comments 27 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23911 2026-08-26 cs.AI cs.LG 新提交

PROOF-Gen: From Optimized Data to Better Distillation

PROOF-Gen:从优化数据到更好的蒸馏

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

AI总结 PROOF-Gen通过每场景提示优化从教师工具调用失败中恢复93%的错误轨迹,微调后提升了Qwen3-4B等模型的工具调用性能及部署流程的轨迹质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23812 2026-08-26 cs.CL 新提交

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

从偏好到原则:基于评分规则的接地知识答案对齐

Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen

机构 * Apple(苹果公司)

AI总结 本研究针对开放域问答的奖励信号设计难题,提出基于检索证据生成查询特定多维评分规则的奖励框架,经实验验证其比基线方法有显著性能提升,为复杂开放域问答提供更有效的奖励监督。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11818 2026-08-24 cs.CV cs.AI 版本更新

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

机构 * Apple(苹果公司)

AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。

Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18303 2026-08-20 cs.AI cs.LG 新提交

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

SESSE:草图、扩展、排序、总结、评估——通过结构化分解的大模型作为评判者的评估

Dae Lee, Mihai Delgeanu, Adel Youssef

机构 * Apple(苹果公司)

AI总结 该研究针对大模型作为评判者评估无法分离质量维度等问题,提出无需训练的SESSE框架,在RewardBench上实现与基线近乎相当的性能,且可提供可解释的审计跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08713 2026-08-19 cs.AI cs.CV cs.RO 版本更新

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Qiyu Hu, Yuxuan Zhou, Xu Zhu, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: https://github.com/UWMILab/UniWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18747 2026-08-19 cs.IR cs.AI cs.CC cs.CL cs.DB 版本更新

The $\mathbf{P}$-Completeness of Inverted Index Traversal: On the Complexity of Evaluating Boolean Query DAGs

倒排索引遍历的$\mathbf{P}$-完备性:关于布尔查询DAG评估的复杂性

Amir Aavani

机构 * Apple Inc.(苹果公司)

AI总结 本文证明基于DAG的布尔查询评估问题是$\mathbf{P}$-完备的,并提出一种稀疏感知算法ComputePN,通过正负对偶表示和DAG记忆化,将评估时间严格限制在$O(|Q| \cdot |U_{\mathit{active}}|)$,避免指数爆炸和全量扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13926 2026-08-17 cs.AI cs.CL cs.DB 新提交

Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

绝非数字:将答案作为事实使用的AI系统的结构弃权

Zhelun, Wu

机构 * Apple Inc.(苹果公司)

AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。

Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13698 2026-08-17 cs.CL cs.LG 新提交

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究

Konstantin Dobler, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

机构 * Apple(苹果公司) Hasso Plattner Institute(哈索·普拉特纳研究所) ELLIS Unit Potsdam(波茨坦ELLIS单元)

AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22899 2026-08-07 cs.LG stat.ML 版本更新

On the Anisotropy of Score-Based Generative Models

基于得分的生成模型的各向异性研究

Andreas Floros, Seyed-Mohsen Moosavi-Dezfooli, Pier Luigi Dragotti

机构 * Imperial College London(伦敦帝国学院) Apple(苹果公司)

AI总结 该研究针对基于得分的生成模型,引入依赖架构的得分各向异性方向(SADs),通过合成数据和图像基准验证其可捕获模型行为并关联下游性能,为预测生成模型泛化能力提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02948 2026-08-05 cs.LG cs.AI 新提交

Rubrics as Privileged Information for Open-Ended Generation

作为特权信息的评分规则:面向开放式生成

Deepika Bablani, Ajay Gupta, Wanming Chen

机构 * Apple(苹果公司)

AI总结 该研究将在线策略自蒸馏扩展至开放式生成,提出以评分规则作为特权信息(RuPI),在Qwen、Llama等模型上,其性能优于评分规则作为奖励的RL及参考完成PI蒸馏方法。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

机构 * San Jose State University(圣何塞州立大学) Meta Apple(苹果公司) Pragya Lab, BITS Pilani Goa(毕拉尼戈亚分校普拉gya实验室)

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08746 2026-08-04 cs.LG cs.AI cs.DS cs.HC 版本更新

Dimensionality Reduction Meets Network Science: Sensemaking on UMAP's kNN Graph

降维与网络科学相遇:UMAP的kNN图上的意义建构

Duen Horng Chau, Donghao Ren, Fred Hohman, Dominik Moritz

机构 * Apple(苹果公司)

AI总结 研究探索UMAP内部kNN图的潜力,应用PageRank、k核分解和聚类系数等标准图算法增强数据意义建构,经对MNIST和Fashion MNIST评估,证明这些基于图的分析实用且与专门方法有竞争力或互补。

Comments Accepted to IEEE Workshop on Topology meets Artificial Intelligence (TopoInVis Connect) at IEEE VIS 2026. Code and demo: https://apple.github.io/embedding-atlas/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28944 2026-08-03 cs.CR cs.CV cs.SE eess.IV 新提交

A Biometric Sensor Network to Enable Real-Time Measurement of Individual Student Engagement in STEM Lecture Environments

用于STEM课堂环境中实时测量个体学生参与度的生物传感器网络

Ahmed Elsayed

机构 * J.B. Speed School of Engineering(J.B. 斯皮德工程学院) Apple(苹果公司)

AI总结 本研究针对STEM课堂学生参与度测量的侵入性问题,提出由学生处理单元构成的生物传感器网络,支持设备端实时分析与隐私保护,可实现非侵入式的学生参与度实时测量。

Comments Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24598 2026-08-03 cs.LG cs.CR 版本更新

A Novel XAI-Enhanced Quantum Adversarial Networks for Velocity Dispersion Modeling in MaNGA Galaxies

一种用于MaNGA星系速度弥散建模的新型可解释人工智能(XAI)增强量子对抗网络

Sathwik Narkedimilli, N V Saran Kumar, Aswath Babu H, Manjunath K Vanahalli, Manish M, Aik Beng Ng, Vinija Jain, Aman Chadha

机构 * Oracle Financial Services Software Ltd.(Oracle金融服务软件有限公司) Indian Institute of Information Technology Dharwad(德瓦德信息学院) NVIDIA Google AI(谷歌人工智能) Apple AI(苹果人工智能)

AI总结 该研究针对量子机器学习精度、鲁棒性与可解释性难以平衡的问题,提出XAI增强的量子对抗网络,经实验验证其在MaNGA星系速度弥散建模中表现稳定,可推动量子机器学习应用发展。

详情

展开后加载摘要…

URL PDF HTML 收藏