Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
无对齐文本音频盒(Text-AB):用于语音配音和全双工对话合成
机构 * FAIR at Meta(Meta FAIR研究院)
AI总结 该研究提出无对齐文本音频盒(Text-AB),基于流匹配扩散Transformer,在48万小时语音预训练后经微调,实现高质量配音与全双工对话合成,性能大幅优于现有系统。
大厂专区
无对齐文本音频盒(Text-AB):用于语音配音和全双工对话合成
机构 * FAIR at Meta(Meta FAIR研究院)
AI总结 该研究提出无对齐文本音频盒(Text-AB),基于流匹配扩散Transformer,在48万小时语音预训练后经微调,实现高质量配音与全双工对话合成,性能大幅优于现有系统。
SLIDEFORGE:一款用于将幻灯片作为结构化工件进行可控编辑的大语言模型智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta
AI总结 SLIDEFORGE是一款基于Deck State Graph的LLM智能体,可实现保留布局样式等的可控幻灯片编辑,在多维度评估中优于现有基线,提供可控幻灯片编辑的新方案。
Comments EMNLP 2026 Main Conference. Haozhen and Fulin contributed equally
通过幂律熵搜索高效估计最优超参数缩放定律
机构 * Meta ; National University of Singapore(新加坡国立大学) ; Atomic Machines(原子机器公司)
AI总结 该研究提出幂律熵搜索(PLES),一种基于多保真度贝叶斯优化的获取函数,可高效估计LLM的最优超参数缩放定律,其计算预算仅为传统网格搜索的十分之一。
CORAL:迈向自主多智能体进化以实现开放性发现
机构 * MIT(麻省理工学院) ; NUS(新加坡国立大学) ; MiniMax ; McGill(麦吉尔大学) ; Stanford(斯坦福大学) ; SambaNova ; Meta ; Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) ; Amazon(亚马逊) ; Microsoft(微软)
AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。
大语言模型作为图神经网络:面向文本属性图基础模型的图词汇学习
机构 * Rutgers University(罗格斯大学) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; University of Science and Technology of China(中国科学技术大学) ; Meta AI ; North Carolina State University(北卡罗来纳州立大学)
AI总结 该研究针对文本属性图基础模型的跨图跨任务迁移难题,提出基于图词汇学习的PromptGFM模型,通过图理解与图推理模块实现LLM与GNN的深度集成,在多图多任务上展现出优越性能与迁移性。
Comments EMNLP 2026
CORAL:面向生产级推荐系统的原生大语言模型(LLM)工具
机构 * Meta AI
AI总结 本研究提出原生大语言模型工具CORAL,将智能体闭环应用于生产级推荐系统,通过A/B实验证实其可在两个大规模社交平台上实现参与度提升或服务成本降低,自动化持续优化工作。
Comments Accepted by RecSys '26 OARS Workshop
预测而非迭代:用于扩散语言模型的高效自适应长度 infilling
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta
AI总结 该研究针对扩散语言模型 infilling 任务的局限,提出无预设长度的高效 PILL 方法,在多模型多基准上实现代码通过率、文本 BLEU-2 提升且推理速度加快。
Comments Accepted at EMNLP 2026 (Main Conference)
hLLM:用于生成式重排序的单遍解码
机构 * Meta Platforms, Inc.(元平台公司)
AI总结 该研究提出hLLM,一种O(1)解码的格式专用策略,结合LoRA微调与教师排序蒸馏,使生成式重排序速度提升64倍,保持质量并连接组合优化,开辟实时排序新路径。
Comments 10 pages
在联合嵌入预测世界模型中成功因素是什么?
机构 * Meta FAIR ; Inria Paris(巴黎理工院) ; Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) ; New York University(纽约大学)
AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。
Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR V4: Added funding acknowledgements for Jean Ponce
多模态语言模型作为文本到图像模型的评估器
机构 * FAIR at Meta - Montreal, New York(Meta 蒙特利尔 FAIR) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mila ; McGill University(麦吉尔大学) ; Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)
AI总结 该研究提出MT2IE框架,以MLLM为评估智能体,生成少量提示即可高效准确评估T2I模型,其排名比现有指标更忠实一致,还可定制基准,助力动态评估框架发展。
是什么、在哪里、如何:探究视频基础模型中的时空表征
机构 * Lassonde School of Engineering(拉桑德工程学院) ; York University(约克大学) ; Vector Institute(矢量研究院) ; FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) ; Mila(米拉研究院) ; McGill University(麦吉尔大学) ; Goodfire AI(Goodfire人工智能公司)
AI总结 本研究通过分层分析V-JEPA 2和VideoMAE-v2,探究其时空表征的编码内容、位置与几何组织,发现相机运动编码特性并应用几何样条引导实现更优的视频插值。
Comments Interactive visualizations are available at https://vid-rep-pca.netlify.app/
训练中期的知识蒸馏更利于推理而非事实回忆
机构 * Meta AI ; University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学)
AI总结 该研究发现训练中期的前向KD会减缓事实回忆但提升推理,提出Switch Distillation方法,在保留高推理和知识性能的同时维持大部分事实回忆,优于现有蒸馏目标。
Comments 33 pages, 13 figures, 9 tables. Code is publicly available at https://github.com/facebookresearch/midtraining-distillation
LUNA: 超越蒙皮的学习通用3D人体动画
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)
AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。
Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/
MELD: 基于梅尔频谱的离散潜变量语音语言建模
机构 * University of Edinburgh(爱丁堡大学) ; Google DeepMind(谷歌DeepMind) ; Meta Superintelligence Labs(Meta超智能实验室)
AI总结 提出一种在梅尔频谱上联合优化编码器和语音语言模型的离散潜变量模型,在零样本文本转语音和语音转文本任务上优于基于编解码器和其他梅尔频谱基线,并缓解了自回归建模中的长时间静音和单词遗漏问题。
Comments Accepted to EMNLP 2026 (main conference)
V-Co:通过去噪更深入地审视视觉表示对齐
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NYU(纽约大学) ; Meta ; AI2(人工智能研究院)
AI总结 本文通过统一的JiT框架系统研究视觉去噪,揭示了四个关键要素:双流架构、结构化无条件预测、感知漂移混合损失和特征重缩放,从而在ImageNet-256上实现更高效的生成模型。
Comments Accepted by ECCV 2026. code: https://github.com/HL-hanlin/V-Co
通过迭代PPO对齐大语言模型以实现多轮对话结果
机构 * Meta ; FAIR at Meta(Meta的FAIR)
AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。
Comments The first two authors contributed equally
角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析
机构 * Iowa State University(爱荷华州立大学) ; Meta
AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。
Comments Preprint
SPHERE:通过结合空间启发式奖励的音频语言模型后训练实现自动音乐上混
机构 * Meta Reality Labs(元宇宙实验室) ; Queen Mary University of London(伦敦玛丽女王大学)
AI总结 该研究提出基于音频语言模型后训练的自动音乐上混方法,设计含6个子奖励的Sphere奖励套件,证明领域知识可蒸馏入语言模型实现该任务。
Journal ref EMNLP 2026
TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取
机构 * Rutgers University(罗格斯大学) ; Meta ; NEC Labs America(美国NEC实验室) ; University of Electro-Communications(电气通信大学) ; NEC Corporation(日本电气公司)
AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。
NxN E-评估:通过共形CRT空假设进行假设验证
机构 * Meta
AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。
脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题
机构 * Meta AI ; Columbia University(哥伦比亚大学)
AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。
Comments 24 Pages
FiCA:基于单张肖像图像的前馈即时高斯编解码器化身
机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) ; Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) ; School of Computing, KAIST(韩国科学技术院计算机学院)
AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。
Comments Project page: https://kim-youwang.github.io/FiCA
LLMs 与停机问题:程序终止推理的特征化
机构 * FAIR Team, Meta AI(Meta AI FAIR 团队) ; The Hebrew University of Jerusalem, Israel(耶路撒冷希伯来大学) ; Bloomberg, New York, USA(彭博社,纽约,美国) ; Imperial College London, UK(伦敦帝国理工学院,英国) ; University College London, UK(伦敦大学学院,英国)
AI总结 本文评估了前沿LLMs在程序终止推理上的能力,发现GPT-5和Claude Sonnet 4.5在C程序终止判断上达到顶级验证工具水平,但无法生成形式化证明,并引入分歧前置条件形式化描述非终止条件。
Comments long paper
不确定性驱动量化大语言模型中的社会偏见变化
机构 * UC Berkeley(伯克利大学) ; Centre for Computational Medicine at The Hospital for Sick Children(儿童医院计算医学中心) ; UCSF(旧金山大学) ; Meta Superintelligence Labs(Meta超智能实验室)
AI总结 研究发现量化过程导致大语言模型中社会偏见的翻转,且不确定性与量化强度影响偏见变化,需进行后续评估以确保可靠性。
Comments Accepted to COLM 2026 (10 pages, 5 figures)
CoFiRec: 生成推荐中的粗到细分词
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; University of California San Diego(加州大学圣地亚哥分校)
AI总结 CoFiRec通过粗到细分词提升生成推荐效果,有效捕捉用户意图演变。
Comments RecSys 2026
破解代码:通过系统性越狱攻击对AI代码代理进行安全评估
机构 * University of Maryland – College Park(马里兰大学-College Park) ; AWS AI Labs(AWS人工智能实验室) ; Meta Superintelligence Labs(Meta超智能实验室)
AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。
Comments 22 pages, 18 figures, 8 tables
大规模推理模型通过 flawed thinking 学习更好的对齐
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; IBM Research(IBM研究院)
AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。
作为条件的注意力:经典学习理论对线性Transformer的预测
机构 * Meta Platforms, Inc.(Meta公司)
AI总结 该研究将线性Transformer的注意力机制与经典动物学习理论模型对应,推导卡明阻塞闭式解,发现不同注意力的线索竞争差异及容量机制,提出PH-注意力规则。
ProofEvolve:用于形式化自动定理证明的神经符号进化方法
机构 * University of Virginia(弗吉尼亚大学) ; Meta AI
AI总结 ProofEvolve是一种神经符号框架,结合神经模型与Lean内核进化形式化验证的证明结构,在三个竞赛级Lean基准中实现最高平均定理解决率,解决现有神经证明器的递归结构缺失问题。
模态成熟度指数:评估全模态模型多模态能力的基准
机构 * Meta Superintelligence Labs(元超级智能实验室)
AI总结 该研究提出评估全模态模型多模态能力的基准MMI,测试五种模态及组合,发现前沿模型MPS得分低,LLM评分者与人工标注者判断一致性达70.8%。
Comments 26 pages, 6 figures. Code and dataset available