arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-25 至 2026-08-25 共收录 7
2608.23410 2026-08-25 cs.CV cs.LG 新提交

Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers

基于Next-Scale Transformer的人脸真实感新视角合成

Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院) Meta

AI总结 本研究将next-scale自回归范式适配人脸新视角合成,结合Transformer模型实现高保真多视角人脸3D模型生成,较扩散模型需更少专用训练数据,提升了感知与跨视角一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22111 2026-08-25 cs.SD 新提交

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

FlowSep 2:用于语言查询音频源分离的自监督流匹配方法

Yi Yuan, Xubo Liu, Haohe Liu, Xiyuan Kang, Mark D. Plumbley, Wenwu Wang

机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) Meta Superintelligence Labs(元宇宙超级智能实验室) Department of Informatics, King’s College London(伦敦国王学院信息学系)

AI总结 本研究提出FlowSep2,一种结合Self-Flow与Diffusion Transformer的文本条件流匹配生成模型,用于语言查询音频源分离,在多个基准上达到SOTA性能,可有效分离重叠声源。

Comments Submission to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14835 2026-08-25 cs.CV 版本更新

OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

OvDSGG:端到端开放词汇动态场景图生成

John Helsby, Yi Yang, Bodo Rosenhahn, Michael Ying Yang

机构 * Meta University of Bath(巴斯大学) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

AI总结 OvDSGG是首个开放词汇DSGG的端到端框架,通过空间主干、时间主干及相关模块实现开放词汇识别,在开放词汇指标上显著优于基线,封闭集性能仍具竞争力,且构建了对应基准并公开代码。

Comments ECCVW'26 CONTEXTUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-25 cs.AI 版本更新

Jagged Judges: Epistemic Stability Under Perturbation, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13197 2026-08-25 cs.CL 版本更新

Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization

释放隐式奖励:前缀值学习用于分布级优化

Shiping Gao, Hongzhan Chen, Xiaojun Quan, Qifan Wang, Lifu Huang

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Meta AI University of California, Davis(加州大学戴维斯分校)

AI总结 提出隐式前缀值奖励模型(IPVRM)直接学习每个前缀的正确概率,并通过时序差分差异获得步骤信号,解决训练与推理不匹配问题;进一步引入分布级强化学习(DistRL)利用前缀值进行密集反事实更新,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-08-25 cs.AI cs.CL cs.LG 版本更新

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 61 pages, 27 figures, 4 tables. Code: https://github.com/facebookresearch/gim ; Dataset: https://huggingface.co/datasets/facebook/gim

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06769 2026-08-25 cs.CL 版本更新

Training Large Language Models to Reason in a Continuous Latent Space

训练大型语言模型在连续潜在空间中进行推理

Shibo Hao, Sainbayar Sukhbaatar, DiJia Su, Xian Li, Zhiting Hu, Jason Weston, Yuandong Tian

机构 * FAIR at Meta(Meta 的 FAIR)

AI总结 本文提出名为Coconut的连续思维链新范式,将LLM推理状态表示为连续潜在空间中的隐藏状态,支持广度优先搜索,在需大量搜索的逻辑推理任务上优于CoT,实现更优的准确率效率权衡。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏