arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-13 至 2026-08-13 共收录 5
2608.12179 2026-08-13 cs.CV 新提交

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D:面向流输入的多视图3D目标检测的度量前馈3D重建先验

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Hermann Blum, Peter Kontschieder, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(元宇宙实验室) University of Bonn(波恩大学)

AI总结 Map-Det3D是一种在线多视图3D目标检测模型,通过将短时间窗口映射为多视图并利用前馈度量3D重建模型作为几何骨干,直接在度量3D空间预测边界框,实现了稳定的单目视频3D检测,且具有良好的在线性能与鲁棒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11859 2026-08-13 cs.LG 新提交

Small-Scale Experiments: Are We There Yet?

小规模实验:我们达到目标了吗?

Nicholas Lourie, Kyunghyun Cho, Karen Ullrich, Sanae Lotfi

机构 * FAIR at MSL Meta New York University(纽约大学)

AI总结 该研究指出小规模模型对超参数的敏感性是缩放定律在小规模实验中失效的关键,开发了以模型为中心的研究方法论,通过小规模实验证实Transformer中预归一化随模型规模增大效果更好,表明小规模实验可兑现缩放定律的承诺。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07423 2026-08-13 cs.SD cs.LG eess.AS 交叉投稿

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

云端增强型低计算量多通道语音增强

Xulin Fan, Juan Azcarreta, Ashutosh Pandey, Jesus Alvarez, Ke Tan, Jacob Donley, Ritwik Giri, Buye Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Reality Labs Research(Meta现实实验室)

AI总结 针对可穿戴设备语音增强的计算约束瓶颈,提出融合延迟服务器输出、分层特征增强及协作多通道维纳滤波的云端协作框架,以低额外开销显著提升边缘模型性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00316 2026-08-13 cs.LG stat.ML 版本更新

Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch

基于代理的贝叶斯优化:通过代理增强的自动研究

Paul Brunzema, Louis Tiao, Nhat Le, Kevin De Angeli, Yao Xuan, Djordje Gligorijevic

机构 * Meta RWTH Aachen University(亚琛工业大学)

AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏