arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-05-21 至 2026-05-21 共收录 8
2605.21458 2026-05-21 cs.AI cs.LG stat.ME

Mind the Sim-to-Real Gap & Think Like a Scientist

注意仿真到现实的差距并像科学家一样思考

Harsh Parikh, Gabriel Levin-Konigsberg, Dominique Perrault-Joncas, Alexander Volfovsky

机构 * Amazon SCOT(亚马逊SCOT团队) Yale University(耶鲁大学) Duke University(杜克大学)

AI总结 本文研究了在仿真和现实之间如何补充实验以减少价值差距,提出了Fisher-SEP方法,并通过两个案例研究展示了其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21131 2026-05-21 cs.CV

UniT: Unified Geometry Learning with Group Autoregressive Transformer

UniT: 基于群自回归变换器的统一几何学习

Haotian Wang, Yusong Huang, Zhaonian Kuang, Hongliang Lu, Xinhu Zheng, Meng Yang, Gang Hua

机构 * Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (GZ), Guangzhou, P.R.China(香港理工大学(广州)系统中心智能交通研究组,中国广东省广州市) The National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an, P.R.China(人机混合增强智能国家级重点实验室,西安交通大学,中国陕西省西安市) Applied Science, Amazon.com, Inc., USA(亚马逊公司应用科学部,美国)

AI总结 本文提出UniT模型,通过群自回归变换器统一了几何感知中的多种能力,包括在线感知、离线重建、多模态融合、长视界扩展和度量尺度估计,并引入了适应性几何损失以提升跨场景的度量尺度泛化能力。

Comments Submitted to IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20910 2026-05-21 cs.CV

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。

Comments Project Page: https://flowlong-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20602 2026-05-21 cs.CL cs.AI cs.LG

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

自我训练不使语言扁平化——它重构了它:表面标记增强而深层语法消失

Ming Liu

机构 * Amazon(亚马逊)

AI总结 该研究通过实验发现自我训练过程并非使语言扁平化,而是重构了语言结构,表面标记增强而深层语法结构消失,并提出了结构性深度假说来解释这一现象。

Comments 19 pages (14 main + 5 appendix), 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20576 2026-05-21 cs.CV

$Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos

$Δ$ynamics: 一种基于语言的表示方法,用于从视频中推断刚体动力学

Chia-Hsiang Kao, Cong Phuoc Huynh, Chien-Yi Wang, Noranart Vesdapunt, Stefan Stojanov, Bharath Hariharan, Oleksandr Obiednikov, Ning Zhou

机构 * Cornell University(康奈尔大学) Amazon(亚马逊)

AI总结 本文提出$Δ$YNAMICS框架,通过语言统一表示刚体动力学,利用结构化文本生成物理模拟场景配置,结合自然语言运动推理和光流输入提升泛化能力,在CLEVRER数据集上实现了7倍于现有VLMs的分割IoU,并在新数据集上展示了良好的迁移能力。

Comments Accepted to CVPR 2026. Project page: https://iandrover.github.io/2026_dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24697 2026-05-21 cs.AI

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

当前智能体能否缩小发现到应用的差距?Minecraft中的一个案例研究

Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Amazon(亚马逊)

AI总结 本文通过Minecraft中的SciCrafter基准测试,探讨了智能体在发现因果规律并将其应用于构建功能系统(发现-应用循环)方面的能力,发现前沿模型在该任务中的成功率约为26%,揭示了知识识别和问题提出能力成为当前AI的瓶颈。

Comments Preprint, under review. 41 pages. Project page: https://scicrafter-bench.github.io/. Code: https://github.com/scicrafter-bench/scicraft-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18915 2026-05-21 cs.CL cs.AI

END: Early Noise Dropping for Efficient and Effective Context Denoising

END:早期噪声丢弃以实现高效有效的上下文去噪

Hongye Jin, Pei Chen, Jingfeng Yang, Zhengyang Wang, Fangran Mo, Jinghan Zhang, Meng Jiang, Yifan Gao, Binxuan Huang, Xinyang Zhang, Zheng Li, Tianyi Liu, Huasheng Li, Bing Yin

机构 * Amazon(亚马逊)

AI总结 本文提出END方法,通过在早期层对输入序列进行分割和线性探针,有效识别并丢弃噪声部分,从而提升LLM在不同任务上的性能和效率,同时加深了对LLM内部上下文推理机制的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08277 2026-05-21 q-bio.NC cs.AI cs.CL cs.CV cs.LG

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式

Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Technische Universität Berlin(柏林技术大学) Rice University(Rice 大学) AWS AI Labs, Amazon(Amazon 人工智能实验室) IIT Delhi(德里理工学院) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Spector Inc(Spector 公司) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。

Comments 57 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏