arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Stanford University(斯坦福大学)

2026-04-01 至 2026-04-01 共收录 16
2603.29798 2026-04-01 cs.CV

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29522 2026-04-01 cs.CL cs.AI cs.LG

Baby Scale: Investigating Models Trained on Individual Children's Language Input

Baby Scale:研究基于个体儿童语言输入训练的模型

Steven Y. Feng, Alvin W. M. Tan, Michael C. Frank

机构 * Stanford University(斯坦福大学)

AI总结 研究基于儿童语言输入训练的模型在不同数据规模下的表现,探讨模型性能与儿童语言发展之间的关系,发现儿童数据在语法任务上表现良好,但在语义和世界知识任务上不如合成数据。

Comments Code and data at https://github.com/styfeng/babyscale-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29315 2026-04-01 cs.RO cs.AI

IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction

IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现

Yingke Wang, Hao Li, Yifeng Zhu, Hong-Xing Yu, Ken Goldberg, Li Fei-Fei, Jiajun Wu, Yunzhu Li, Ruohan Zhang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29301 2026-04-01 cs.CV

Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

基于大语言模型的运动轨迹生成与验证的自一致性

Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29240 2026-04-01 cs.RO

Long-Reach Robotic Cleaning for Lunar Solar Arrays

月球太阳能板的长距离机器人清洁

Stanley Wang, Velin Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种小型移动机器人,配备长距离可展开臂和可更换清洁工具,用于月球太阳能板的温和清洁,减少人工干预,通过 compliant wrist 和速度基 admittance 控制器实现稳定接触。

Comments Extended abstract, 4 pages, 3 figures, accepted to and presented at the Sustainable Space Robotics Workshop at iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29226 2026-04-01 cs.RO

Long-Reach Robotic Manipulation for Assembly and Outfitting of Lunar Structures

长距离机器人操作用于月球结构的装配与布线

Stanley Wang, Venny Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种紧凑且长距离的机器人操作装置,用于月球结构的装配与布线任务,通过减少结构变形和振动提高操作精度。

Comments 7 pages, 6 figures, to appear in the proceedings of iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28997 2026-04-01 cs.CV

GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates

GenFusion:通过渐进性规范空间更新实现前馈人体性能捕捉

Youngjoong Kwon, Yao He, Heejung Choi, Chen Geng, Zhengmao Liu, Jiajun Wu, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种前馈人体性能捕捉方法,通过单目RGB流生成表演者的新型视角。通过渐进式规范空间更新,利用时间连续性积累外观信息,实现更精确的重建与合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28804 2026-04-01 physics.ins-det cs.LG hep-ex nucl-ex

Generalizable Foundation Models for Calorimetry via Mixtures-of-Experts and Parameter Efficient Fine Tuning

通过专家混合和参数高效微调实现可推广的 calorimetry 基础模型

Carlos Cardona-Giraldo, Cristiano Fanelli, James Giroux, Cole Granger, Benjamin Nachman, Gerald Sabin

机构 * RNET Technologies Inc.(RNET技术公司) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) Stanford University(斯坦福大学)

AI总结 本文提出一种基于next-token transformer的可推广calorimetry基础模型,结合专家混合预训练和参数高效微调,实现模块化适应不同材料和粒子类型,提升模拟效率和扩展性。

Comments 18 pages, 11 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28780 2026-04-01 cs.DC cs.AI

Byzantine-Robust and Communication-Efficient Distributed Training: Compressive and Cyclic Gradient Coding

具有容错性和通信效率的分布式训练:压缩和循环梯度编码

Chengxi Li, Youssef Allouah, Rachid Guerraoui, Mikael Skoglund, Ming Xiao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Stanford University(斯坦福大学) Swiss Federal Institute of Technology in Lausanne (EPFL)(洛桑联邦理工学院)

AI总结 本文提出LAD方法,通过循环梯度编码提升分布式训练在拜占庭攻击下的鲁棒性,并引入Com-LAD进一步降低通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11780 2026-04-01 econ.EM cs.LG math.ST stat.ME stat.TH

Inference on Optimal Policy Values and Other Irregular Functionals via Softmax Smoothing

通过Softmax平滑对最优政策值及其他不规则函数进行推断

Justin Whitehouse, Qizhao Chen, Morgane Austern, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 本文提出一种基于Softmax平滑的估计方法,用于推断最优治疗政策的价值,适用于静态和动态治疗方案,仅需拟合常数数量的 nuisance 模型,并在无治疗非响应概率时具有统计效率。

Comments 82 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20663 2026-04-01 cs.CL

Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository

通过创建注释项目仓库预测阅读理解题难度

Radhika Kapoor, Sang T. Truong, Nick Haber, Maria Araceli Ruiz-Primo, Benjamin W. Domingue

机构 * Stanford University(斯坦福大学)

AI总结 本文通过创建包含阅读材料和学生成绩数据的注释仓库,利用惩罚回归模型预测项目难度,同时结合LLM嵌入进一步提升预测性能,为阅读理解题的分类和过滤提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏