Coordinated Humanoid Manipulation with Choice Policies
协调的人形机器人操作与选择策略
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。
Comments Code and Website: https://choice-policy.github.io/
高校专区
协调的人形机器人操作与选择策略
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。
Comments Code and Website: https://choice-policy.github.io/
端到端的测试时间训练用于长上下文
机构 * NVIDIA(NVIDIA公司) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; UC San Diego(圣地亚哥大学)
AI总结 本文提出了一种端到端的测试时间训练方法,通过在测试时进行token预测和训练时的元学习,实现长上下文处理,具有与完整注意力相同的扩展性但更高效的推理速度。
Comments Code: https://github.com/test-time-training/e2e
DAVE: 一种用于文档理解与网络代理的视觉编码器
机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) ; UC Berkeley(加州大学伯克利分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。
RedunCut: 用于低成本实时视频分析的测量驱动采样与精度性能建模
机构 * UC Berkeley(伯克利大学)
AI总结 RedunCut通过测量驱动的采样和精度模型,有效降低实时视频分析的计算成本,提升系统在多样负载下的鲁棒性与准确性。
Comments 21 pages, 23 figures
LLMs如何泛化:从认知行为到低级模式的细粒度分析
机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学) ; California Institute of Technology(加州理工学院)
AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。
通过时间预测三维高斯分布进行跟踪
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 Video-GMAE通过时间预测三维高斯分布实现自监督视频跟踪,显著提升了Kinetics和Kubric数据集的跟踪性能。
PolaRiS:面向通用机器人策略的可扩展真实-仿真评估
机构 * University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Toyota Research Institute(丰田研究中心) ; University of Southern California(南加州大学) ; Cornell University(康奈尔大学)
AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。
Comments Website: https://polaris-evals.github.io/
OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta AI
AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。
量化文本嵌入模型中的位置偏差
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本研究量化了文本嵌入模型中位置偏差的影响,发现模型倾向于优先处理输入开头部分,且位置越远离开头,句子重要性越低。
Comments 13 pages, 11 figures, NeurIPS
从图像和视频中重建手持物体的三维结构
机构 * UC Berkeley(伯克利大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; Caltech(加州理工学院)
AI总结 本文提出了一种基于3D手和物体联合重建的方法,通过检索增强重建实现对视频中手持物体的高效三维重建。
Comments 3DV 2026, Project page: https://janehwu.github.io/mcc-ho
涌现的世界信念:探索变换器在随机游戏中的应用
机构 * University of Waterloo(多伦多大学) ; University of California, Berkeley(加州大学伯克利分校) ; Algoverse AI Research(Algoverse人工智能研究)
AI总结 本文研究了LLMs在扑克等信息不完全领域中学习随机环境表示的能力,通过预训练和内部激活探测,展示了模型能自主学习确定性和随机性特征。
Comments Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop