arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-01-01 至 2026-01-01 共收录 11
2512.25072 2026-01-01 cs.RO cs.AI cs.LG

Coordinated Humanoid Manipulation with Choice Policies

协调的人形机器人操作与选择策略

Haozhi Qi, Yen-Jen Wang, Toru Lin, Brent Yi, Yi Ma, Koushil Sreenath, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。

Comments Code and Website: https://choice-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23675 2026-01-01 cs.LG

End-to-End Test-Time Training for Long Context

端到端的测试时间训练用于长上下文

Arnuv Tandon, Karan Dalal, Xinhao Li, Daniel Koceja, Marcel Rød, Sam Buchanan, Xiaolong Wang, Jure Leskovec, Sanmi Koyejo, Tatsunori Hashimoto, Carlos Guestrin, Jed McCaleb, Yejin Choi, Yu Sun

机构 * NVIDIA(NVIDIA公司) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) UC San Diego(圣地亚哥大学)

AI总结 本文提出了一种端到端的测试时间训练方法,通过在测试时进行token预测和训练时的元学习,实现长上下文处理,具有与完整注意力相同的扩展性但更高效的推理速度。

Comments Code: https://github.com/test-time-training/e2e

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24386 2026-01-01 cs.CV cs.DC

RedunCut: Measurement-Driven Sampling and Accuracy Performance Modeling for Low-Cost Live Video Analytics

RedunCut: 用于低成本实时视频分析的测量驱动采样与精度性能建模

Gur-Eyal Sela, Kumar Krishna Agrawal, Bharathan Balaji, Joseph Gonzalez, Ion Stoica

机构 * UC Berkeley(伯克利大学)

AI总结 RedunCut通过测量驱动的采样和精度模型,有效降低实时视频分析的计算成本,提升系统在多样负载下的鲁棒性与准确性。

Comments 21 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22489 2026-01-01 cs.CV

Tracking by Predicting 3-D Gaussians Over Time

通过时间预测三维高斯分布进行跟踪

Tanish Baranwal, Himanshu Gaurav Singh, Jathushan Rajasegaran, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 Video-GMAE通过时间预测三维高斯分布实现自监督视频跟踪,显著提升了Kinetics和Kubric数据集的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16881 2026-01-01 cs.RO cs.LG

PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies

PolaRiS:面向通用机器人策略的可扩展真实-仿真评估

Arhan Jain, Mingtong Zhang, Kanav Arora, William Chen, Marcel Torne, Muhammad Zubair Irshad, Sergey Zakharov, Yue Wang, Sergey Levine, Chelsea Finn, Wei-Chiu Ma, Dhruv Shah, Abhishek Gupta, Karl Pertsch

机构 * University of Washington(华盛顿大学) Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究中心) University of Southern California(南加州大学) Cornell University(康奈尔大学)

AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。

Comments Website: https://polaris-evals.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03734 2026-01-01 cs.RO cs.CV

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

机构 * University of California, Berkeley(加州大学伯克利分校) Meta AI

AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15241 2026-01-01 cs.CL cs.AI cs.IR

Quantifying Positional Biases in Text Embedding Models

量化文本嵌入模型中的位置偏差

Reagan J. Lee, Samarth Goel, Kannan Ramchandran

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本研究量化了文本嵌入模型中位置偏差的影响,发现模型倾向于优先处理输入开头部分,且位置越远离开头,句子重要性越低。

Comments 13 pages, 11 figures, NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06507 2026-01-01 cs.CV

Reconstructing Hand-Held Objects in 3D from Images and Videos

从图像和视频中重建手持物体的三维结构

Jane Wu, Georgios Pavlakos, Georgia Gkioxari, Jitendra Malik

机构 * UC Berkeley(伯克利大学) UT Austin(德克萨斯大学奥斯汀分校) Caltech(加州理工学院)

AI总结 本文提出了一种基于3D手和物体联合重建的方法,通过检索增强重建实现对视频中手持物体的高效三维重建。

Comments 3DV 2026, Project page: https://janehwu.github.io/mcc-ho

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23722 2026-01-01 cs.CL

Emergent World Beliefs: Exploring Transformers in Stochastic Games

涌现的世界信念:探索变换器在随机游戏中的应用

Adam Kamel, Tanish Rastogi, Michael Ma, Kailash Ranganathan, Kevin Zhu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse人工智能研究)

AI总结 本文研究了LLMs在扑克等信息不完全领域中学习随机环境表示的能力,通过预训练和内部激活探测,展示了模型能自主学习确定性和随机性特征。

Comments Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏