arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2025-12-02 至 2025-12-02 共收录 8
2512.01992 2025-12-02 cs.AI cs.CL

LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess

LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力

Sai Kolasani, Maxim Saplin, Nicholas Crispino, Kyle Montgomery, Jared Quincy Davis, Matei Zaharia, Chi Wang, Chenguang Wang

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者) UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02896 2025-12-02 eess.SY cs.AI cs.SY

Global Convergence of Policy Gradient for Entropy Regularized Linear-Quadratic Control with Multiplicative Noise

熵正则化线性二次控制中乘性噪声下的策略梯度全局收敛性

Gabriel Diaz, Lucky Li, Wenhao Zhang

机构 * Department of Mathematics, University of California, Berkeley(加州大学伯克利分校数学系) College of Computing, Data Science, and Society, University of California, Berkeley(加州大学伯克利分校计算机科学与数据科学学院) Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系)

AI总结 本文提出SB-RPG算法,通过熵正则化解决RL中的探索与利用问题,在未知参数环境下实现策略梯度的全局收敛性。

Comments The authors found that article contains some theoretical errors and decided to withdraw from arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11373 2025-12-02 cs.CL cs.AI

Reliable Reasoning Beyond Natural Language

超越自然语言的可靠推理

Nasim Borazjanizadeh, Steven T. Piantadosi

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出神经符号推理方法,通过整合Prolog引擎,解决LLMs在非线性推理任务中的不足,提升推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01446 2025-12-02 cs.RO

$\mathbf{M^3A}$ Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering

M³A策略:通过光度重渲染的可变材料操控增强策略

Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang

机构 * Tsinghua University(清华大学) MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) University of California, Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学)

AI总结 M³A策略通过光度重渲染生成多样化演示,提升机器人跨材料操控的泛化能力。

Comments under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01188 2025-12-02 cs.RO cs.AI cs.LG

Real-World Reinforcement Learning of Active Perception Behaviors

现实世界中主动感知行为的强化学习

Edward S. Hu, Jie Wang, Xingfang Yuan, Fiona Luo, Muyao Li, Gaspard Lambrechts, Oleh Rybkin, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Liège(列日大学) UC Berkeley(伯克利大学)

AI总结 本文提出AAWR方法,通过特权传感器训练高效主动感知策略,提升机器人在部分可观测环境下的任务性能。

Comments NeurIPS 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01061 2025-12-02 cs.RO cs.CV

Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

为人类oid像素到动作策略转移打开仿真到现实的大门

Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) CUHK(香港中文大学)

AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。

Comments https://doorman-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14776 2025-12-02 cs.CL

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19943 2025-12-02 cs.CV cs.AI

Interpreting ResNet-based CLIP via Neuron-Attention Decomposition

通过神经-注意力分解解释基于ResNet的CLIP

Edmund Bu, Yossi Gandelsman

机构 * UC San Diego(圣迭戈大学) UC Berkeley(伯克利大学)

AI总结 通过神经-注意力分解解释CLIP-ResNet中的神经元,实现无训练语义分割和分布偏移监控

Comments Accepted at NeurIPS 2025 Workshop on Mechanistic Interpretability. Project page: https://edmundbu.github.io/clip-neur-attn/

详情

展开后加载摘要…

URL PDF HTML 收藏