arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-08-27 至 2026-08-27 共收录 8
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25518 2026-08-27 cs.AI 新提交

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) University of California, Berkeley(加州大学伯克利分校) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) HPC-AI Lab(高性能计算与人工智能实验室)

AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25198 2026-08-27 cs.AI 新提交

Tunable Tool-Call Rates in LLM Agents via Representation Steering

通过表示调控实现LLM智能体中可调节的工具调用率

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(圣克鲁兹加利福尼亚大学) UC Berkeley(加利福尼亚大学伯克利分校)

AI总结 本研究提出通过调控LLM残差流的线性方向,可在推理时无需额外训练调节工具调用率,使开放域问答准确率近翻倍,且能泛化到多种模型与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25551 2026-08-27 cs.LG math.OC math.ST stat.ML 新提交

Beyond Optimal Rates in Stochastic Optimization: Trajectory-Adaptive Stopping Rules

随机优化中超越最优速率:轨迹自适应停止规则

Liviu Aolaritei, Lucas Lévy, Francis Bach, Michael I. Jordan

机构 * UC Berkeley(加州大学伯克利分校) Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学院) PSL Research University(巴黎文理研究大学) Department of Statistics, UC Berkeley(加州大学伯克利分校统计系)

AI总结 该研究针对强凸随机优化,提出轨迹自适应停止规则,构建相关置信序列与不等式,将其扩展至小批量SGD,实验显示该规则所需迭代次数远少于确定时间范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24963 2026-08-27 cs.LG math.OC 新提交

Why and When Neural Networks Improve Local Approximation in Optimization

神经网络为何及何时能优化局部近似效果

Chengkuo Bian, Pengcheng Xie

机构 * University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

AI总结 本文明确了影响神经替代模型在无导数优化中作用的三个关键因素,通过117个基准实例等实验验证了各因素对求解性能的影响,化解了该领域的应用矛盾。

Comments 30 pages, 3 figures, 3 tables. Supplementary material (6 pages) included as an ancillary file. Code and raw results: this https URL (https://github.com/chengkuobian/neural-surrogates-dfo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23831 2026-08-27 cs.RO cs.LG 版本更新

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu, Momen Khalil, E Harrison, Emanuele Poggi, Philipp Schmitt, Bernd Kast, Philine Meister, Pranav Atreya, Qiyang Li, Finn Ferchau, Cesar Colmenero, Yash Shahapurkar, Gokul Narayanan, Melih Erdogan, Kai Wurm, Georg von Wichert, Oier Mees, Eugen Solowjow, Andrew Wagenmaker, Sergey Levine

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures, project website: this https URL (https://async-rl-intermediate-information.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-27 cs.AI 版本更新

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00991 2026-08-27 cs.AI cs.CL 版本更新

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏