arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-09-01 至 2026-09-01 共收录 9
2608.17027 2026-09-01 cs.RO 版本更新

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

FetchMan:基于模拟经验学习人形机器人视觉 locomotion-manipulation(移动操作)策略

Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

AI总结 该研究提出 FetchMan,通过端到端 sim-to-real 流水线训练人形机器人视觉移动操作策略,在 FetchMan-Bench 评估中,其单物体抓取策略在 Unitree G1 上零样本部署成功率达73.3%,并扩展至多物体训练。

Comments Project website: https://orayyan.com/fetchman

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-09-01 cs.CL 版本更新

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14581 2026-09-01 cs.LG cs.AI 版本更新

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

CARE:通过科学实验中的可审计证据审查控制LLM生成的策略

Guanyu Liu, Weiyi Kong, Chao Tang, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi

机构 * University of Macau(澳门大学) University of Toronto(多伦多大学) UCLA(加州大学洛杉矶分校) Harvard University(哈佛大学) XtalPi(晶泰科技) McGill University(麦吉尔大学)

AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。

Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28042 2026-09-01 cs.CL cs.AI cs.LG 版本更新

Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts

通过激进剪枝专家从LLM中提取小型翻译专家

Liu O. Martin, Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出一种从混合专家LLM中激进剪枝与翻译无关的专家,实现大幅压缩MoE块而不显著降低翻译质量的方法。

Comments EMNLP 2026, published at Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-09-01 cs.CR cs.AI cs.CL 版本更新

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05575 2026-09-01 stat.ML cs.LG 版本更新

Prediction-Powered Conditional Inference

预测驱动的条件推断

Yang Sui, Jin Zhou, Hua Zhou, Xiaowu Dai

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出一种预测驱动的条件推断方法,在标记数据稀缺的情况下利用机器学习预测器和未标记协变量,通过局部化与方差缩减技术提高统计效率,实现更精确的置信区间估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-09-01 cs.CV 版本更新

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2026-09-01 cs.LG cs.AI cs.CL 版本更新

ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00030 2026-09-01 cs.LG cs.AI 版本更新

RSPO: Regularized Self-Play Alignment of Large Language Models

RSPO:大语言模型的正则化自博弈对齐

Xiaohang Tang, Sangwoong Yoon, Seongho Son, Huizhuo Yuan, Quanquan Gu, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本研究提出RSPO框架,统一现有方法并保证收敛性,在多个基准测试中提升了自博弈微调LLMs的性能,为正则化自博弈对齐提供了基础。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏