arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-03-03 至 2026-03-03 共收录 10
2603.02188 2026-03-03 cs.LG

Multi-Head Low-Rank Attention

多头低秩注意力

Songtao Liu, Hongwu Peng, Zhiwei Zhang, Zhengyu Chen, Yue Guo

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本研究提出多头低秩注意力机制,通过高效4路张量并行解码,显著提升大型语言模型的解码速度和性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02155 2026-03-03 cs.LG cs.AI math.ST stat.ML stat.TH

Near-Optimal Regret for KL-Regularized Multi-Armed Bandits

KL正则化多臂老虎机的近最优后悔

Kaixuan Ji, Qingyue Zhao, Heyang Zhao, Qiwei Di, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA 90095, USA(计算机科学系,加州大学洛杉矶分校)

AI总结 本文提出了一种针对KL正则化多臂老虎机的近最优后悔分析方法,通过新颖的剥皮论证得出高概率后悔界,并在不同正则化范围内提供了全面的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01641 2026-03-03 cs.AI

Learning Structured Reasoning via Tractable Trajectory Control

通过可计算的轨迹控制学习结构化推理

Po-Nien Kung, Zhen Yang, Jeffrey Luo, Cheng-Fu Yang, Haikang Deng, Zi-Yi Dou, Yinfei Yang, Nanyun Peng, Zhe Gan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Apple(苹果公司)

AI总结 Ctrl-R通过可计算的轨迹控制学习结构化推理,提升复杂问题解决的多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01210 2026-03-03 cs.CV cs.RO

OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation

OmniVLA:具有统一多传感器感知的物理基础多模态VLA

Heyu Guo, Shanmu Wang, Ruichun Ma, Shiqi Jiang, Yasaman Ghasempour, Omid Abari, Baining Guo, Lili Qiu

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft Research Asia(微软亚洲研究院)

AI总结 OmniVLA通过整合多种传感器模态,提升机器人操作的感知能力与任务成功率。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17768 2026-03-03 cs.LG cs.AI cs.CV

Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization

改变训练数据分布以减少简单性偏差以提高分布内泛化能力

Dang Nguyen, Paymon Haddad, Eric Gan, Baharan Mirzasoleiman

机构 * Department of Computer Science, UCLA(计算机科学系, UCLA)

AI总结 通过改变训练数据分布以减少简单性偏差,提高分布内泛化能力,该方法在多种数据集上实现了最先进的性能。

Comments 43 pages, 15 figures, 9 tables, link: https://github.com/BigML-CS-UCLA/TADA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24203 2026-03-03 cs.LG cs.AI cs.CL

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

组相对REINFORCE实际上是秘密的非策略算法:解开GRPO及其朋友的一些神话

Chaorui Yao, Yanxi Chen, Yuchang Sun, Yushuo Chen, Wenhao Zhang, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Alibaba Group(阿里巴巴集团)

AI总结 本文揭示组相对REINFORCE本质上是非策略算法,通过理论分析和实验验证,解开了GRPO及相关算法的一些神话,为LLMs的非策略强化学习提供了新的设计思路。

Comments Accepted to ICLR 2026. arXiv v2 update: add references and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21413 2026-03-03 cs.CL cs.AI

RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning

RefTool: 基于参考的工具创建用于知识密集型推理

Xiao Liu, Da Yin, Zirui Wu, Yansong Feng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) University of Chicago(芝加哥大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 RefTool通过基于参考的工具创建框架,提升LLMs在知识密集型任务中的推理能力,实现更准确和高效的工具生成与应用。

Comments Accepted by ICLR 2026. Code is available at https://github.com/xxxiaol/RefTool

详情

展开后加载摘要…

URL PDF HTML 收藏