arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Apple(苹果)

2026-05-22 至 2026-05-22 共收录 3
2602.12506 2026-05-22 cs.LG

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02604 2026-05-22 cs.LG

Heterogeneous Agent Collaborative Reinforcement Learning

异质智能体协作强化学习

Zhixia Zhang, Zixuan Huang, Gongxun Li, Huaiyang Wang, Chengyi Yuan, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma, Ning Ding, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Bytedance China(字节跳动中国) Tsinghua University(清华大学) Peking University(北京大学) Apple(苹果公司)

AI总结 本文提出了一种新的强化学习从可验证奖励(RLVR)问题HACRL,通过异质智能体共享验证的轨迹实现协同优化,解决了孤立多智能体在线优化的效率问题,并提出HACPO算法以最大化样本利用率和跨智能体知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04938 2026-05-22 cs.CV cs.AI cs.LG

Improved DDIM Sampling with Moment Matching Gaussian Mixtures

改进的DDIM采样与矩匹配高斯混合模型

Prasad Gabbur

机构 * Independent Researcher(独立研究者) Apple(苹果公司)

AI总结 本文提出在DDIM框架中使用高斯混合模型作为反向转换操作符,通过约束GMM参数匹配DDPM前向边缘的矩,从而在少量采样步骤下提升生成样本质量,实验表明GMM核在FID和IS指标上优于传统高斯核。

Comments 34 pages, 12 figures; Accepted to TMLR; Code open sourced

Journal ref Transactions on Machine Learning Research, 05/2026

详情

展开后加载摘要…

URL PDF HTML 收藏