On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
关于RL微调VLMs的鲁棒性和链式思维一致性
机构 * Apple(苹果公司) ; OpenAI
AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。
Comments ICML 2026