arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Michigan(密歇根大学安娜堡分校)

2026-03-06 至 2026-03-06 共收录 5
2512.04277 2026-03-06 cs.LG cs.AI

Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order

基于强化学习后训练的混合奖励:注入经典动作顺序

Prakhar Gupta, Vaibhav Gupta

机构 * University of Michigan(密歇根大学)

AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05226 2026-03-06 stat.ML cs.LG

Learning Optimal Individualized Decision Rules with Conditional Demographic Parity

学习最优的个性化决策规则以实现条件人口平等问题

Wenhai Cui, Wen Su, Donglin Zeng, Xingqiu Zhao

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) Department of Biostatistics, City University of Hong Kong(生物统计学系,香港城市大学) Department of Biostatistics, University of Michigan(生物统计学系,密歇根大学)

AI总结 本文提出了一种结合人口平等问题和条件人口平等问题约束的框架,用于学习最优的个性化决策规则,以减少算法歧视并提高公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02663 2026-03-06 cs.CL cs.AI

When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark

当工具和规划如何帮助大语言模型思考?一个成本和延迟感知的基准测试

Subha Ghoshal, Ali Al-Bustami

机构 * College of Engineering(工程学院) University of Michigan-Dearborn(密歇根大学-迪尔伯恩分校)

AI总结 研究通过对比不同配置评估工具和规划对大语言模型性能的影响,发现工具增强能显著提升准确性但增加延迟,而复杂工具协调易导致模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23648 2026-03-06 cs.LG

Continuous Chain of Thought Enables Parallel Exploration and Reasoning

连续思维链实现并行探索与推理

Halil Alperen Gozeten, M. Emrullah Ildiz, Xuechen Zhang, Hrayr Harutyunyan, Ankit Singh Rawat, Samet Oymak

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Google Research NYC(谷歌纽约研究)

AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏