Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
在测试时理解并引导推理模型的认知行为
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Together AI ; University of Sydney(悉尼大学)
AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。
高校专区
在测试时理解并引导推理模型的认知行为
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Together AI ; University of Sydney(悉尼大学)
AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。
Text2Seg: 通过文本引导的视觉基础模型实现遥感图像语义分割
机构 * University of Georgia(佐治亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Virginia(弗吉尼亚大学)
AI总结 Text2Seg通过文本引导的视觉基础模型实现遥感图像语义分割,显著提升零样本预测性能。
Comments 10 pages, 3 figures
重新思考多智能体工作流的价值:一个强大的单智能体基线
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Amazon(亚马逊) ; Emory University(埃默里大学) ; Northeastern University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本研究通过单个代理的多轮对话模拟多智能体工作流,提出OneFlow算法,实现高效且准确的多代理流程,为多智能体系统研究提供强基线。
快速双时间尺度随机梯度方法及其在强化学习中的应用
机构 * J.P. Morgan AI Research(摩根大通AI研究) ; UT Austin, Department of Aerospace Engineering & Engineering Mechanics(得克萨斯大学奥斯汀分校航空航天工程与工程力学系)
AI总结 本文提出了一种快速双时间尺度随机梯度方法,通过引入平均步骤提升收敛速度,并在强化学习中实现了优于现有方法的性能。
LIBRA:基于语言模型的带状 recourse 算法用于个性化治疗计划
机构 * McCombs School of Business, University of Texas at Austin(德克萨斯大学奥斯汀分校麦克斯韦商学院) ; Naveen Jindal School of Management, University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达管理学院) ; Mays Business School, Texas A&M University(德克萨斯农工大学梅斯商学院) ; Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)
AI总结 LIBRA 是一种结合大语言模型和带状学习的算法,用于在个性化治疗中实现更高效的决策和鲁棒性。
Comments 50 pages. Previous version with human-AI collaboration: arXiv:2410.14640
通过多领域去偏框架增强问答模型
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出多领域去偏框架,通过知识蒸馏和领域扩展技术,有效缓解问答模型中的偏见问题,提升其在对抗性环境下的性能和可靠性。
Comments 5 pages, 7 tables