Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
生成数据驱动的推理评分标准以实现领域自适应奖励建模
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出数据驱动的推理评分标准,用于提升领域自适应奖励建模的错误检测能力,实验显示其在技术领域任务准确性提升达45%
高校专区
生成数据驱动的推理评分标准以实现领域自适应奖励建模
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出数据驱动的推理评分标准,用于提升领域自适应奖励建模的错误检测能力,实验显示其在技术领域任务准确性提升达45%
探测大型视觉-语言模型中的知觉恒常性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Emory University(埃默里大学) ; University of Washington(华盛顿大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究了大型视觉-语言模型在颜色、大小和形状恒常性任务中的表现,发现模型在不同任务上的性能存在显著差异。
Comments Under Review
跨LoRA秩的学习率缩放与对全微调的迁移
机构 * Department of Applied Mathematics and Statistics, Johns Hopkins University, Maryland, United States of America(应用数学与统计学系,约翰霍普金斯大学,马里兰,美国)
AI总结 本文提出μA框架,揭示LoRA学习率与适配器秩的缩放规律,并实现从LoRA到全微调的学习率迁移。
SpIDER:面向软件问题定位的时空感知密集嵌入检索
机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) ; AWS(亚马逊公司) ; AWS AI Labs(亚马逊人工智能实验室)
AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。
Comments Initial preprint