Learning When to Reason for Text-to-SQL via SFT and DPO
通过监督微调(SFT)和直接偏好优化(DPO)学习何时对文本到SQL进行推理
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) ; AI Center, Samsung Electronics(三星电子人工智能中心) ; AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(首尔国立大学人工智能研究所、高级科学研究所以及综合纳米技术中心、信息存储研究中心和人工智能平台研究所)
专题命中 指令微调 :SFT(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 研究文本到SQL推理问题,提出AutoThinkSQL框架,集成自动思考机制到SFT和DPO中,使模型能根据查询难度动态调整推理,在基准测试中提升效果,减少输出令牌和延迟,让推理决策与查询难度匹配。
Comments 8 pages, 5 figures. Model checkpoints are available at https://huggingface.co/autothinksql