arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-01 至 2026-07-01 共收录 4
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02863 2026-07-01 cs.AI 版本更新

Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems

不要赌博,GAMBLe:AI驱动研究系统的分析框架

Marquita Ellis, Paul Castro

机构 * IBM Research(IBM研究院)

AI总结 提出GAMBLe框架,通过四个参数(生成器G、评估器A、发现机制M、预算B)和一个有效景观L_eff = A ∘ G分解AI驱动研究系统行为,实验表明组件选择可显著提升性能和搜索效率。

Comments Preprint. 23 pages (10 main, 13 appendix). 6 figures (2 in main, 4 in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15845 2026-07-01 cs.CL cs.AI 版本更新

Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection

不确定时验证:超越黑盒幻觉检测中的自一致性

Yihao Xue, Kristjan Greenewald, Youssef Mroueh, Baharan Mirzasoleiman

机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏