Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
回答错误的问题:用于LLMs中退避的推理轨迹逆向
机构 * MIT(麻省理工学院) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。
大厂专区
回答错误的问题:用于LLMs中退避的推理轨迹逆向
机构 * MIT(麻省理工学院) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。
ELT-Bench-Verified: 评估质量问题低估了AI代理的能力
机构 * IBM Research(IBM研究院) ; ETH Zurich(苏黎世联邦理工学院) ; University of Illinois (UIUC)(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文通过重新评估ELT-Bench发现代理能力被低估,提出Auditor-Corrector方法修正评估质量,构建ELT-Bench-Verified提升评估准确性。
ThinkGeo: 评估用于遥感任务的工具增强代理
机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; IBM Research(IBM研究院) ; Linköping University(林雪平大学) ; Australian National University(澳大利亚国立大学)
AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。