VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
大厂专区
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
作为逻辑的策略:针对规则的鲁棒推理
机构 * IBM Research(IBM研究院) ; IBM(国际商业机器公司)
AI总结 该研究提出混合符号方法,将策略表示为形式逻辑,结合语言模型事实提取与答案集求解器推理,性能优于策略作为提示、策略作为代码方法,令牌用量减少约10倍,助力生成式AI系统做出鲁棒决策。
Comments RobustifAI Workshop at IJCAI-ECAI '26
措辞效应:量化大语言模型基准测试性能中的双向漂移
机构 * IBM Research India(IBM印度研究院) ; IBM Research Almaden(IBM阿尔马登研究院)
AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。