VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
大厂专区
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
作为逻辑的策略:针对规则的鲁棒推理
机构 * IBM Research(IBM研究院) ; IBM(国际商业机器公司)
AI总结 该研究提出混合符号方法,将策略表示为形式逻辑,结合语言模型事实提取与答案集求解器推理,性能优于策略作为提示、策略作为代码方法,令牌用量减少约10倍,助力生成式AI系统做出鲁棒决策。
Comments RobustifAI Workshop at IJCAI-ECAI '26
措辞效应:量化大语言模型基准测试性能中的双向漂移
机构 * IBM Research India(IBM印度研究院) ; IBM Research Almaden(IBM阿尔马登研究院)
AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。
优化低成本部署强模型:面向进化优化的成本感知跨层迁移
机构 * IBM Research(IBM研究院)
AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。