arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-03 至 2026-04-03 共收录 3
2604.02230 2026-04-03 cs.AI

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs

回答错误的问题:用于LLMs中退避的推理轨迹逆向

Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29399 2026-04-03 cs.AI cs.DB

ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities

ELT-Bench-Verified: 评估质量问题低估了AI代理的能力

Christopher Zanoli, Andrea Giovannini, Tengjun Jin, Ana Klimovic, Yotam Perlitz

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) University of Illinois (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文通过重新评估ELT-Bench发现代理能力被低估,提出Auditor-Corrector方法修正评估质量,构建ELT-Bench-Verified提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏