DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate
DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)
AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。
Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings