The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge
自信的撒谎者:利用对数概率和LLM作为评判诊断多智能体辩论
机构 * University of California, Irvine(加州大学伊文斯分校)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 研究多智能体辩论中令牌级对数概率、LLM评判分数与任务准确性的关系,发现信心与推理质量在构造者上关联更强,且信心可检测关键推理失败。
Comments 15 pages, 7 figures, 1 table, ACL proceedings