内部稳定,跨样本未识别:基准效应与排名的语义识别
What Does an Evaluation License? A Commit-Bound Census of Claim Replay in Inspect Evals
浏览论文内容
中文总结 AI 辅助
该研究针对TraceElephant基准,揭示评估语义对结论的影响,通过分析F_asym、F_cc等的效应与排名,提出局部非蕴含见证及族索引审计方法。
中文摘要 AI 辅助
评估结论取决于评估者控制的语义:法律参考、可评分性和聚合。当由工件定义的端点Q(s)在声明的族中不变时,我们称其为评估语义识别。一项217行的冻结分析在其受限契约族内表现稳定。在TraceElephant中,F_asym产生了精确的任务不相交采用效应,范围为-40.76至-43.03个百分点,而F_cc中两个联合冻结的、可对比的处理产生的结果恰好为0,区间为[0,0]。因此,它们的并集F_audit无法识别T,尽管F_cc可识别T=0。一项因子审计将100%的分歧归因于单侧终端删除,非终端贡献为0。排名在对称处理间仍依赖于规范。这是一个局部非蕴含见证和可复用的族索引审计,而非流行度估计、详尽语义分类或独立复现。
英文摘要
Benchmarks can run without determining what their results license. We freeze a large evaluation collection and attempt to replay its historical claims. Most units stop because the evidence required for replay is not bound. Where replay is possible, different claims remain stable at different resolutions. We make this otherwise implicit inference step explicit and executable.
发表机构
- Wuhan University(武汉大学)
机构由 AI 辅助整理,请以论文原文为准。