Measuring AI Ability to Complete Long Software Tasks
衡量AI完成长期软件任务的能力
机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) ; Ohm Chip ; Anthropic
AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。
Comments v4: added Chris Painter as listed author, consistent with listing in the pdf
Journal ref NeurIPS 2025