PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience
PseudoBench: 衡量自主研究如何助长伪科学
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiao Tong University(西安交通大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出PseudoBench基准,通过200个伪科学声明-证据对评估AI代理识别和抵制伪科学的能力,发现当前系统极易生成有说服力的伪科学报告,拒绝率接近零。
Comments 26 pages, 21 figures