Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages
评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试
机构 * ServiceNow
AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。