arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ServiceNow

2026-01-13 至 2026-01-13 共收录 1
2601.06341 2026-01-13 cs.LG cs.AI cs.SE

Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages

评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试

Tara Bogavelli, Oluwanifemi Bamgbose, Gabrielle Gauthier Melançon, Fanny Riols, Roshnee Sharma

机构 * ServiceNow

AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏