arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2025-12-05 至 2025-12-05 共收录 3
2508.08833 2025-12-05 cs.CL cs.AI cs.LG

An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems

对LLMs在数学推理中鲁棒性的调查:通过高级数学问题的数学等价转换进行基准测试

Yuren Hao, Xiang Wan, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois Urbana–Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science Stanford University(计算机科学系斯坦福大学)

AI总结 本文提出了一种新的评估方法,通过数学等价转换的变体测试LLMs的数学推理鲁棒性,发现模型在不同变体上的表现差异显著。

Comments 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17793 2025-12-05 cs.CV cs.AI

SYNTHIA: Novel Concept Design with Affordance Composition

SYNTHIA:基于功能连贯性的新型概念设计

Hyeonjeong Ha, Xiaomeng Jin, Jeonghwan Kim, Jiateng Liu, Zhenhailong Wang, Khanh Duy Nguyen, Ansel Blume, Nanyun Peng, Kai-Wei Chang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。

Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02112 2025-12-05 cs.LG cs.CV

ImageNot: A contrast with ImageNet preserves model rankings

ImageNot: 与ImageNet对比的图像数据集保持模型排名

Olawale Salaudeen, Moritz Hardt

机构 * University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 ImageNot数据集用于验证ImageNet上训练的模型在不同数据集上的相对性能一致性,显示模型排名保持稳定,与绝对准确率下降形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏