arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2025-12-18 至 2025-12-18 共收录 3
2512.15699 2025-12-18 cs.LG cs.SE

FrontierCS: Evolving Challenges for Evolving Intelligence

FrontierCS: 蒸馏智能面临的挑战

Qiuyang Mang, Wenhao Chai, Zhifei Li, Huanzhi Mao, Shang Zhou, Alexander Du, Hanchen Li, Shu Liu, Edwin Chen, Yichuan Wang, Xieting Chu, Zerui Cheng, Yuan Xu, Tian Xia, Zirui Wang, Tianneng Shi, Jianzhu Yao, Yilong Zhao, Qizheng Zhang, Charlie Ruan, Zeyu Shen, Kaiyuan Liu, Runyuan He, Dong Xing, Zerui Li, Zirong Zeng, Yige Jiang, Lufeng Cheng, Ziyi Zhao, Youran Sun, Wesley Zheng, Meiyuwang Zhang, Ruyi Ji, Xuechang Tu, Zihan Zheng, Zexing Chen, Kangyang Zhou, Zhaozi Wang, Jingbang Chen, Aleksandra Korolova, Peter Henderson, Pramod Viswanath, Vijay Ganesh, Saining Xie, Zhuang Liu, Dawn Song, Sewon Min, Ion Stoica, Joseph E. Gonzalez, Jingbo Shang, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) UCSD(加州大学圣迭戈分校) X-camp Academy(X-camp学院) Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学) University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) New York University(纽约大学) MIT(麻省理工学院)

AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。

Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15000 2025-12-18 cs.LG cs.AI cs.CL

DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding

DreamPRM-Code: 一种基于函数作为步骤的进程奖励模型与标签校正用于LLM编码

Ruiyi Zhang, Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

AI总结 DreamPRM-Code通过链式函数提示策略和元学习校正机制,提升LLM在编码任务中的表现,达到LiveCodeBench的最高准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02491 2025-12-18 cs.DB cs.LG

Stress-Testing Causal Claims via Cardinality Repairs

通过基数修复检验因果主张

Yarden Gabbay, Haoquan Guan, Shaull Almagor, El Kindi Rezig, Brit Youngmann, Babak Salimi

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Utah(犹他大学)

AI总结 SubCure通过基数修复方法检验因果分析的稳健性,揭示数据中的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏