arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-01-12 至 2026-01-12 共收录 6
2504.11741 2026-01-12 cs.AI cs.CL cs.LG

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05666 2026-01-12 cs.HC cs.AI cs.CY

Advancing credit mobility through stakeholder-informed AI design and adoption

通过利益相关者导向的AI设计与采用推进信用流动性

Yerin Kwak, Siddharth Adelkar, Zachary A. Pardos

机构 * Berkeley School of Education, University of California, Berkeley, CA(伯克利教育学院,加州大学伯克利分校)

AI总结 本研究通过与纽约州立大学系统合作,利用AI提出课程衔接建议,提升学生学分流动性,减少人工审查成本,提高衔接效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05420 2026-01-12 cs.LG stat.AP stat.ME

Efficient Inference for Noisy LLM-as-a-Judge Evaluation

高效噪声LLM-as-a-Judge评估

Yiqun T Chen, Sizhu Lu, Sijia Li, Moran Guo, Shengyi Li

机构 * Departments of Biostatistics and Computer Science, Johns Hopkins University(生物统计学与计算机科学系,约翰霍普金斯大学) Department of Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校) Department of Biostatistics, University of California, Los Angeles(生物统计学系,加州大学洛杉矶分校) Department of Biostatistics, Johns Hopkins University(生物统计学系,约翰霍普金斯大学)

AI总结 本文提出了一种高效方法,通过半参数效率理论统一了测量误差校正和预测驱动推断,以提高LLM-as-a-judge评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05254 2026-01-12 cs.CV cs.AI cs.LG

Explaining Low Perception Model Competency with High-Competency Counterfactuals

用高能力反事实解释低感知模型能力

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出五种生成高能力反事实图像的方法,用于解释模型预测不确定性的原因,并通过实验验证了其在生成语言解释中的有效性。

Journal ref Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2580

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16715 2026-01-12 cs.CV cs.LG stat.ML

PaRCE: Probabilistic and Reconstruction-based Competency Estimation for CNN-based Image Classification

PaRCE:基于概率和重建的卷积神经网络图像分类中的能力估计

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 PaRCE通过概率和重建方法提升CNN图像分类中的信心估计,有效区分正常、误分类和异常样本,提供可解释的置信度评分。

Comments arXiv admin note: text overlap with arXiv:2409.06111

Journal ref Artificial Neural Networks and Machine Learning - ICANN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06111 2026-01-12 cs.RO cs.AI cs.CV cs.SY eess.SY

Competency-Aware Planning for Probabilistically Safe Navigation Under Perception Uncertainty

具有能力感知的规划用于在感知不确定性下的概率安全导航

Sara Pohland, Claire Tomlin

机构 * Department of EECS, UC Berkeley(电子工程与计算机科学系,伯克利大学)

AI总结 本文提出PaRCE方法,通过估计模型对输入图像的整体和局部熟悉度,提升在感知不确定性下的导航安全性与效率。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏