arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-02-13 至 2026-02-13 共收录 4
2602.12180 2026-02-13 cs.LG cs.GT

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13732 2026-02-13 stat.ML cs.LG

Backward Conformal Prediction

反向符合预测

Etienne Gauthier, Francis Bach, Michael I. Jordan

机构 * INRIA-ENS-PSL Paris(法国国家信息与自动化研究所-巴黎综合理工学院-巴黎理工学院) UC Berkeley(加州大学伯克利分校)

AI总结 反向符合预测通过约束预测集大小行为并调整覆盖率水平,提供灵活的可计算覆盖率保证,适用于医疗诊断等大预测集不现实的应用场景。

Comments Code available at: https://github.com/GauthierE/backward-cp

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11167 2026-02-13 cs.CL cs.AI

Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering

通过内部状态分析和聚类可视化和评估大语言模型事实性幻觉倾向

Nathan Mao, Varun Kaushik, Shreya Shivkumar, Parham Sharafoleslami, Kevin Zhu, Sunishchal Dev

机构 * The Harker School(哈克尔学校) Monta Vista High School(蒙塔维斯高中) University of California Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse AI研究)

AI总结 通过FalseCite数据集评估大语言模型在误导性引用下的事实性幻觉倾向,并利用内部状态分析和聚类揭示隐藏状态的特征。

Journal ref Proceedings of IJCNLP-AACL SRW 2025, pp. 289-298

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏