arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Transactions on Machine Learning Research · 期刊 · Machine Learning

2026-07-14 至 2026-07-14 共收录 3
2607.10855 2026-07-14 cs.LG 新提交

Reliability Scaling Laws for Quantized Large Language Models

量化大语言模型的可靠性缩放定律

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Pruna AI(Pruna人工智能公司)

AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09993 2026-07-14 cs.GT cs.AI cs.LG cs.MA 新提交

Beyond Bayesian Nash: Learning Minimax-Regret Equilibria for Adversarial Team Games under Asymmetric Information

超越贝叶斯纳什均衡:非对称信息下对抗团队博弈的极小极大遗憾均衡学习

Naman Aggarwal, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院) Aerospace Control Laboratory(航空控制实验室) Laboratory of Information and Decision Systems(信息与决策系统实验室)

AI总结 研究非对称信息下对抗团队博弈,提出概率鲁棒极小极大遗憾均衡(PR-MRE),结合极小极大遗憾推理的无分布鲁棒性与概率信息,通过鲁棒双线性规划及新型元求解器 PRMRE-PSRO 实现策略学习,实验证明其在隐藏类型上性能更优,行为更稳健。

Comments 29 pages, 11 figures, 6 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏