arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Transactions on Machine Learning Research · 期刊 · Machine Learning

2026-06-23 至 2026-06-23 共收录 10
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18471 2026-06-23 cs.CV 版本更新

Jacobian-Aware Posterior Sampling for Inverse Problems

Jacobian-Aware 后验采样用于逆问题

Liav Hen, Tom Tirer, Raja Giryes, Shady Abu-Hussein

机构 * Tel Aviv University, Israel(特拉维夫大学,以色列) Bar-Ilan University, Israel(巴伊兰大学,以色列) University of Cambridge, UK(剑桥大学,英国)

AI总结 提出 Jacobian-Aware 后验采样器 (JAPS),通过结合扩散去噪器的 Jacobian 先验与近端解,在无额外计算成本下提升逆问题重建质量。

Comments Accepted by TMLR 2026; Code at https://github.com/liavhen/JAPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09166 2026-06-23 cs.LG cs.CR cs.DC 版本更新

DP-FedSOFIM: Differentially Private Federated Stochastic Optimization using Regularized Fisher Information Matrix

DP-FedSOFIM: 使用正则化Fisher信息矩阵的差分隐私联邦随机优化

Sidhant Nair, Tanmay Sen, Mrinmay Sen, Sayantan Banerjee

机构 * Department of Mechanical Engineering, Indian Institute of Technology Delhi(印度理工学院德里机械工程系) SQC & OR Unit, Indian Statistical Institute Kolkata(印度统计研究院科钦SQC与OR单位) Department of Artificial Intelligence, Indian Institute of Technology Hyderabad(印度理工学院海得拉巴人工智能系) Operations Management & Quantitative Techniques Area, Indian Institute of Management, Indore(印度管理学院印地尔运营管理和定量技术领域)

AI总结 针对差分隐私联邦学习在严格隐私预算下收敛慢的问题,提出DP-FedSOFIM方法,利用正则化Fisher信息矩阵的代理进行二阶优化,无需完整Hessian计算,在CIFAR-10和PathMNIST上实现更快收敛和更高精度。

Comments 59 pages, 8 figures, 16 tables. Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17431 2026-06-23 cs.CL cs.AI cs.LG 版本更新

Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study

长文本语言模型输出的细粒度不确定性量化:一项比较研究

Dylan Bouchard, Mohit Singh Chauhan, Viren Bajaj, David Skarbrevik

机构 * CVS Health(CVS健康公司) Wellesley, MA(马萨诸塞州韦尔士利)

AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05520 2026-06-23 cs.LG cs.CL 版本更新

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

通过自适应课程学习的高效强化微调

Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出AdaRFT方法,通过自适应课程学习动态调整训练问题难度,提升强化微调效率,在数学推理任务上训练时间减半。

Comments Published in Transactions on Machine Learning Research (TMLR). 30 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01652 2026-06-23 cs.LG cs.AI 版本更新

Causally Fair Node Classification on Non-IID Graph Data

非独立同分布图数据上的因果公平节点分类

Yucong Dai, Lu Zhang, Yaowei Hu, Susan Gauch, Yongkai Wu

机构 * Clemson University(克莱姆森大学) University of Arkansas(亚拉巴马大学) Walmart Inc.(沃尔玛公司)

AI总结 针对图数据中节点因果机制异质性违反经典因果模型假设的问题,提出基于网络结构因果模型的消息传递变分自编码器,通过计算干预分布实现因果公平节点分类,理论保证可分解性和图独立性条件,实验验证其有效缓解偏差。

Comments Accepted by TMLR: https://openreview.net/forum?id=AwptwzGld5

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22934 2026-06-23 cs.LG cs.AI 版本更新

FairSAM: Fair Classification on Corrupted Image Data Through Sharpness-Aware Minimization

FairSAM: 通过锐度感知最小化实现损坏图像数据上的公平分类

Yucong Dai, Jie Ji, Xiaolong Ma, Yongkai Wu

机构 * Clemson University(克莱姆森大学)

AI总结 针对图像分类模型在数据损坏时性能下降且不公平的问题,提出FairSAM框架,将公平性策略融入锐度感知最小化,平衡鲁棒性与公平性。

Comments Accepted by TMLR: https://openreview.net/forum?id=W2QKvn57yw

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏