arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-17 至 2026-07-17 共收录 2
2607.14318 2026-07-17 cs.LG 新提交

Counterfactual Optimal Action Trees (COAT): Interpretable Prescriptive Policies from Observational Data

反事实最优行动树(COAT):从观测数据中学习可解释的规范性策略

Youssef Drissi, Markus Ettl, Shivaram Subramanian, Wei Sun, Zack Xue

机构 * IBM Research(IBM研究院)

AI总结 研究从观测数据学习可解释规范性策略的问题,核心方法是结合反事实结果估计与大规模混合整数优化的COAT框架,主要贡献是应用于航空公司辅助定价提升收入,推动扩大采用及相关决策举措。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14332 2026-07-17 cs.CL cs.AI 版本更新

Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring

步骤标记:通过步骤监控控制语言推理模型的生成

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(都柏林信任学院) ADAPT Research Centre(ADAPT研究中心)

AI总结 针对语言推理模型效率低、过度生成推理步骤的问题,提出步骤标记框架,引入ReasonType分类法,可在线监控特定步骤计数以产生早期停止标准,经实验在保持准确性时减少令牌数,为控制模型生成及研究其行为提供新途径和工具。

Comments ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏