基于非确定性因果模型的鲁棒反事实策略优化
Robust Counterfactual Policy Optimisation via Nondeterministic Causal Models
浏览论文内容
中文总结 AI 辅助
该研究针对序列决策反事实推理的确定性因果模型假设与MDP随机性的矛盾,提出概率非确定性因果模型下的鲁棒反事实策略优化方法,经脓毒症治疗模拟器验证有效。
中文摘要 AI 辅助
针对序列决策的反事实推理方法通常假设因果模型是确定性的,所有随机性均源于潜变量,但马尔可夫决策过程(MDP)本质上是随机的。为解决该问题,我们在概率非确定性因果模型下形式化反事实策略优化,该模型可恰当分离潜混杂与不可约随机性,还提出了灵敏度分析框架下识别鲁棒反事实策略的首个实用优化问题。我们在脓毒症治疗模拟器上验证了所提方法,其中糖尿病状态作为隐藏全局混杂因素。
英文摘要
Counterfactual inference approaches for sequential decision-making typically assume deterministic causal models, where all randomness stems from latent variables. However, Markov Decision Processes (MDPs) are inherently stochastic. We address this by formalising counterfactual policy optimisation under probabilistic nondeterministic causal models, which properly separates latent confounding from irreducible stochasticity, and here propose a first practical optimisation problem for identifying robust counterfactual policies under a sensitivity analysis framework. We validate our approach on a sepsis treatment simulator, where diabetes status acts as a hidden global confounder.
发表机构
- Durham University(杜伦大学)
- University College London(伦敦大学学院)
机构由 AI 辅助整理,请以论文原文为准。