TL;DR:「决策依赖问题」不是一个规范术语,但它指向一个真实存在、横跨运筹学、经济学、控制论、博弈论与机器学习的问题家族。这个家族的共同结构只有一句话:决策会反馈回问题本身——你的选择会改变你面对的分布、你能获得的信息、他人的优化问题、乃至数据本身。本文从术语辨析出发,定位它在运筹学中的"真身"(决策依赖不确定性),区分它最易混淆的邻居(预测-优化范式),最后展开一张完整的家族地图,并给出一句可以检验任何问题的问句。
目录
- 从一个不规范的词开始
- 辨义:这个词可能指向哪里
- 真身:决策依赖不确定性
- 邻居:预测-优化范式
- 拉远:整个家族
- 一张地图,一句检验
- 参考文献
一、从一个不规范的词开始
所有精确的概念,都有一个不精确的起点。
设想有人问:“有没有一种东西叫决策依赖问题?”
这个问题有趣的地方在于:这个词查无出处——你在任何教科书的索引里都找不到它的规范定义。但它又不像是生造的,因为它的每一个音节都指向某种真实的东西。本文记录把这个概念钉死在地图上的过程:先排除两处相邻的地层,找到主矿体,再沿着矿脉四下张望,最后发现——这东西比想象中大得多。
二、辨义:这个词可能指向哪里
在非正式用法里,"决策依赖"有两处常见落点。
心理学:依赖型决策倾向。指难以独自做决定、需要他人持续提供建议和保证才能完成选择的行为倾向。它不是独立的临床诊断;当倾向严重到病理程度时,对应的是依赖型人格障碍(症状包括"让别人为自己做大多数重要决定")。近旁的概念还有决策疲劳(长期回避选择导致决策能力退化)与决策瘫痪(对后果的灾难化想象导致无法行动)。
经济学:路径依赖。由 David(1985)提出、经 North 系统化为制度变迁理论的正式概念:系统一旦进入某条路径,就会被规模经济、学习效应等自我强化机制"锁定",即使存在更优替代方案也难以突破。QWERTY 键盘击败效率更高的德沃夏克键盘,是它的经典案例。
而本文的主线,是它在运筹学中的那处落点——那里有一整个研究方向。
三、真身:决策依赖不确定性
3.1 经典随机规划的隐含假设
不确定性下优化的标准范式是这样一条链:
选一个决策 x → 随机因素 ξ 实现 → 得到结果 → 选 x 使期望结果最好
它有一个默认假设:ξ 的分布 P 是自然给定的、固定的,与你做什么无关。
以报童问题为例:明天的报纸需求是随机的,但这个需求的分布是客观存在的。你订 100 份还是 500 份,都不会改变"明天有多少人想买报纸"这个规律。用一句话说:你的决策只是在被动地应对随机性。
而决策依赖不确定性(decision-dependent uncertainty,DDU),又称内生不确定性(endogenous uncertainty),打破的正是这个假设——决策与随机机制之间,长出了一条反向的箭头。
3.2 三种箭头
| 箭头落在哪 | 含义 | 典型例子 |
|---|---|---|
| 概率分布 | 随机参数的分布随决策改变 | R&D 投资额决定项目成功概率 |
| 信息结构 | 不确定性何时、是否被揭示取决于决策 | 只有钻井之后,才知道油田储量 |
| 不确定集 | 鲁棒优化中的不确定集随决策变化 | 安全投入越多,损失的不确定集越小 |
箭头落在分布上:R&D 项目组合是经典场景——投 500 万,项目成功率 20%;投 2000 万,成功率 60%。"项目成功与否"这个随机事件的分布,是你自己选出来的。此时目标函数里的期望不再是固定的E ξ [ ⋅ ] \mathbb{E}_\xi[\cdot]Eξ[⋅],而是E ξ ∼ P ( x ) [ ⋅ ] \mathbb{E}_{\xi \sim P(x)}[\cdot]Eξ∼P(x)[⋅]——连"在哪个分布下取期望"都取决于你。
箭头落在信息上:海上油气田开发是奠基性案例——地下储量是个客观事实,但你不钻井就永远不知道。钻井这个决策本身打开了信息的闸门。于是问题的性质变了:你不仅在选择"做什么",还在选择"花多少钱去知道什么"。这类问题的决策往往分阶段:先钻探(买信息)→ 看到结果 → 再定开发规模。临床试验排程、地质勘探、市场测试,都是这个模式。它的祖先可以追溯到 Weitzman(1979)的"潘多拉盒子"问题:只有打开盒子,才能看到盒子的价值。
3.3 为什么这类问题特别难
- 非凸性:经典设定下,若Q ( x , ξ ) Q(x,\xi)Q(x,ξ)对x xx凸,则期望也凸;分布本身依赖x xx之后,目标函数一般变为非凸、甚至非连续;
- 情景树失效:情景树方法假设信息按时间自然展开,但这里"信息是否被揭示"本身取决于你的行动——非预期性约束被"污染",标准的情景分解算法直接不可用;
- 算法需要重造:析取规划重构、拉格朗日分解、定制的分支定界与有效不等式,都是为这条箭头付出的代价。
3.4 一句话定义
普通随机优化研究:在给定的不确定性面前,如何最优行动。
DDU 研究:当你的行动本身会改变你所面对的不确定性时,如何行动。
打个比方:前者是在固定的牌桌上打牌;后者是你的打法会改变牌堆里还剩什么牌。
四、邻居:预测-优化范式
描述到这里,容易产生一个误解——“这类问题是不是就是一个预测加一个优化?”
4.1 "一个预测 + 一个优化"确实是一个范式
它叫预测-优化(predict-then-optimize,PTO),结构正如字面:
数据 →预测模块→ 预测出参数 →优化模块→ 决策
当优化问题里的参数本身未知(明天的需求、路况、客户违约概率),就用机器学习先预测这些参数,再代入优化模型求解。预测每条路的通行时间 → 车辆路径优化;预测需求 → 库存优化。它的升级形态叫决策导向学习(decision-focused learning,DFL)。
这条线研究的核心痛点是:预测得好 ≠ 决策好。用 MSE 训练预测模型,但预测误差落在哪个方向、对下游决策的代价天差地别——需求预测偏高 10 件,可能只是多压点货;预测偏低,缺货损失可能是它的十倍。于是 DFL 干脆把优化层放进训练循环,让预测模型直接以"最终决策有多差"为目标来学。
4.2 知识问题 vs 结构问题
但 PTO 不是 DDU。区别在于箭头的方向:
| 预测-优化(PTO/DFL) | 决策依赖不确定性(DDU) | |
|---|---|---|
| 不确定性的性质 | 外生、参数未知(知识问题) | 内生、被决策改变(结构问题) |
| 整体形状 | 流水线:数据→预测→优化→决策,到此为止 | 闭环:决策→改变分布/信息→面对新的不确定性 |
| 若参数全知 | 退化为普通确定优化 | 仍是随机问题,且分布的形状由你选 |
| 核心研究内容 | 预测误差与决策损失的错配 | 反馈导致的非凸性、信息揭示的建模 |
用报童问题做"同病不同源"的对照最直观:你的报摊不知道明天需求的分布,用历史数据训练模型预测需求——这是 PTO 问题;你在短视频平台投放广告,投放力度直接改变明天的需求分布——这是 DDU 问题。同一个问题外壳,两种病。
关键是:这两种病可以同时得——既要预测(分布未知),又依赖(决策改变分布)。它们是正交的维度,可以叠加,近年也确实有工作把它们合在一起处理。
4.3 两者之间的桥
有一个概念恰好站在交界处:表演性预测(performative prediction,Perdomo et al., 2020)——你部署一个预测模型,人们依据它行动,行动改变了数据分布,于是模型面对的分布被模型自己扭曲。从机器学习那侧看,它是 PTO 的闭环化;从运筹那侧看,它就是"决策依赖分布"的特例(决策 = 部署哪个模型)。
五、拉远:整个家族
一旦习惯了寻找那条"指回来的箭头",你会发现它无处不在——横跨经济学、金融、控制论、博弈论、机器学习。分类标准只有一个:箭头落在什么上面。
5.1 落在分布上:你的行动改写你面对的随机规律
- 卢卡斯批判(宏观经济学,1976):用历史数据估出的经济关系来设计政策,政策本身会改变这条关系——你脚下的地图,你一踩就过期。它可以看作表演性预测的经济学老祖宗。
- 市场冲击(金融,Almgren–Chriss、Kyle 模型):你下多大的单,价格就被你推多少。大基金把大单拆成小单慢慢买,本质就是内化了自己对价格分布的影响。
- 古德哈特定律 / reward hacking:指标一旦成为优化目标,行为分布就围绕指标重组,与真实目标脱钩——强化学习里那个发现"原地绕圈刷分比冲线得分更高"的赛艇游戏智能体,是经典一幕。
- 同族:自我实现的预言(预言银行挤兑反而引发挤兑)、平均场博弈(每个人的决策共同构成所有人面对的"平均分布")。
5.2 落在信息上:你的行动本身就是侦察行动
- 双重控制(dual control,控制理论,1960s):控制信号有双重作用——既驱动系统,又试探系统以降低参数不确定性。何时"稳稳地控制"、何时"故意扰动去学习",是控制论版的探索-利用。
- 多臂老虎机 / 贝叶斯优化 / 主动学习 / 最优实验设计:拉一次杆的价值,一半在收益,一半在信息。
- 贝叶斯劝服 / 信息设计(Kamenica & Gentzkow, 2011):走到极致的情形——你优化的对象干脆就是"别人能看到什么信息"。
5.3 落在他人的优化问题上:你的决策是他人世界的一部分
- 双层优化 / Stackelberg 博弈:领导者选 x,追随者在 x 给定下解自己的优化问题,领导者预判这一切再选。LAX 机场的安保调度系统(ARMOR)是这个框架的真实部署。
- 机制设计(“逆向博弈论”,2007 年诺奖方向):你优化的变量是游戏规则本身,所有参与者的行为——即结果的分布——是对规则的均衡反应。
5.4 落在数据上:你手里的样本是你自己造出来的
- 强化学习:策略决定你访问的状态分布——RL 之所以比监督学习难,根源就是这条回路。
- 离线策略评估 / 选择偏差:旧策略下收集的数据天然偏袒旧策略,拿它评估新策略会系统性跑偏。
- 对抗适应:垃圾邮件过滤器一部署,垃圾邮件制造者随即调整策略——一场围绕你模型展开的分布军备竞赛。
5.5 为什么它们是一家人
两条深层共性。
数学上,它们最终都归结为不动点 / 均衡问题:解一个优化 → 环境响应 → 旧解失效 → 再解……"稳定"的解是这条循环的驻点。表演性预测里叫 performatively stable point,博弈论里叫均衡,计量经济学里叫联立方程的一致解——同一件事的不同方言。
因果上,它们都在同一个地方翻车:
数据告诉你的是P(结果 | 观察到 x),而优化需要的是P(结果 | 由我做 x)。
凡是你自己站在因果环路里的地方,这两个量就会分叉。predict-then-optimize 流水线在这些场景里系统性失灵,正是因为它偷偷假设了两者相等。
六、一张地图,一句检验
| 箭头落在哪 | 代表问题 | 大本营 |
|---|---|---|
| 概率分布 | 卢卡斯批判、市场冲击、古德哈特定律 | 经济学、金融 |
| 信息结构 | 双重控制、老虎机、信息设计 | 控制论、运筹 |
| 他人的优化问题 | 双层优化、机制设计 | 博弈论、运筹 |
| 数据分布 | RL 探索、离线评估、对抗适应 | 机器学习 |
判断任何一个问题是否属于这个家族,只需要问一句:
“把我的决策固定住,我面对的世界会不会不一样?”
——如果会,你就在这张地图上。
世界上的问题分两种:一种是你把决策固定住、世界还是原来那个世界的问题;另一种是你把决策固定住、世界已不再是原来那个世界的问题。后者是本文的主题——它们更难,因为每当你伸手,问题本身就在移动。
参考文献
- Jonsbråten, T. K., Wets, R. J.-B., & Woodruff, D. L. (1998). A class of stochastic programs with decision dependent random variables.Operations Research, 46(3).
- Goel, V., & Grossmann, I. E. (2006). A class of stochastic programs with decision dependent uncertainty.Annals of Operations Research, 142.
- Solak, S., Clarke, J.-P. B., Johnson, E. L., & Barnes, E. R. (2010). Optimization of R&D project portfolios under endogenous uncertainty.European Journal of Operational Research, 207(2).
- Hellemo, L., Barton, P. I., & Tomsgard, A. (2018). Decision-dependent probabilities in stochastic programs with recourse.Computational Management Science, 15.
- Apap, R. M., & Grossmann, I. E. (2017). Models and computational strategies for multistage stochastic programming under endogenous and exogenous uncertainties.Computers & Chemical Engineering, 103.
- Weitzman, M. L. (1979). Optimal search for the best alternative.Econometrica, 47(3).
- Donti, P. L., Amos, B., & Kolter, J. Z. (2017). Task-based end-to-end model learning.NeurIPS.
- Elmachtoub, A. N., & Grigas, P. (2022). Smart “predict, then optimize”.Management Science, 68(1).
- Perdomo, J., Zrnic, T., Mendler-Dünner, C., & Hardt, M. (2020). Performative prediction.ICML.
- Kamenica, E., & Gentzkow, M. (2011). Bayesian persuasion.American Economic Review, 101(6).
- Lucas, R. E. (1976). Econometric policy evaluation: A critique.Carnegie-Rochester Conference Series on Public Policy, 1.
- Feldbaum, A. A. (1960–1961). Dual control theory (I–IV).Automation and Remote Control.
- Almgren, R., & Chriss, N. (2001). Optimal execution of portfolio transactions.Journal of Risk, 3(2).
- Kyle, A. S. (1985). Continuous auctions and insider trading.Econometrica, 53(6).
- David, P. A. (1985). Clio and the economics of QWERTY.American Economic Review (Papers & Proceedings), 75(2).
- North, D. C. (1990).Institutions, Institutional Change and Economic Performance. Cambridge University Press.