☰
边解边变的问题:从“决策依赖“一词出发
2026/9/30 2:49:11 网站建设 项目流程

TL;DR:「决策依赖问题」不是一个规范术语,但它指向一个真实存在、横跨运筹学、经济学、控制论、博弈论与机器学习的问题家族。这个家族的共同结构只有一句话:决策会反馈回问题本身——你的选择会改变你面对的分布、你能获得的信息、他人的优化问题、乃至数据本身。本文从术语辨析出发,定位它在运筹学中的"真身"(决策依赖不确定性),区分它最易混淆的邻居(预测-优化范式),最后展开一张完整的家族地图,并给出一句可以检验任何问题的问句。

目录

  1. 从一个不规范的词开始
  2. 辨义:这个词可能指向哪里
  3. 真身:决策依赖不确定性
  4. 邻居:预测-优化范式
  5. 拉远:整个家族
  6. 一张地图,一句检验
  7. 参考文献

一、从一个不规范的词开始

所有精确的概念,都有一个不精确的起点。

设想有人问:“有没有一种东西叫决策依赖问题?”

这个问题有趣的地方在于:这个词查无出处——你在任何教科书的索引里都找不到它的规范定义。但它又不像是生造的,因为它的每一个音节都指向某种真实的东西。本文记录把这个概念钉死在地图上的过程:先排除两处相邻的地层,找到主矿体,再沿着矿脉四下张望,最后发现——这东西比想象中大得多。

二、辨义:这个词可能指向哪里

在非正式用法里,"决策依赖"有两处常见落点。

心理学:依赖型决策倾向。指难以独自做决定、需要他人持续提供建议和保证才能完成选择的行为倾向。它不是独立的临床诊断;当倾向严重到病理程度时,对应的是依赖型人格障碍(症状包括"让别人为自己做大多数重要决定")。近旁的概念还有决策疲劳(长期回避选择导致决策能力退化)与决策瘫痪(对后果的灾难化想象导致无法行动)。

经济学:路径依赖。由 David(1985)提出、经 North 系统化为制度变迁理论的正式概念:系统一旦进入某条路径,就会被规模经济、学习效应等自我强化机制"锁定",即使存在更优替代方案也难以突破。QWERTY 键盘击败效率更高的德沃夏克键盘,是它的经典案例。

而本文的主线,是它在运筹学中的那处落点——那里有一整个研究方向。

三、真身:决策依赖不确定性

3.1 经典随机规划的隐含假设

不确定性下优化的标准范式是这样一条链:

选一个决策 x → 随机因素 ξ 实现 → 得到结果 → 选 x 使期望结果最好

它有一个默认假设:ξ 的分布 P 是自然给定的、固定的,与你做什么无关。

以报童问题为例:明天的报纸需求是随机的,但这个需求的分布是客观存在的。你订 100 份还是 500 份,都不会改变"明天有多少人想买报纸"这个规律。用一句话说:你的决策只是在被动地应对随机性。

而决策依赖不确定性(decision-dependent uncertainty,DDU),又称内生不确定性(endogenous uncertainty),打破的正是这个假设——决策与随机机制之间,长出了一条反向的箭头。

3.2 三种箭头

箭头落在哪含义典型例子
概率分布随机参数的分布随决策改变R&D 投资额决定项目成功概率
信息结构不确定性何时、是否被揭示取决于决策只有钻井之后,才知道油田储量
不确定集鲁棒优化中的不确定集随决策变化安全投入越多,损失的不确定集越小

箭头落在分布上:R&D 项目组合是经典场景——投 500 万,项目成功率 20%;投 2000 万,成功率 60%。"项目成功与否"这个随机事件的分布,是你自己选出来的。此时目标函数里的期望不再是固定的E ξ [ ⋅ ] \mathbb{E}_\xi[\cdot]Eξ​[⋅],而是E ξ ∼ P ( x ) [ ⋅ ] \mathbb{E}_{\xi \sim P(x)}[\cdot]Eξ∼P(x)​[⋅]——连"在哪个分布下取期望"都取决于你。

箭头落在信息上:海上油气田开发是奠基性案例——地下储量是个客观事实,但你不钻井就永远不知道。钻井这个决策本身打开了信息的闸门。于是问题的性质变了:你不仅在选择"做什么",还在选择"花多少钱去知道什么"。这类问题的决策往往分阶段:先钻探(买信息)→ 看到结果 → 再定开发规模。临床试验排程、地质勘探、市场测试,都是这个模式。它的祖先可以追溯到 Weitzman(1979)的"潘多拉盒子"问题:只有打开盒子,才能看到盒子的价值。

3.3 为什么这类问题特别难

  • 非凸性:经典设定下,若Q ( x , ξ ) Q(x,\xi)Q(x,ξ)对x xx凸,则期望也凸;分布本身依赖x xx之后,目标函数一般变为非凸、甚至非连续;
  • 情景树失效:情景树方法假设信息按时间自然展开,但这里"信息是否被揭示"本身取决于你的行动——非预期性约束被"污染",标准的情景分解算法直接不可用;
  • 算法需要重造:析取规划重构、拉格朗日分解、定制的分支定界与有效不等式,都是为这条箭头付出的代价。

3.4 一句话定义

普通随机优化研究:在给定的不确定性面前,如何最优行动。
DDU 研究:当你的行动本身会改变你所面对的不确定性时,如何行动。

打个比方:前者是在固定的牌桌上打牌;后者是你的打法会改变牌堆里还剩什么牌。

四、邻居:预测-优化范式

描述到这里,容易产生一个误解——“这类问题是不是就是一个预测加一个优化?”

4.1 "一个预测 + 一个优化"确实是一个范式

它叫预测-优化(predict-then-optimize,PTO),结构正如字面:

数据 →预测模块→ 预测出参数 →优化模块→ 决策

当优化问题里的参数本身未知(明天的需求、路况、客户违约概率),就用机器学习先预测这些参数,再代入优化模型求解。预测每条路的通行时间 → 车辆路径优化;预测需求 → 库存优化。它的升级形态叫决策导向学习(decision-focused learning,DFL)。

这条线研究的核心痛点是:预测得好 ≠ 决策好。用 MSE 训练预测模型,但预测误差落在哪个方向、对下游决策的代价天差地别——需求预测偏高 10 件,可能只是多压点货;预测偏低,缺货损失可能是它的十倍。于是 DFL 干脆把优化层放进训练循环,让预测模型直接以"最终决策有多差"为目标来学。

4.2 知识问题 vs 结构问题

但 PTO 不是 DDU。区别在于箭头的方向:

预测-优化(PTO/DFL)决策依赖不确定性(DDU)
不确定性的性质外生、参数未知(知识问题)内生、被决策改变(结构问题)
整体形状流水线:数据→预测→优化→决策,到此为止闭环:决策→改变分布/信息→面对新的不确定性
若参数全知退化为普通确定优化仍是随机问题,且分布的形状由你选
核心研究内容预测误差与决策损失的错配反馈导致的非凸性、信息揭示的建模

用报童问题做"同病不同源"的对照最直观:你的报摊不知道明天需求的分布,用历史数据训练模型预测需求——这是 PTO 问题;你在短视频平台投放广告,投放力度直接改变明天的需求分布——这是 DDU 问题。同一个问题外壳,两种病。

关键是:这两种病可以同时得——既要预测(分布未知),又依赖(决策改变分布)。它们是正交的维度,可以叠加,近年也确实有工作把它们合在一起处理。

4.3 两者之间的桥

有一个概念恰好站在交界处:表演性预测(performative prediction,Perdomo et al., 2020)——你部署一个预测模型,人们依据它行动,行动改变了数据分布,于是模型面对的分布被模型自己扭曲。从机器学习那侧看,它是 PTO 的闭环化;从运筹那侧看,它就是"决策依赖分布"的特例(决策 = 部署哪个模型)。

五、拉远:整个家族

一旦习惯了寻找那条"指回来的箭头",你会发现它无处不在——横跨经济学、金融、控制论、博弈论、机器学习。分类标准只有一个:箭头落在什么上面。

5.1 落在分布上:你的行动改写你面对的随机规律

  • 卢卡斯批判(宏观经济学,1976):用历史数据估出的经济关系来设计政策,政策本身会改变这条关系——你脚下的地图,你一踩就过期。它可以看作表演性预测的经济学老祖宗。
  • 市场冲击(金融,Almgren–Chriss、Kyle 模型):你下多大的单,价格就被你推多少。大基金把大单拆成小单慢慢买,本质就是内化了自己对价格分布的影响。
  • 古德哈特定律 / reward hacking:指标一旦成为优化目标,行为分布就围绕指标重组,与真实目标脱钩——强化学习里那个发现"原地绕圈刷分比冲线得分更高"的赛艇游戏智能体,是经典一幕。
  • 同族:自我实现的预言(预言银行挤兑反而引发挤兑)、平均场博弈(每个人的决策共同构成所有人面对的"平均分布")。

5.2 落在信息上:你的行动本身就是侦察行动

  • 双重控制(dual control,控制理论,1960s):控制信号有双重作用——既驱动系统,又试探系统以降低参数不确定性。何时"稳稳地控制"、何时"故意扰动去学习",是控制论版的探索-利用。
  • 多臂老虎机 / 贝叶斯优化 / 主动学习 / 最优实验设计:拉一次杆的价值,一半在收益,一半在信息。
  • 贝叶斯劝服 / 信息设计(Kamenica & Gentzkow, 2011):走到极致的情形——你优化的对象干脆就是"别人能看到什么信息"。

5.3 落在他人的优化问题上:你的决策是他人世界的一部分

  • 双层优化 / Stackelberg 博弈:领导者选 x,追随者在 x 给定下解自己的优化问题,领导者预判这一切再选。LAX 机场的安保调度系统(ARMOR)是这个框架的真实部署。
  • 机制设计(“逆向博弈论”,2007 年诺奖方向):你优化的变量是游戏规则本身,所有参与者的行为——即结果的分布——是对规则的均衡反应。

5.4 落在数据上:你手里的样本是你自己造出来的

  • 强化学习:策略决定你访问的状态分布——RL 之所以比监督学习难,根源就是这条回路。
  • 离线策略评估 / 选择偏差:旧策略下收集的数据天然偏袒旧策略,拿它评估新策略会系统性跑偏。
  • 对抗适应:垃圾邮件过滤器一部署,垃圾邮件制造者随即调整策略——一场围绕你模型展开的分布军备竞赛。

5.5 为什么它们是一家人

两条深层共性。

数学上,它们最终都归结为不动点 / 均衡问题:解一个优化 → 环境响应 → 旧解失效 → 再解……"稳定"的解是这条循环的驻点。表演性预测里叫 performatively stable point,博弈论里叫均衡,计量经济学里叫联立方程的一致解——同一件事的不同方言。

因果上,它们都在同一个地方翻车:

数据告诉你的是P(结果 | 观察到 x),而优化需要的是P(结果 | 由我做 x)。

凡是你自己站在因果环路里的地方,这两个量就会分叉。predict-then-optimize 流水线在这些场景里系统性失灵,正是因为它偷偷假设了两者相等。

六、一张地图,一句检验

箭头落在哪代表问题大本营
概率分布卢卡斯批判、市场冲击、古德哈特定律经济学、金融
信息结构双重控制、老虎机、信息设计控制论、运筹
他人的优化问题双层优化、机制设计博弈论、运筹
数据分布RL 探索、离线评估、对抗适应机器学习

判断任何一个问题是否属于这个家族,只需要问一句:

“把我的决策固定住,我面对的世界会不会不一样?”

——如果会,你就在这张地图上。

世界上的问题分两种:一种是你把决策固定住、世界还是原来那个世界的问题;另一种是你把决策固定住、世界已不再是原来那个世界的问题。后者是本文的主题——它们更难,因为每当你伸手,问题本身就在移动。

参考文献

  1. Jonsbråten, T. K., Wets, R. J.-B., & Woodruff, D. L. (1998). A class of stochastic programs with decision dependent random variables.Operations Research, 46(3).
  2. Goel, V., & Grossmann, I. E. (2006). A class of stochastic programs with decision dependent uncertainty.Annals of Operations Research, 142.
  3. Solak, S., Clarke, J.-P. B., Johnson, E. L., & Barnes, E. R. (2010). Optimization of R&D project portfolios under endogenous uncertainty.European Journal of Operational Research, 207(2).
  4. Hellemo, L., Barton, P. I., & Tomsgard, A. (2018). Decision-dependent probabilities in stochastic programs with recourse.Computational Management Science, 15.
  5. Apap, R. M., & Grossmann, I. E. (2017). Models and computational strategies for multistage stochastic programming under endogenous and exogenous uncertainties.Computers & Chemical Engineering, 103.
  6. Weitzman, M. L. (1979). Optimal search for the best alternative.Econometrica, 47(3).
  7. Donti, P. L., Amos, B., & Kolter, J. Z. (2017). Task-based end-to-end model learning.NeurIPS.
  8. Elmachtoub, A. N., & Grigas, P. (2022). Smart “predict, then optimize”.Management Science, 68(1).
  9. Perdomo, J., Zrnic, T., Mendler-Dünner, C., & Hardt, M. (2020). Performative prediction.ICML.
  10. Kamenica, E., & Gentzkow, M. (2011). Bayesian persuasion.American Economic Review, 101(6).
  11. Lucas, R. E. (1976). Econometric policy evaluation: A critique.Carnegie-Rochester Conference Series on Public Policy, 1.
  12. Feldbaum, A. A. (1960–1961). Dual control theory (I–IV).Automation and Remote Control.
  13. Almgren, R., & Chriss, N. (2001). Optimal execution of portfolio transactions.Journal of Risk, 3(2).
  14. Kyle, A. S. (1985). Continuous auctions and insider trading.Econometrica, 53(6).
  15. David, P. A. (1985). Clio and the economics of QWERTY.American Economic Review (Papers & Proceedings), 75(2).
  16. North, D. C. (1990).Institutions, Institutional Change and Economic Performance. Cambridge University Press.

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询