不确定性决策准则与数字时代应用
课堂笔记(按讲授顺序整理)
第一部分:不确定性决策的五大准则
【背景】面对不确定性时,人容易焦虑。老师先分享了一个心态:当你纠结焦虑时,告诉自己最坏的结果会发生,如果最坏的情况没发生,就会觉得特别舒服——这就是悲观法的心理基础。
一、乐观法(大中取大 / Maximax)
核心逻辑:比较每个方案的最好结果,从中再选最优。一句话总结:只盯着最好的可能。
决策步骤:
1. 找出每个方案在各种状态下的最大收益值。
2. 在所有方案的最大收益值中,选最大的那个方案。
性格映射:反映了一种人类天然的性格——盲目乐观型。只关注最好的可能,不考虑风险。
案例应用:以希尔顿机场选址为例——A 处购买地(状态 A 发生则收益13,状态 B 发生则损失12)、B 处购买地、AB 都买、AB 都不买。乐观法会选每个方案中收益最大的那个,然后从中挑最优。
二、悲观法(小中取大 / Maximin / 瓦尔德准则)
核心逻辑:考虑最坏的那个结果,在坏中选优。一句话总结:先问最坏能有多坏,然后从最坏的结果中选最好的。
决策步骤:
1. 找出每个方案在各种状态下的最小收益值(最坏情况)。
2. 在所有方案的最坏结果中,选最大的那个方案(矮子里面拔将军)。
案例应用:希尔顿机场选址
四个方案:A 处购买、B 处购买、AB 都买、AB 都不买。每个方案的最坏情况:
A 处购买 → 最坏是 −12(政府在 B 建机场)。
B 处购买 → 最坏是 −8(政府在 A 建机场)。
AB 都买 → 最坏是 −5(政府在 A 建机场)。
AB 都不买 → 最坏是0(没有赚头也没有损失)。
坏中求好:选 AB 都不买(最坏情况是0,比其他方案的最坏情况都好)。
优缺点:
优点:保守稳健,规避最大风险。
缺点:错失 A 方案的最大收益可能性(如果政府在 A 建机场,A 方案能赚13,但悲观法直接排除了)。
心理机制:老师分享个人经历——疫情期间家人检查,医生说要等三天出结果。老师作为教决策的学者,发现自己宁愿医生当场告诉他是癌(最坏结果确定了),也不愿等三天煎熬。
因为确定了最坏结果,就可以规划应对方案;而不确定性带来的焦虑远超结果本身。
这说明老师性格偏悲观型——先做好最坏打算,如果结果比预期好,就会特别愉悦。
三、最小最大后悔值法(Minimax Regret / 萨维奇准则)
核心概念:什么是后悔值
后悔值 = 你选了某个方案后,发现未来状态发生时,你本可以选到更好的那种损失感。
关键!后悔值是纵向比的,不是横向比的!
纵向比 = 在同一状态下,拿该状态下最好的方案减去你选的方案的收益。
为什么不能横向比?因为状态是不可控的(政府选址你决定不了),你只能控制自己选哪个方案。横向比就等于上帝视角——假设你能控制政府选址,这逻辑不通。
三步法(三道弯)
第一步:把决策矩阵转换成后悔值矩阵。每个状态下,找到该状态下所有方案中最大的收益值,然后用这个最大值减去每个方案的收益值。
举例:在状态 A 下,A 处购买收益13,B 处购买收益 −8,AB 都买收益5,AB 都不买收益0。状态 A 下最大收益是13(A 处购买),所以:
A 处购买的后悔值 = 13 − 13 = 0。
B 处购买的后悔值 = 13 − (−8) = 21。
AB 都买的后悔值 = 13 − 5 = 8。
AB 都不买的后悔值 = 13 − 0 = 13。
同理计算状态 B 下的后悔值。
第二步:找出每个方案的最大后悔值。每个方案在不同状态下后悔值不同,取其中最大的那个。这代表了这个方案在最差情况下你会多后悔。
第三步:在所有方案的最大后悔值中,选最小的那个。选择最大后悔值最小的方案,即选错了也最不难过的方案。
案例结果:
A 处购买 → 最大后悔值 = 23。
B 处购买 → 最大后悔值 = 21。
AB 都买 → 最大后悔值 = 8(最小,选这个)。
结论:选择 AB 都买(最小最大后悔值)。
记忆口诀:最小最大后悔值 = 先找每个方案的最大后悔,再选其中最小的。选错了也最不难过。
四、折中法(赫维茨准则 / Hurwicz Criterion)
核心逻辑:既不是盲目乐观,也不是完全悲观,而是介于两者之间。每个人对自己的乐观程度赋值一个系数 a(0到1之间)。
a = 乐观系数:a 越大越乐观,a 越小越悲观。例如 a = 0.4,意味着你认为40% 的情况会往好的方向发展,60% 的情况会往差的方向发展。
计算方法:当只有两个状态时,折中值 = 最大值 × a + 最小值 × (1 − a)。当有多个状态时(如 A、B、C 三个状态),仍然只挑最大值和最小值,用同样的公式计算。最后在所有方案的折中值中选最大的那个。
案例计算(a = 0.5):
同理计算其他方案,最后选择折中值最大的方案。结论:选择 AB 都买。
系数的灵活性:a 取多少没有标准答案,取决于个人性格和当下心态。心情好时可能乐观系数到0.8,心情差时可能降到0.2。老师建议可以先取0.5作为默认值。
五、等可能法(拉普拉斯准则 / Laplace Criterion)
核心逻辑:因为没有充分理由判断哪种状态更可能发生,所以假定每种状态发生的概率相等。两个状态就各50%,三个状态就各1/3,以此类推。这是最早由拉普拉斯(Laplace)提出的方法,老师称之为最笨的方法——干脆等概率分配。
计算方法:每个方案的期望值 = 各状态收益 × 等概率(1/n)的总和,然后选期望值最大的方案。
六大准则总结对比
乐观法(大中取大):只盯着最好的可能,选各方案最好结果中最大的。
悲观法(小中取大):先问最坏能有多坏,选各方案最坏结果中最好的。
折中法(赫维茨准则):用系数 a 平衡乐观与悲观,折中值 = 最大值 × a + 最小值 × (1 − a)。
最小最大后悔值法(萨维奇准则):先算后悔值矩阵,再找每个方案的最大后悔值,选其中最小的。
等可能法(拉普拉斯准则):假定所有状态等概率发生,选期望值最大的。
为什么没有最好的准则?
老师强调:面对不确定性决策,除非你是上帝能看到未来,否则无法判断哪种方法最优。每种方法各有利弊,关键在于了解自己是哪种性格类型,在不同场景下匹配不同的决策思路。
决策准则与性格匹配
乐观法 → 盲目乐观型:只看好的一面。
悲观法 → 保守悲观型:先想最坏打算,超出预期则愉悦。
折中法 → 理性平衡型:给乐观悲观加权。
最小后悔值法 → 后悔规避型:选错了也不难过。
等可能法 → 平等分配型:不偏不倚。
老师分享:自己大概率是悲观型,但买演唱会票时突然变乐观了——说明具体问题要具体分析,没有一种性格在所有场景下都适用。
第二部分:数字时代的不确定性挑战
数字时代没有淘汰过去的决策准则,而是改写了它们的适用条件。以下探讨数字时代给不确定性决策带来的新挑战。
一、信息过载(Information Overload)
问题本质:决策需要信息,但信息太少(选择不充分)和信息太多(信息超载)都有问题。
信息过窄:选择依据不充分,决策盲目。
信息超载:个人脑力无法处理海量信息,无法逐一核实,只能像赌博一样筛选。
案例1:新冠疫情早期信息。2019年底老师跟研究生庆祝元旦。2020年1月1日吃饭时学生说 SARS 又来了,老师当时还反驳。结果没过几天证实了,1月20多号封城,老师被封在武汉。
这体现了信息爆炸时代,早期信号被海量信息淹没,等确认时已经来不及。
案例2:明星高考分数谣言。老师在小红书看到帖子说演员李云瑞(华科毕业)高考600多分。老师知道他是体育生,第一反应不信。但随后看到不同帖子说610分、630分、620分——信息爆炸,三人成虎,一瞬间开始怀疑是不是真有可能。
老师去问周围老师,大家都说不可能。最后问带体育班的孙春霞老师,确认绝对不可能。
启示:信息过载 + 真假难辨 = 很难辨别真相。大量谣言、阴谋论泛滥。
二、后真相时代与阴谋论(Post-Truth Era)
核心特征:
真假难辨:无法确定信息何为真、何为伪。
阴谋论:既不能证实也不能证伪,最终在你心中形成难以磨灭的印象。
一旦印象形成,即使后来有证据反驳也难以消除。
案例1:爱泼斯坦案(公共事件)。爱泼斯坦是美国有政治前科的人物,在狱中自杀——用绳子上吊,但监狱摄像头刚好那几秒钟没拍到。他手里掌握大量高端政客和有钱人的黑料,正要逐个曝光。在一个戒备森严的监狱里自杀了,多年后相关证据通通消失。
影响:导致公众对政府不信任,每次类似事件出现,人们会本能地怀疑政府就是这样办事的。
案例2:明星八卦谣言。沈腾与林允的婚外情谣言,说得有鼻子有眼。虽然年龄差、时间线都对不上,但评论区有人用越不可能传得越离谱说明越是真的这种逻辑来佐证。老师指出:即使你知道不能相信,但印象已经留在脑海中,难以消除。
案例3:高校教师学术不端争议。五大高校 PPT 事件,有人质疑学术署名、劳务费等。但官方尚未有确凿调查结果,网友已经百分之五十相信了。老师指出:没有学生出来实名实锤,官方调查也有难度。但印象一旦形成就很难消除。
三、面对未经核实的信息,不同准则的行为方式
乐观法 → 直接采信最符合自己预期的版本(如我相信内部人士的爆料)。
悲观法 → 默认所有未经核实的信息都不可信(让子弹飞一会儿,官方没确认前什么都不信)。
折中法 → 部分采信,给每个版本标注可信度(但实际操作很难,人类大脑不是这样运作的)。
最小后悔值法 → 不转发、只围观,选择即使错了带来最小信息损失的策略(老师推荐的方式)。
数字时代的三大陷阱:
1. 算法推荐 → 让乐观更危险(只推送你想看的)。
2. 信息过载 → 让悲观法失效(信息太多,根本来不及核实)。
3. 情绪极化 → 让折中法最难实行(极端情绪让人难以理性权衡)。
四、电子商务中的决策挑战
网购的不确定性:网购看不见摸不着,永远不确定商品实际质量。
乐观法 → 只看最佳结果(万一更好用呢),冲动下单。被首发限量、错过就没有等话术刺激。
安于现状(Status Quo Bias)→ 冲动下单后拿到手不想退,懒得退。这是最危险的组合。
悲观法 → 锁定最差结果,可承受才行动。比如挑七天无理由、运费险、比销量。老师同事的秘诀:在京东下单,找销量最高的(大家已经帮你验证过了)。
折中法 → 考察很多信息(好评率、价格、测评),但信息爆棚也很累,时间消耗大。
最小后悔值法 → 买错了也不心疼,破财消灾,接受损失。
平台策略对用户决策的利用(平台知道你的决策倾向,针对性地设计策略):
包运费、运费险 → 戳中悲观法(退了也不亏)。
先用后付 → 降低决策门槛。
直播话术:主播和厂家砍价表演 → 刺激乐观法(全网最低价、帮你把价格打下来)。
盲盒(泡泡玛特):现场开盒的刺激感 → 让人愿意为可能开出隐藏款的乐观预期买单。
直播电商的负面影响:直播吸走了线下经济的资金和流量。线下店没有溢价权,被平台抽取大部分利润。制造业尤其是小型加工企业很受伤。对个体而言需要理性适应,但对整个商业环境产生了冲击。
五、求职与职业发展中的不确定性
当前就业环境:
经济下行,企业利润变薄,外贸比例下降,内循环未充分发展。
工业克苏鲁称号——个人买东西很便宜,但企业间恶性竞争、价格战。
企业竞争内卷 → 盈利下降 → 招工减少、工资降低。
AI替代基础岗位 → 就业岗位减少。
结论:考公务员 / 保编制成为第一选择(十几年前学生都想去互联网大厂)。
六、数字时代决策自检清单
老师总结:数字时代没有淘汰过去的决策准则,而是改写了适用条件。以下是面对不确定性时的自检方法:
1. 觉察自己正在用什么准则做决策?是主动选择还是被算法操控?
2. 做悲观法自检:不管多兴奋,适当考虑最差的情况是什么。
3. 警惕算法操控:你看到的最好情况是不是被平台过滤过的?是不是只推送了你愿意相信的信息?(信息茧房 / 气泡效应)
4. 不确定性转化检验:值不值得花成本去获取更准确的信息?比如买同一个商品比较不同商家,测量信息成本和收益。
5. 后悔检验:你的后悔会持续多久?你在互联网上的一言一行都可能被永久记录和传播,后悔成本可能远超线下。
数字时代的核心变化:
1. 概率背后是信息——获取信息需要花时间和成本。
2. 算法潜移默化侵蚀你的决策权(推荐算法让你只看同类型信息,误以为这就是共识)。
3. 后悔成本不对称——互联网上的言行会永久存档传播。
第三部分:风险型决策(期望值准则与决策树)
风险型决策与不确定性决策的区别:风险型决策中,各种自然状态的发生概率是已知的(可以通过历史数据统计得出)。
一、期望值准则(Expected Value Criterion)
与不确定性决策的区别:
不确定性决策:不知道各状态发生的概率。
风险型决策:知道各状态发生的概率(如通过历史数据统计)。
案例:希尔顿机场选址(已知概率)。假设通过统计过去100个机场选址案例,测算出:
政府在 A 建机场的概率 。
政府在 B 建机场的概率 。
计算方法:每个方案的期望值 = 各状态收益 × 该状态概率的总和。
选期望值最大的方案。
期望值的含义(非常重要!):期望值 = 平均值,不是确定值!举例:抛硬币,正面赢10元(概率0.5),反面赢0元(概率0.5),期望值 = 元。
但实际每一次玩,你要么得到10元,要么得到0元,永远不会得到5元。
期望值的意义是:如果你重复玩很多次,平均每次能得到5元。所以期望值准则适用于同类型问题重复多次的场景。单次决策中,期望值只是一个参考值,不保证实际结果。
二、决策树(Decision Tree)
什么是决策树:决策树是一种将复杂风险型决策问题可视化表达的工具。把决策问题映射到一棵树上,通过树的结构来辅助决策。现实中的复杂决策可以用计算机程序模拟表达,实验课会用 Excel 的决策树模块来做。
决策树的构成要素
节点(三种):
1. 决策节点(方框)→ 你要做的选择,有几个方案就有几个分支。
2. 状态节点(圆圈)→ 未来可能发生的状态,有几个自然状态就有几个分支。
3. 结果节点(三角形)→ 某个方案在某个状态下带来的最终收益。
分支(树枝):
从决策节点引出的分支 → 代表你的方案(你可控的)。
从状态节点引出的分支 → 代表自然状态(你不可控的),标注概率 。
决策树的画法:从左到右画树,从右到左计算(回溯法)。
1. 从决策节点出发,画出所有方案分支。
2. 每个方案分支末端连接状态节点,画出所有状态分支并标注概率。
3. 每个状态分支末端标注对应收益值。
4. 从右到左计算:每个状态节点的期望值 = 各分支收益 × 概率的总和,然后选期望值最大的方案。
考试注意事项:决策节点必须是方框,状态节点必须是圆圈!画错了 Excel 工具会按错误的节点类型计算,结果全错。
三、课堂练习(四种准则对比)
老师给出一个新的决策矩阵(A、B、C 三个方案,三种状态),让学生用四种准则计算:
练习结果:
乐观法 → 选 C 方案(各方案最大收益中最大的)。
悲观法 → 选 B 方案(A 最坏 −80,B 最坏 −40,C 最坏 −20,坏中求好选 B)。
最小后悔值法 → 选 C 方案。后悔值矩阵计算:每个状态下,用该状态下最大收益减去各方案收益。A 方案最大后悔值 = 200,B 方案最大后悔值 = 140,C 方案最大后悔值 = 100。选最大后悔值最小的 → C 方案。
折中法(a = 0.4)→ 每个方案:最大值 × 0.4 + 最小值 × 0.6,选结果最大的。
全文总结:不确定性决策知识框架
不确定性决策(不知道概率):
1. 乐观法:大中取大 → 只看好的一面。
2. 悲观法:小中取大 → 先想最坏打算。
3. 折中法:赫维茨准则 → a 加权平均。
4. 最小后悔值法:萨维奇准则 → 选错了也不难过。
5. 等可能法:拉普拉斯准则 → 等概率分配。
数字时代的新挑战:
1. 信息过载 → 真假难辨。
2. 后真相 → 阴谋论印象难以消除。
3. 算法操控 → 信息茧房。
4. 平台策略 → 利用你的决策倾向。
5. 求职环境 → AI替代 + 内卷 → 保编制。
风险型决策(知道概率):
1. 期望值准则:各收益 × 概率之和,选最大的。
2. 决策树:方框 = 决策节点,圆圈 = 状态节点,三角形 = 结果节点。
3. 从左到右画树,从右到左计算。
