使用说明 · 30 秒
管理定量研究方法·开卷考试复盘提纲 · 使用说明(先读这里,30 秒)
- 本提纲所有页码 =《管理定量研究方法_完整讲义_英中对照-formatted.pdf》的 PDF 页码(全书共 113 页)。考场上翻 PDF 直接用这里的页码。
- 结构:第一部分全书总图(纲)→第二部分分章提纲(目,每节给英文关键词缩写 + 页码指引)→第三部分公式速查→第四部分英文答题弹药库(开卷要英文作答,直接背/抄这些句型)→第五部分跨章对比表(最爱考)→第六部分考场策略与复习节奏。
- 标记含义:必须背熟(闭眼能写)|重点(会认、能翻到)|快速过(考到能找着即可)。
- 英文关键词已尽量缩写:corr=correlation、reg=regression、dist=distribution、hyp=hypothesis、est=estimation、var=variable、coef=coefficient、sig=significance、fn=function。
第 1 页
纲 · 一条研究流水线
第一部分 全书知识总图(纲)
管理定量研究方法 = 一条完整的研究流水线
- Ch1 导论 ………… 为什么做定量研究(p1-5)
- qual vs quant vs mixed|描述-解释-预测-处方|研究四步
- Ch2 数据特征 ………… 数据长什么样(p6-17)核心基础章
- 4 种尺度 N-O-I-R|3 种数据类型|集中趋势+离散程度|正态分布+t 分布
- Ch3 数据处理 ………… 数据从哪来、怎么洗(p17-35)
- 一手:问卷(设计+信度+效度)|二手:数据库+缺失值|PCA 降维|熵权法
- Ch4 假设检验 ………… 统计推断的总开关(p35-43)全书逻辑核心
- 反证法+小概率原理|H0/H1|五步流程|单双侧
- Ch5 线性回归 ………… 连续因变量(p43-73)分值最高章
- 相关 r→简单回归 OLS→五大假设→BLUE→R²→t 检验/F 检验→多元回归
- Ch6 离散选择模型 ………… 分类因变量(p73-86)
- 二元 Logit(odds/OR/MLE)|Probit|多项 Logit|有序 Logit/Probit
- Ch7 面板数据 ………… 截面×时间(p87-99)
- 优点(遗漏变量/异质性)|FE(LSDV/组内/一阶差分)vs RE(FGLS)|Hausman
- Ch8 研究设计 ………… 怎么写一篇论文(p99-113)
- 三性(科学/创新/理论)|结构(前置-主体-后置)|文献综述|范文解读
一页记住全书:Ch1 定方向 → Ch2 认数据 → Ch3 备数据 → Ch4 学思想 → Ch5/6/7 三大模型(按因变量类型+数据类型选:连续→Ch5;0/1 或分类→Ch6;面板→Ch7)→ Ch8 写成论文。
第 2 页
Ch1 导论 p1-5 · 快速过
第二部分 · Chapter 1 导论(p1-5)快速过
| 知识点 | 英文关键词 | 一句话要义 | 翻阅 |
|---|---|---|---|
| 三种实证方法 | qual / quant / mixed methods | 定性用文字,定量用数字,混合两者结合 | p1 |
| 定性研究方法 | interview, observation, case study; field notes, transcripts, memos | 访谈/观察/案例;原始数据=笔记、转录、录音等 | p1 |
| 定量方法四大功能 | Describe → Explain → Predict → Prescribe | 描述已发生→解释为何→预测未来→处方对策 | p2 记这四个动词 |
| 定量研究一般过程 | hypothesis → data → test → corr(X,Y) | 提假设→收数据→检验变量关系→判断相关程度 | p2 |
| PCT 专利案例 | AI patent, geographic concentration | 数据揭示规律:AI 专利集中于中美 | p3 |
| 人均 GDP 门槛 | per capita GDP $3,000 threshold | 跨越门槛→城市化/中产/消费升级 | p3 |
| 大数据时代 | big data; data as factor of production; National Data Bureau (2023.10) | 数据成为新生产要素(与土地劳动资本技术并列) | p4 |
| PAR/JPART 统计 | quant research >60% of empirical studies | 定量研究在公管顶刊占主导 | p4-5 |
第 3 页
Ch2 数据特征 p6-17 · 必复习
Chapter 2 数据特征(p6-17)必复习
2.1 四种测量尺度(p6-7)必背顺序 N→O→I→R
| 尺度 | 英文 | 能做什么 | 不能做什么 | 例子 | 翻阅 |
|---|---|---|---|---|---|
| 定类 | Nominal scale | 只分类 | 排序、运算 | 性别 0/1 | p6 |
| 定序 | Ordinal scale | 分类+排序 | 加减乘除 | 一二三等品;李克特 5 点 | p6-7 |
| 定距 | Interval scale | 分类+排序+差值有意义,可加减 | 无绝对零点,不能比倍数 | 摄氏温度 | p7 |
| 定比 | Ratio scale | 全部运算,有 absolute zero | — | 工资、身高 | p7 |
- 定类尺度两要求:exhaustiveness 穷尽性 + mutual exclusivity 互斥性(p6)
2.2 数据类型(p8)
- Qualitative data(定性)= nominal + ordinal;Quantitative data(定量)= interval + ratio
- Cross-sectional(截面:同一时点多个体)/ Time series(时序:一个体多时点)/ Panel(面板:多个体×多时点)——例:2020 各省 GDP / 湖北 2000-2020 GDP / 各省 2000-2020 GDP
2.3 描述统计三大件(p8-12)
第 4 页
| 维度 | 指标 | 英文 | 要点 | 翻阅 |
|---|---|---|---|---|
| 集中趋势 central tendency | 均值 | (arithmetic) mean | 最常用;受 outlier 影响 | p9-10 |
| 几何平均 | geometric mean | 连乘开 n 次方 | p9 | |
| 中位数 | median | 排序后中间值;不受 outlier 影响;适合 ordinal | p10 | |
| 众数 | mode | 出现最多;可无/可多;nominal 也能用 | p10 | |
| 离散程度 dispersion | 极差 | range | max-min | p11 |
| 方差 | variance | 最重要的离散度量 | p11 | |
| 标准差 | standard deviation | 与原始数据同量纲 | p11-12 | |
| 变异系数 | 相对离散度;比较不同量纲/均值的数据(股票 A/B 例) | p12 | ||
| 分布形状 | 对称/偏 | symmetry / skewness | — | p8-9 |
2.4 正态分布(p13-16)
第 5 页
- 历史:de Moivre 1733 提出,Gauss 用于天文 → 又称 Gaussian dist(p13)
- 密度函数参数:=总体均值、=总体方差、、;记法 (p13)
- 五大特征(p14-15):①关于 对称;②f(x) 在 取最大;③两个拐点 inflection points 在 ;④ 定位置、 定形状( 大→扁平分散, 小→陡峭集中);⑤两侧无限延伸,以 x 轴为渐近线 asymptote
- 标准正态分布:;换算 (p15-16)
- 3σ 法则(p16):→68.27%,→95.45%,→99.73%
2.5 t 分布(p16-17)
- 记法 ,n=自由度 degrees of freedom
- 与正态同:对称钟形,mean=median=mode 重合
- 与正态异:尾部更厚(小样本不确定性);df→∞ 收敛于 N(0,1);df>30 即很接近
第 6 页
Ch3 数据处理 p17-35
Chapter 3 数据处理(p17-35)
3.1 一手数据:问卷调查(p17-22)
- 定义:设计问题直接收集 raw data;价值:避免二手数据过时/口径偏差,“量身定制”(p17)
- 三类问卷(p17-18):Structured(预设选项,标准化、高效,但限制表达)/ Unstructured(开放回答,深入但需人工编码)/ Semi-structured(混合,兼顾效率与深度)
- 问卷设计四步(p19-22):
- 明确目的+目标群体(大学生 ≤15 分钟;中老年简化语言)p19
- 问题设计:Likert 5-point scale、matrix items;措辞原则=避免歧义、保持中立、不用引导性问题 leading questions p19
- 质量控制 4 类题(p20-21):陷阱题 trap questions(明确指示型/重复一致性/常识题/反向逻辑题);放问卷中部,2-3 题
- 结构:开头(标题+问候+说明)→主体(背景→行为→态度,难度递进)→结尾(致谢+开放补充)p21-22
- 预调查 pre-survey:抽目标群体 10%-20%;查回答时长/歧义/跳题逻辑,然后修订(p22)
3.2 信度与效度(p23-27)高频考点
第 7 页
| 信度 Reliability | 效度 Validity | |
|---|---|---|
| 定义 | 同一方法反复测同一对象,结果一致的程度(p23) | 测到想测的东西的程度=准确性/真实性(p24) |
| 指标 1 | Cronbach’s α(内部一致性;α>0.7 好/0.8 优/0.9 非常高)p23 | Content validity 内容效度(覆盖概念全维度;专家判断;CVR,N=5 时 >0.74)p25-26 |
| 指标 2 | Test-retest 重测信度(不同时间测同组人,r>0.7 良好)p24 | Construct validity 构念效度(因子分析; 1-3 好、2-5 可接受;CFI>0.9;TLI>0.9)p26 |
| 指标 3 | — | Criterion validity 效标效度(与外部标准一致;Pearson r)p27 |
- 记忆口诀:信度=稳不稳,效度=准不准;信度是效度的必要非充分条件。
3.3 二手数据(p27-28)
- 三来源:公开数据(统计年鉴)、非公开(企业财报)、网络爬取 web crawler(p27)
- 四大国家级数据库(p28):国家统计局数据库 / CGSS 中国综合社会调查(人大,2003)/ CSS 中国社会状况综合调查(社科院,2005)/ CFPS 中国家庭追踪调查(北大,微观数据)
3.4 缺失值处理(p28-29)
- 直接删除:缺失随机且比例
- 插补 imputation:均值/中位数(数值型)、众数(分类型)、线性插值(时序数据)、回归插补(用相关变量预测)
第 8 页
3.5 主成分分析 PCA(p29-32)
- 目的:降维 dimensionality reduction;把多个相关变量→少数不相关主成分(线性组合),按方差排序,方差越大信息越多(p29)
- 五步(p30-32):①标准化(Z-score)→②算协方差矩阵→③求特征值+特征向量→④定主成分个数(累积贡献率 ≥85%)→⑤算主成分得分(排序/聚类)
3.6 熵权法(p32-35)
- 信息熵=系统无序/不确定性程度;指标变异越大→熵越小→信息越多→权重越大(p32)
- 客观赋权,用于多准则综合评价
- 五步(p32-35):①归一化(极差法,正/负向指标公式不同)→②算比重 →③算熵值 ( 时调成 0.001 以便算 )→④算差异系数 →⑤算权重 → 加权和算综合得分
第 9 页
Ch4 假设检验 p35-43 · 思想核心
Chapter 4 假设检验(p35-43)全书思想核心
- 引入案例:女士品茶 Lady Tasting Tea(Fisher,8 杯奶茶挑 4 杯,纯猜对概率 =1/70≈0.014,太小→不信是猜的)(p35-37)
- 概念(p38):对总体参数(均值/方差)或分布形式做先验假设,用样本数据判断是否成立。又名 significance test 显著性检验
- 两大思想支柱(p38):反证法 proof by contradiction + 小概率事件原理(小概率事件在一次试验中几乎不可能发生;发生了→怀疑原假设)
- 显著性水平 :常用 0.01 / 0.05 / 0.1,研究者事先定; 表示“错误拒绝 H0 的概率 <1%”(p38)
- 五步流程(p39)必背:
- State H0 (null) & H1 (alternative)
- Select test statistic & its distribution
- Determine rejection region at given
- Calculate observed value, compare
- Make statistical decision
- 全聚德鸭子案例(p39-41):H0: vs H1:;n=100 大样本+ 已知→z 统计量 ;算得 z=-6 < -1.96 落入拒绝域→拒绝 H0,鸭子不达标
- 单双侧检验(p42-43):
- Two-tailed:拒绝域平分两尾;H1:;只想知道“有没有差异”时用
- One-tailed:拒绝域在一尾;左尾 H1: / 右尾 H1:
- 选择规则:实验设计阶段由专业知识定;无先验方向→双侧;有理论/经验表明 A 不差于 B、只想验证 A 更好→单侧(p43)
第 10 页
Ch5 线性回归 p43-73 · 分值最高
Chapter 5 线性回归(p43-73)分值最高
5.1 相关分析(p44-49)
- 变量关系三种(p44):deterministic functional(一对一确定)/ statistical correlation(不确定,含 )/ none;用 scatter plot 散点图看
- 相关分类(p45):按变量数=simple vs multiple;按形式=linear vs nonlinear;按方向=positive vs negative;按程度=perfect / imperfect / no corr
- 总体相关系数 (p46):公式含 协方差;X,Y 独立 →Cov=0; 是客观常数、无量纲、
- 样本相关系数 r(p47):用观测值估计 ,是随机变量
- r 的性质(p47-48):;r>0 正相关/r<0 负相关/r=0 无线性关系/|r|=1 完全线性;对称 ;只测线性;不能推因果
- r 的检验(p49):H0:;t 统计量 ; 拒绝 H0,相关显著
5.2 简单线性回归(p50-63)
第 11 页
- 回归的目的(p50):用固定的自变量估计因变量的均值(总体→样本→估计→回总体)
- PRF 总体回归函数 ;一般式 (p50)
- SRF 样本回归函数 ;一般式 (p51)
- 五大经典假设(p51)必背:①零均值 ;②同方差 homoscedasticity ;③无自相关 ;④ 与 X 不相关;⑤正态性
- OLS 普通最小二乘(p52-54):原理=最小化残差平方和 RSS;对 a、b 求导、令一阶导=0 解出
- Gauss-Markov 定理(p55):OLS 估计量是 BLUE = Best Linear Unbiased Estimator(最佳线性无偏估计量):线性+无偏+方差最小
- 的无偏估计(p56):用
- 拟合优度(p56-57):(总离差平方和=解释+残差);
- 特征(p57):非负、、随机变量;简单回归中
- 回归系数 t 检验(p57-59):H0: vs H1:;;四步:提假设 → 算统计量 → 给 查临界值 → 比较下结论
- p 值(p59):H0 成立时得到观测统计量(或更极端)的概率;p<α 拒绝 H0;p>α 不拒绝
- 银行不良贷款例题(p60-63):;(贷款余额解释不良贷款变异的 71.16%);t=7.53>2.20 拒绝 H0;评价回归结果 4 问:系数符号合理论?显著吗? 多大? 正态吗(残差直方图/正态概率图)
5.3 多元线性回归(p64-73)
第 12 页
- 为什么要多元(p64):冰淇淋销量与儿童溺水=典型 spurious regression 虚假回归——共同受温度影响;多元回归能控制其他变量、逼近因果
- 模型(p65):矩阵形式 ;假设=简单回归 5 条+第 6 条:自变量间无完全相关(X 满列秩, 可逆)
- OLS 矩阵解(p66-67):;仍是 BLUE;,k=参数个数(含常数项)
- 调整 (p68-69): 随变量增多只增不减→不同变量数的模型不能直接比 ;调整 纳入 k 做惩罚,在解释力与简约性 parsimony 间权衡
- 单个系数:t 检验(p69);整体方程:F 检验(p70):基于 ANOVA 方差分析;H0:;
- 章小结 p71;重要公式汇总 p72-73(考前最后翻这两页!)
第 13 页
Ch6 离散选择 p73-86
Chapter 6 离散选择模型(p73-86)
- 现实问题(p73-74):选食堂/考研/通勤方式;公管例=政策创新扩散(采纳或不采纳)、部门终止(终止 vs 存续)、调查量表(很难~很容易)
- 共同特征(p75):因变量是分类变量;自变量无量纲要求;研究“哪些因素影响分类结果的发生”
- 三大家族(p75):Binary 二元 / Multinomial 多项 / Ordered 有序
6.1 二元 Logit(p75-81)
- 为什么不用线性回归:线性模型无法保证预测值落在 (p75)
- 模型:,S 形曲线=logistic 分布(p76)
- Logit 变换(p77):(对数变换后对自变量线性)
- 估计:MLE 极大似然(p77-78):选参数使观测样本出现概率最大;软件迭代求解
- 系数解释(p78-79):=截距(所有 X=0 时的 );=某自变量每增加 1 单位(其他不变)引起的 变化
- Odds 优势(p79)=两结果概率之比 ;抛硬币例:均匀→odds=1,偏币(2/3 vs 1/3)→odds=2
- Odds Ratio 优势比 OR=(p79-80):β>0→OR>1 正向效应;β<0→OR<1 负向;β=0→OR=1 无效应(p80-81)
- 拟合优度(p81):①Accuracy rate 准确率(预测概率 >0.5 判 1,否则 0,对比实际);②McFadden Pseudo-R²(无平方和分解,用对数似然构造: 全模型 vs 仅常数项)
6.2 二元 Probit(p82)
第 14 页
- 用 =标准正态累积分布函数 CDF 替代 logistic;同样 MLE
- 缺点:参数不如 Logit 好解释→用得比 Logit 少;解释只看系数符号:正→提高 P(y=1),负→降低
6.3 多项选择(p82-85)
- Multinomial Logit(p83-84):;以第 K 项为基准(系数全设 0);MLE;似然函数用指示函数 ;最大化 对数似然
- Multinomial Probit(p85):假设效用函数误差项服从正态分布;表达式复杂、可解释性差→不常用
6.4 有序选择(p85-86)
- 场景:官员晋升(0 退休/1 留任/2 晋升)、满意度 1-5、态度五级(p85)
- 微观基础(p85-86):潜变量 (不可观测)+ cut-off points 截止点划分等级; Ordered Probit; logistic→Ordered Logit;两者预测概率很接近
第 15 页
Ch7 面板数据 p87-99
Chapter 7 面板数据(p87-99)
7.1 面板数据是什么、好不好(p87-89)
- 数据类型复习+典型面板=城市×年份政策采纳 0/1(政策扩散研究)(p87-88)
- 优点(p88):①解决遗漏变量 omitted variables 问题——遗漏变量常来自不可观测个体异质性 heterogeneity;若差异时间不变 time-invariant,面板可消掉它;②信息更多(截面+纵向两维);③样本量更大→估计更精确
- 缺点(p88):①通常不满足 i.i.d.(同一个体不同期扰动项自相关);②收集成本高、难获取
7.2 三种估计策略(p89-90)
- 极端 1:Pooled regression 混合回归(所有个体同一方程)→缺点:忽略个体异质性→估计不一致(p89)
- 极端 2:每个体单独回归→缺点:忽略共同特征+样本量不足(p89)
- 折中:同斜率、不同截距捕捉异质性(p90)
- 个体效应模型(p90):;=个体效应(随时间不变的个体特征截距项)
7.3 FE vs RE 定义(p91)必背
- 与任一解释变量相关 → Fixed Effects 固定效应(OLS 不一致,需变换消 )
- 与所有解释变量不相关 → Random Effects 随机效应
7.4 FE 三种估法(p91-95)
第 16 页
| 方法 | 英文 | 思路 | 缺点/注意 | 翻阅 |
|---|---|---|---|---|
| 虚拟变量法 | LSDV (Least Squares Dummy Variable) | 每个体一个 dummy,OLS 估计 | n 个截距只放 n-1 个 dummy(全放→完全共线性=dummy 陷阱);个体多时(300+地级市)不可行 | p91-93 |
| 组内估计 | Within-group | 各变量减去个体时间均值(离差变换)再 OLS,消掉 | 用聚类标准误 clustered SE(组内自相关);无法估计时不变变量(如性别,被消掉) | p93-94 |
| 一阶差分 | First-difference (FD) | 本期减上期消 ,OLS 得 FD 估计量 | 要求 与 不相关才一致 | p95 |
7.5 RE 估计:FGLS(p95-96)
- OLS 一致但非最有效(扰动项非球形 spherical:同一个体存在序列自相关)
- FGLS 可行广义最小二乘:先 OLS 估 ,再做变换; 退化为混合回归; 组内估计;所得=随机效应估计量(Stata 中 theta)
7.6 选 FE 还是 RE:Hausman 检验(p97-98)必背
- H0: 与 、 不相关(RE 更好)
- H0 对 → FE、RE 都一致,RE 更有效,两估计量差异不显著
- H0 错 → FE 一致、RE 不一致,差异显著
- 统计量超阈值(或 )→拒绝 H0→选 FE;否则选 RE(Hausman 1978)
7.7 模型选择总纲(p99)
选回归模型看两件事:①数据类型(面板 or 非面板)②因变量测量尺度(连续 or 离散)——连续非面板→Ch5 多元回归;离散→Ch6 Logit/Probit;面板→Ch7 FE/RE。参数分析始终遵循假设检验基本规则。
第 17 页
Ch8 研究设计 p99-113
Chapter 8 研究设计(p99-113)
8.1 总论(p99-101)
- 研究设计=对研究全过程的综合规划(计划-实施-收集-分析);最常见载体=学术论文(p99-100)
- 论文三大特性(p100-101):
- Scientificity 科学性(前提):数据真实+术语规范+结构合范式
- Innovation 创新性(核心):新理论/新视角/新现象/新数据;分 breakthrough 突破性 vs incremental 增量性——本科生做增量性
- Theoretical nature 理论性:结果要理论解读→可推广结论;常见误区=只有数据模型没有理论
8.2 论文结构(p101-103)框架必背
第 18 页
- 前置 Preliminary:标题(名词短语、含关键词)→ 作者+单位 → 摘要(核心论点/方法/发现)→ 关键词(3-8 个,名词)
- 主体 Main Body:引言(问题+目的+文献综述+方法+概念)→ 正文论证(方法/结果/讨论)→ 结论(三件套)
- 后置 Supplementary:附录(问卷/代码/原始表)→ 参考文献(GB/T 7714、APA、Chicago;文中引用与文末列表一一对应)→ 致谢
- 结论三件套(p103):研究结论 + 政策建议 policy implications + 局限与未来方向 limitations & future research
- 引言要素(p104):为什么值得研究(理由+意义)→文献综述(进展+空白)→本研究目标/范围/方法/预期贡献
- 文献综述三大作用+特点(p104-105):作用=①助选题(识别 research gap)②为研究假设提供理论支撑(定量论文中综述与假设常一起呈现);特点=综合性 comprehensiveness、评述性 criticality(述+评结合)、前沿性 frontier
- 研究方法部分(p106):关键=研究对象(依课题性质/可行性/效率界定)+样本(怎么抽、多大、什么结构)
- 结果(p106):图表+文字呈现;定量定性整合分析;正文/表/图不重复
- 讨论(p107):与已有文献比较→新结论;分析结果提新见解;评估意义价值创新;指出局限与未来
8.3 范文解读:垃圾分类政策试点扩散(p107-113)
第 19 页
公式速查 · 26 条
- 出处:李欢欢、顾丽梅《中国行政管理》2020;235 个地级市、2000-2018(p107,p110)
- 结构:引言→文献综述与研究假设→研究方法→实证结果→结论与未来研究(p108)
- 三种逻辑、8 个假设(p108-109):需求驱动(H1a 经济发展水平+、H1b 人口密度+)/ 压力回应(H2a 上级政治压力+、H2b 同级政府采纳数+、H2c 公众舆论+)/ 效率导向(H3a 社会支持+、H3b 科技投入+、H3c 配套制度+)
- 变量(p110):因变量=二元变量 0-1(当年是否实施垃圾分类)→用离散选择/面板模型
- 结论(p112-113):人均 GDP、人口密度、上级压力、社会压力、人力资本、制度建设显著影响扩散;不同阶段/区域存在异质性;建议:回应治理需求、试点形成可复制可推广经验、纳入官员考核
- 局限(p113):未涵盖全部因素(志愿组织、市场主体缺数据);未考虑交互效应;政策扩散测量待改进(象征性/表演性执行未讨论)
第三部分 公式速查表(考前过一遍)
第 20 页
| # | 公式 | 名称 | 用途 | 翻阅 |
|---|---|---|---|---|
| 1 | sample mean | 样本均值 | p9 | |
| 2 | ; 除以 N | variance | 方差(样本 n-1) | p11 |
| 3 | standard deviation | 标准差 | p11 | |
| 4 | coefficient of variation | 比较多组数据的相对离散度 | p12 | |
| 5 | standard score | 正态→标准正态 | p16 | |
| 6 | 3σ rule | 正态概率区间 | p16 | |
| 7 | sample corr coef | 样本相关系数 | p47 | |
| 8 | test of r | 相关系数检验 | p49 | |
| 9 | (PRF);(SRF) | reg functions | 总体/样本回归函数 | p50-51 |
| 10 | 求导=0 | OLS | 最小二乘原理 | p53 |
| 11 | (简单);(多元) | unbiased est of | 误差方差估计 | p56, p67 |
| 12 | ; | decomposition | 拟合优度 | p56-57 |
| 13 | adjusted R² | 跨模型比较 | p68 |
第 21 页
| # | 公式 | 名称 | 用途 | 翻阅 |
|---|---|---|---|---|
| 14 | t-test | 单个系数显著性 | p58, p69 | |
| 15 | F-test | 方程整体显著性 | p70 | |
| 16 | matrix OLS | 多元回归系数 | p67 | |
| 17 | logit | 二元 Logit 线性形式 | p77 | |
| 18 | odds ratio | 优势比解释 | p79-80 | |
| 19 | Pseudo- | McFadden | Logit/Probit 拟合优度 | p81 |
| 20 | probit | 二元 Probit(=标准正态分布 CDF) | p82 | |
| 21 | + cut-offs | ordered model | 有序选择微观基础 | p85-86 |
| 22 | (Cronbach) | reliability | 信度 | p23 |
| 23 | CVR;;CFI;TLI | validity indices | 效度指标 | p26 |
| 24 | z-score 标准化: | standardization | PCA 第一步 | p31 |
| 25 | ; | entropy weight | 熵权法 | p33, p35 |
| 26 | Hausman 统计量 | FE vs RE | 拒绝 H0 选 FE | p98 |
| — | Ch5 全部重要公式汇总 | — | 考前最后翻 | p72-73 |
第 22 页
英文作答句型 · 直接套用
第四部分 英文答题弹药库(开卷英文作答直接套用)
以下句型全部源自讲义原文英文,考试可直接改写使用。背带标记的万能句。
Ch1-2 定义类
- Quantitative research uses numbers and data to analyze and explain social phenomena, while qualitative research uses words and texts to describe and study events and social problems. (p1)
- The four functions of quantitative methods: describe what has happened, explain why it happened, predict what may happen, and prescribe what to do. (p2)
- The nominal scale can only distinguish categories and must satisfy exhaustiveness and mutual exclusivity. (p6)
- The interval scale has no absolute zero, while the ratio scale requires a true absolute zero point. (p7)
- The mean is affected by outliers, whereas the median and the mode are not. (p10)
- The coefficient of variation measures the relative degree of dispersion and is used to compare the dispersion of multiple sets of data. (p12)
- The normal distribution curve is symmetric about , attains its maximum at , has two inflection points at , and takes the x-axis as its asymptote. determines the position and determines the shape. (p14-15)
- As the degrees of freedom approach infinity, the t-distribution converges to the standard normal distribution; when df>30, it is very close to N(0,1). (p16-17)
Ch3 信度效度/数据类
第 23 页
- Reliability refers to the degree of consistency of results obtained when the same method is repeatedly applied to the same object. (p23)
- Validity denotes the degree to which a measurement tool can accurately capture the desired variable. (p24)
- Validity encompasses content validity, construct validity, and criterion validity. (p25)
- For Cronbach’s : indicates good reliability, excellent, and very high. (p23)
- PCA transforms multiple correlated variables into a smaller set of uncorrelated principal components through linear combinations. (p29)
- When missing values are random and the proportion is low (less than 5%), direct deletion is a straightforward approach. (p28)
Ch4 假设检验类
- Hypothesis testing adopts proof by contradiction, and its rationality is based on the principle of small probability events. (p38)
- Steps: (1) state H0 and H1; (2) select a test statistic; (3) determine the rejection region at the given ; (4) calculate the observed value and compare; (5) make a statistical decision. (p39)
- If the test statistic falls within the rejection region, a small-probability event has occurred and H0 should be rejected. (p41)
- If there is no prior knowledge of direction and the purpose is to examine whether a significant difference exists, a two-tailed test should be selected. (p43)
Ch5 回归类
第 24 页
- The purpose of regression analysis is to estimate the mean of the dependent variable using fixed independent variables. (p50)
- The OLS estimator is the Best Linear Unbiased Estimator (BLUE) according to the Gauss-Markov theorem. (p55)
- The correlation coefficient only reflects linear correlation and cannot determine causal relationships. (p48)
- shows that X% of the variation in the dependent variable can be explained by the independent variable(s).(仿 p61)
- The adjusted introduces a trade-off between explanatory power and parsimony by incorporating k. (p69)
- If the p-value is less than the significance level , we reject the null hypothesis. (p59)
- The F-test examines whether multiple variables collectively exert a significant effect on the dependent variable, based on ANOVA. (p70)
- The ice-cream/drowning example represents a spurious relationship because both variables depend on temperature. (p64)
Ch6 离散选择类
第 25 页
- The conventional linear regression model cannot ensure that the predicted value of y lies within ; therefore a logistic model is adopted. (p75)
- The regression coefficient represents the change in caused by a one-unit change in the given independent variable, holding others constant. (p78)
- When , the odds ratio , indicating a positive effect on the occurrence of the event. (p80)
- Parameters are estimated by Maximum Likelihood Estimation (MLE), which finds the optimal parameters that maximize the probability of the observed sample. (p77)
- The binary probit model relies on the cumulative distribution function of the standard normal distribution and is less interpretable than logit. (p82)
Ch7 面板类
第 26 页
辨析题高发区 · 19 组
- Panel data helps address the omitted variable problem caused by unobservable, time-invariant individual heterogeneity. (p88)
- If the individual effect is correlated with any explanatory variable, the fixed-effects model should be used; if uncorrelated, the random-effects model applies. (p91)
- In LSDV, only n-1 dummy variables can be included; otherwise perfect collinearity arises. (p92)
- The within-group estimator cannot estimate the effects of time-invariant variables, and clustered standard errors should be used due to within-group autocorrelation. (p93-94)
- Hausman test: H0 states that is uncorrelated with the explanatory variables (RE is better). If H0 is rejected, choose the fixed-effects model; otherwise choose random effects. (p97-98)
Ch8 论文写作类
- A complete conclusion typically includes research conclusions, policy recommendations, and limitations with future research directions. (p103)
- The literature review facilitates topic selection by identifying research gaps, and provides theoretical support for the proposed hypotheses. (p104-105)
- Its characteristics are comprehensiveness, criticality (combining description and comment), and frontier orientation. (p105)
- Innovation falls into breakthrough and incremental types; undergraduates are advised to pursue incremental contributions. (p100-101)
第五部分 跨章对比表(论述/辨析题高发区)
第 27 页
| 对比组 | 核心区别一句话 | 翻阅 |
|---|---|---|
| Qual vs Quant vs Mixed | 文字 vs 数字 vs 结合 | p1 |
| Nominal/Ordinal/Interval/Ratio | 分类→排序→差值→比值(绝对零点),层级递增 | p6-7 |
| Cross-sectional / Time series / Panel | 一时点多个体 / 一个体多时点 / 多体多点 | p8, p87 |
| Mean vs Median vs Mode | 受不受 outlier;适用什么尺度 | p9-10 |
| Variance vs SD vs CV | 平方单位 / 同量纲 / 相对(跨量纲可比) | p11-12 |
| Normal vs t dist | t 尾更厚;df>30≈正态;小样本用 t | p16-17 |
| Reliability vs Validity | 稳不稳(一致)vs 准不准(测到目标) | p23-27 |
| vs p-value | 事先定的标准;p 算出来的概率;p< 拒绝 H0 | p38, p59 |
| One-tailed vs Two-tailed | 有无方向先验;拒绝域一尾还是两尾 | p42-43 |
| vs r | 总体常数 vs 样本随机变量 | p46-47 |
| Corr vs Regression | 对称只看线性关联 vs 不对称估计均值/可预测;都不能直接=因果 | p48, p50 |
| R² vs Adjusted R² vs Pseudo-R² | 只增不减 / 惩罚 k 可跨模型比 / 似然构造(Logit) | p68, p81 |
| t-test vs F-test(回归) | 单个系数 / 全部系数联合=0 | p69-70 |
| OLS vs MLE | 最小化残差平方和(线性模型)/ 最大化似然(Logit/Probit) | p53, p77 |
第 28 页
| 对比组 | 核心区别一句话 | 翻阅 |
|---|---|---|
| Logit vs Probit | logistic 分布 S 曲线 / 正态 CDF ;Logit 更好解释更常用 | p76-77, p82 |
| Pooled vs FE vs RE | 忽略异质性 / 与 X 相关 / 与 X 不相关 | p89-91 |
| LSDV vs Within vs FD | 加 n-1 个 dummy / 减组均值 / 减上一期;都不能估时不变变量(后两者) | p91-95 |
| FE vs RE 选择 | Hausman:拒绝 H0→FE,不拒绝→RE(RE 更有效) | p97-98 |
| Consistent vs Unbiased vs Efficient | 大样本收敛真值 / 期望=真值 / 方差最小 | p55, p89, p95 |
第 29 页
检索三步法 + 必背 5 件事
第六部分 开卷考场策略 + 考前节奏
考场检索三步法
- 审题抓关键词 → 判断属于哪章(用第一部分总图:因变量连续→Ch5;0/1 分类→Ch6;面板→Ch7;问信度效度→Ch3;问检验步骤→Ch4;问论文结构→Ch8)
- 翻本提纲第二部分找到对应节的 PDF 页码 → 直接翻 PDF 抄原文英文(第四部分弹药库有现成句型的先用句型)
- 答题格式:定义题=英文定义句+一个例子;步骤题=编号 1-5 步(Ch4 五步/p39、OLS 四步、PCA 五步/p30、熵权法五步/p32);辨析题=用第五部分对比表“一句话区别+各自适用场景”
必背到“不用翻书”的 5 件事(其余都允许翻)
- 假设检验五步流程 + 常用值(p38-39)
- 回归五大假设 + BLUE(p51, p55)
- FE vs RE 判据 + Hausman 逻辑(p91, p97-98)
- Logit 系数解释 + OR 三种符号情形(p78-81)
- 论文结构树 + 结论三件套(p101-103)
考前节奏(今天起)
- D-3~D-2 系统过:每天 2-3 章,用本提纲“关键词→页码”演练翻书速度;重点章 Ch4/5/6/7 各留 40 分钟
- D-1 冲刺:只过标记 + 第三部分公式表 + 第五部分对比表;给 PDF 贴上章节便签(p6/p17/p35/p43/p73/p87/p99 七个分界页)
- 考试当天:进场先在草稿纸默写“必背 5 件事”,之后全程按三步法检索;不确定的题先写弹药库句型占位,再翻书补细节
诚实提醒:本提纲的页码基于你上传的 PDF(113 页)逐页核对生成;若老师另发新版讲义,页码可能偏移,届时以标题关键词检索为准。
第 30 页
