返回学习路线
同一个人的两次回答,怎样共同推动一个系数?
这是已完成“从随机准则算到可用标准误”核心链后的独立选读。只研究预先固定工作相关的 GEE理路广义估计方程Generalized estimating equations · GEE · Fixed-working-correlation GEE在独立重复观测簇上解固定工作相关的非线性边际均值方程,区分期望敏感度、观测导数与稳健协方差。;不要求估计 nuisance,不把时间序列 HAC 或缺失资料处理加入这一题。
先交出什么
你的报告要包括:完整簇条件均值、两个工作相关下的第一步与最终根、每簇得分、、稳健与工作协方差、停止残差,以及它们支持和不支持的统计结论。根的算术可以用标准库复算器核验;总体条件需要自己陈述。
A. 同一组二元资料,两次预先指定的分析
四簇的 为
均值设为 ,设计含截距,工作方差为 。分别固定 与 的二阶交换相关矩阵,从 开始。
- 手算 和不阻尼的第一次 scoring 步。为什么在 的约定下必须用加号?
- 继续求根并检查 。给出两种稳健协方差及 的工作协方差。
- 在 根处列出四个簇得分。再用有限差分计算观测负 Jacobian,与 比较。根处总得分为零,为什么仍不足以令二者相等?
- 对 的边际 log odds ,用完整协方差求方差。能否删去非对角元?这是不是新个体二元响应的预测方差?
B. 将证明的每一层说完整
假定完整簇 IID、簇大小统一有界、维数固定, 预先指定。
- 从完整簇条件均值直接证明真参数处得分均值为零;说明正确相关在哪里没有用到。
- 展开 ,指出期望敏感度的残差项为什么消失。
- 写出从中心为零到一致定位、再到正态展开,还各缺哪些条件。 可逆能替代这些条件吗?
- 说明 的拟合后插件一致性为什么需要一个可积包络,而不能只写“各簇独立,所以用大数律”。
C. 一组新的计数与观察时间
保留 A 中的四组 ,计数改为 ,对应暴露量为 。使用 log link、已知 offset、Poisson 型工作方差和固定 。
推导 ,求根及两种协方差,解释斜率的指数。假设实际响应过度离散,哪些结论仍可能成立?删掉暴露量能否由 robust 协方差补救?
D. 三种错误的“稳健”承诺
- ,以 解 。计算真均值处期望得分及最终总体根。
- 每簇有1000行,总共只有两个独立簇,拟合两个系数。 可逆,程序还显示一个很小的正的第二协方差特征值。能否据此宣称完整二维 Wald 推断成立?
- 先比较多个 ,挑样本标准误最小者,再删除响应不齐全的簇。能否直接引用本页固定 、完整资料的定理?请指出两个不同的额外责任。
完整解答
A. 第一轮、最终根和单位对齐
初值处各均值为 ,、。因此 ,。例如 时,第1簇的两个加权残差都为 ,簇得分为 ;第4簇的加权残差是 ,得分为 。
将四簇相加, 给
给
因为 的期望为 ,解近似方程 得 ,更新必须加上 。这并未证明任何联合似然必然上升。
最终根分别约为 与 。默认复算器的平均残差分别低于 与 ;平台舍入及停止阈值可令最后几位不同。两种稳健协方差为
在 的根上,四个簇得分约为
它们逐坐标相加近于零。逐簇先做外积再求和,得
矩阵 已经是 ;再除4会错一个簇数因子。工作模型却报告
观测负 Jacobian 的有限差分值为
差别来自 ,其中 。总得分零控制 ,却没有同时令每一种新权重的残差和为零。不能在推导中悄悄把这两种 bread 当成有限样本恒等式。
目标 的估计为 ,稳健方差为
SE约为0.65221950。边际概率估计约为0.53007417,delta 法的概率均值SE为 。这仍不是新响应本身的预测波动,也没有因为计算完成就获得四簇的可靠95%覆盖。
B. 从条件均值到抽样极限
在 , 是完整设计的函数,故 。这里没有使用真实协方差;完整条件均值与权重不额外依赖响应才是核心。
导数是 。若可积支配允许期望与求导交换,第一项条件期望为零,负期望导数就是 。只知道同一时点的 不够,因为其余时点的设计可能带有关于该响应的信息。
一致性还需要选定参数区域上的总体根分离、得分一致大数律和趋零求解残差;局部正态展开再需要统一 Jacobian 控制、非奇异 、有限二阶簇得分与 的平均残差。前一项负责选中正确根,后一组负责局部反演。有限样本 可逆不能证明全部条件。
对拟合插件,设 ,,。则外积的平均差由
控制。有限二阶矩保证这里可积,一致定位使 。随后才可对固定真参数处的得分外积应用大数律。根共享全部响应,不应把拟合得分当成相互独立。
C. offset 是均值模型的一部分
,,;正暴露量保证对数 offset 有定义。固定同样的 后,簇得分和协方差累计方式不变。
解为 ,平均残差低于 。工作协方差约为
稳健协方差约为
在暴露量及其余输入固定时, 增加1的边际率比估计为 。真实条件方差可以不同于 ;若完整条件均值与矩条件仍正确,稳健公式仍可能一致,而 一般失去依据。删除 offset 改变了均值,不会由替换协方差修复。
D. 先定位失效的那一行等式
- 在 时得分为 ,在 时为1,两者各占一半,期望为 。一般得分期望 的根为 ,不是真实均值。失效发生在把响应相关权重从条件期望中提出的那一步。
- 精确根的两个簇得分互为相反数,外积和秩至多1,因此完整二维协方差不可逆。近似根与舍入可制造很小的第二特征值,但不能增加独立信息;2000行不等于2000个独立簇。
- 看结果后选择相关需要分析随机权重或选择步骤,固定配置定理不能直接套给所选配置;删掉不完整簇另需核验观察机制下的条件得分均值。两个缺口都不是一句“用了robust SE”能够填上。
复算方式与验收标准
下载复算器后运行 python gee-inference-reader.py。它默认给出两种二元分析和计数分析的 JSON,且只使用 Python 标准库。自定义输入用 --input data.json:顶层提供 family、initial、tol、max_iter、clusters;每簇提供唯一 id、含截距的 X、y、预先指定的完整 R;计数例另给正 exposure 数组。程序不会从结局估计相关参数。
程序用 Cholesky 检查相关矩阵和 ,用残差回溯作阻尼,并同时检查平均残差与评分步长。无效 、列共线、过大初值、均值饱和、溢出、回溯失败或迭代耗尽都应得到明确失败,不能把最后一个迭代点包装成已收敛估计。输入者仍负责独立簇的科学定义、条件均值、根定位及总体矩条件。
验收必须能解释:为什么两次有限样本根可以不同;为什么 不是观测 Jacobian;为什么求和协方差不再除 ;为什么正的响应相关权重能移动目标;为什么固定工作相关不能自动推广到估计 nuisance、数据选择或任意失访。四簇的数值只核验计算,不提供效率排序或小样本覆盖证书。