拓端数据tecdat|R语言逻辑回归（Logistic回归）模型分类预测病人冠心病风险

本文的目的是完成一个逻辑回归分析。使你对分析步骤和思维过程有一个基本概念。

library(tidyverse)
library(broom)

这些数据来自一项正在进行的对镇居民的心血管研究。其目的是预测一个病人是否有未来10年的冠心病风险。该数据集包括以下内容。

男性：0=女性；1=男性
年龄。
教育。1 = 高中以下；2 = 高中；3 = 大学或职业学校；4 = 大学以上
当前是否吸烟。0=不吸烟；1=吸烟者
cigsPerDay: 每天抽的烟数量（估计平均）。
BPMeds: 0 = 不服用降压药；1 = 正在服用降压药
中风。0 = 家族史中不存在中风；1 = 家族史中存在中风
高血压。0 =高血压在家族史上不流行；1 =高血压在家族史上流行
糖尿病：0 = 没有；1 = 有
totChol: 总胆固醇(mgdL)
sysBP: 收缩压(mmHg)
diaBP: 舒张压(mmHg)
BMI: 体重指数
心率
葡萄糖：总葡萄糖mgdL
TenYearCHD: 0 = 患者没有未来10年冠心病的风险; 1 = 患者有未来10年冠心病的风险

加载并准备数据

read_csv("framingham.csv") %>%
drop_na() %>% #删除具有缺失值的观察值
ageCent = age - mean(age),
totCholCent = totChol - mean(totChol),

拟合逻辑回归模型

glm(TenYearCHD ~ age + Smoker + CholCent,
data = data, family = binomial)

预测

对于新病人

data_frame(ageCent = (60 - 49.552),
totCholCent = (263 - 236.848),

预测对数几率

predict(risk_m, x0)

预测概率

根据这个概率，你是否认为这个病人在未来10年内有患冠心病的高风险？为什么？

risk

混淆矩阵

risk_m %>%
group_by(TenYearCHD, risk_predict) %>%
kable(format="markdown")

mutate( predict = if_else(.fitted > threshold, "1: Yes", "0: No"))

有多大比例的观察结果被错误分类？

依靠混淆矩阵来评估模型的准确性有什么缺点？

ROC曲线

ggplot(risk_m_aug,
oc(n.cuts = 10, labelround = 3) +
geom_abline(intercept = 0) +

auc(roc )$AUC

一位医生计划使用你的模型的结果来帮助选择病人参加一个新的心脏病预防计划。她问你哪个阈值最适合为这个项目选择病人。根据ROC曲线，你会向医生推荐哪个阈值？为什么？

假设

为什么我们不绘制原始残差？

ggplot(data = risk aes(x = .fitted, y = .resid)) +
labs(x = "预测值", y = "原始残差")

分级的残差图

plot(x = fitted, y = resid,
xlab = "预测概率",
main = "分级后的残值与预测值的对比",

## # A tibble: 2 x 2
## currentSmoker mean_resid
## <fct> <dbl>
## 1 0 -2.95e-14
## 2 1 -2.42e-14

检查假设：

- 线性？- 随机性？- 独立性？

系数的推断

currentSmoker1的测试统计量是如何计算的？

在统计学上，totalCholCent是否是预测一个人患冠心病高风险的重要因素？

用检验统计量和P值来证明你的答案。

用置信区间说明你的答案。

偏离偏差检验

glm(TenYearCHD ~ ageCent + currentSmoker + totChol,
data = heart_data, family = binomial)

anova

AIC

根据偏离偏差检验，你会选择哪个模型？

基于AIC，你会选择哪个模型？

使用 `step逐步回归` 选择模型

step(full_model )

kable(format = "markdown" )

拓端数据tecdat|R语言逻辑回归（Logistic回归）模型分类预测病人冠心病风险

加载并准备数据

拟合逻辑回归模型

预测

对于新病人

混淆矩阵

ROC曲线

假设

为什么我们不绘制原始残差？

分级的残差图

检查假设：

系数的推断

偏离偏差检验

AIC

使用 `step逐步回归` 选择模型

继续阅读

PAT (Advanced Level) Practise 1012 The Best Rank (25)

mysql5.7的sql优化

线程通信和进程通信区别（线程进程区别）

Matlab随机波动率SV、GARCH用MCMC马尔可夫链蒙特卡罗方法分析汇率时间序列

Lagrange插值的R语言实现

微信小程序前端解密获取用户信息

Spring MVC 自学杂记（五） -- SpringMVC与前台的json数据交互

《MySQL技术内幕：InnoDB存储引擎》笔记

扩容TIKV节点遇到的坑

PHP辅导代做编程：CS353 Database System

自学Zabbix3.10.2-事件通知Notifications upon events-Actions报警配置点击返回：自学zabbix集锦

HDU 5678 ztr loves trees

R语言-相关性分析函数

拓端tecdat|R语言弹性网络Elastic Net正则化惩罚回归模型交叉验证可视化

二叉树及其应用--二叉树创建

详解STM32单片机的堆栈

拓端数据tecdat|R语言逻辑回归（Logistic回归）模型分类预测病人冠心病风险

加载并准备数据

拟合逻辑回归模型

预测

对于新病人

混淆矩阵

ROC曲线

假设

为什么我们不绘制原始残差？

分级的残差图

检查假设：

系数的推断

偏离偏差检验

AIC

使用​ ​step逐步回归​ ​选择模型

继续阅读

使用 `step逐步回归` 选择模型