回归分析是统计学和机器学习中最核心的分析方法之一,用于研究变量之间的关系并进行预测。
📌 核心定义
回归分析通过建立数学模型来描述**自变量(X)与因变量(Y)**之间的依赖关系,目的是:
理解关系:X 如何影响 Y?
进行预测:给定新的 X,能预测出什么 Y?
🔢 常见类型
类型 公式示例 适用场景
简单线性回归 Y = β₀ + β₁X + ε 一个自变量,线性关系
多元线性回归 Y = β₀ + β₁X₁ + β₂X₂ + … + ε 多个自变量
逻辑回归 P(Y=1) = 1/(1+e^(-z)) 分类问题(二分类)
多项式回归 Y = β₀ + β₁X + β₂X² + … + ε 非线性关系
岭回归/Lasso 带正则化的线性回归 防止过拟合、特征选择
🧪 典型应用场景
房价预测:根据面积、地段等预测房价
销售预测:根据广告投入、季节等因素预测销量
风险评估:根据信用评分、收入等预测违约概率
医学研究:研究年龄、体重对血压的影响
A/B 测试分析:评估不同策略的效果差异
📊 关键输出指标
R² (决定系数):模型解释的变异比例(0-1,越接近 1 越好)
系数估计值:每个自变量的影响方向和强度
p 值:检验系数是否显著不为零
残差分析:检查模型假设是否成立
⚠️ 注意事项
相关性 ≠ 因果性:回归显示关联,但不证明因果
多重共线性:自变量之间高度相关会影响系数稳定性
异方差性:残差方差不恒定会导致推断偏差
过拟合风险:模型过于复杂会失去泛化能力