回归分析
线性回归计算与预测:支持一元与多元最小二乘回归,输出回归系数、截距、R²、调整 R²、残差标准误与各系数标准误,并给出残差列表和可直接使用的预测函数。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
输入
最小二乘解正规方程 (XᵀX)β = Xᵀy,用列主元高斯消元求解;系数标准误来自 σ²(XᵀX)⁻¹ 的对角元。
回归结果
y = 2.2000 + 0.6000 × x12.20000.93810.60000.28280.60000.46670.894453-0.8000, 0.6000, 1.0000, -0.6000, -0.2000
预测
留空则不预测;维度必须与 X 的列数一致。
这个工具能做什么
- 用最小二乘拟合一条趋势线:把「广告费 → 销售额」这类成对数据粘进来,直接得到斜率和截距,还能拿方程去预测新样本。
- 多元回归:控制多个因素(例如面积、房龄、楼层)对目标的影响,看每个自变量的系数和标准误,判断哪一项真的起作用。
- 检查拟合质量:R² 与调整 R² 一起看,配合残差列表发现明显的模式(残差随 x 变大就是典型的非线性信号)。
- 课程作业与实验数据处理:一次拿到系数、标准误、自由度与残差,可以照着写结果表格,也能用预测函数做外推。
示例
输入
X(每行一个样本)1 / 2 / 3 / 4 / 5;Y 2, 4, 5, 4, 5
输出
回归方程 y = 2.2000 + 0.6000 × x1,截距 2.2000(标准误 0.9381),x1 系数 0.6000(标准误 0.2828),R² = 0.6000,调整 R² = 0.4667,残差标准误 0.8944,自由度 3,残差 -0.8000, 0.6000, 1.0000, -0.6000, -0.2000
把预测样本填成 10,预测值是 2.2000 + 0.6000 × 10 = 8.2000。多元回归时每行写多列,例如「1, 5」表示 x1 = 1、x2 = 5。
常见问题
样本量要多少才够?
工具要求样本量严格大于自变量个数加 1,因为自由度 n − k − 1 必须为正,否则残差标准误与标准误都没有定义。实践中经验法则是每个自变量至少 10 个样本,否则 R² 会虚高、系数不稳定。
R² 和调整 R² 有什么区别?
R² 只会随着自变量增加而上升,哪怕加进去的是纯噪声。调整 R² 用自由度做了惩罚:1 − (1 − R²)(n − 1)/(n − k − 1),变量越多、样本越少惩罚越重,所以比较不同变量个数的模型时看调整 R² 更公平。
为什么提示「设计矩阵列不满秩」?
说明存在完全共线的自变量,例如两列数值完全相同、或某一列是其他列的线性组合,此时 (XᵀX) 不可逆,系数没有唯一解。删掉冗余的那一列,或者改用带正则化的方法(岭回归)再拟合。
标准误是干什么用的?
系数标准误衡量该系数的估计精度:系数除以标准误就是 t 统计量,可用于检验「这个自变量是否显著不为 0」。标准误越小,说明在同样数据下系数的估计越稳定。
算出来的公式能直接外推吗?
线性模型只在数据覆盖的范围内可靠。把预测样本填成远大于训练数据的值属于外推,误差会迅速放大;同时回归只刻画相关关系,不能证明因果关系。
关键词:linear regressionmultiple regressionleast squaresr squaredadjusted r squaredresiduals线性回归多元回归最小二乘回归系数残差预测