相关系数
计算 Pearson/Spearman 相关系数:粘贴两组一一对应的数据,得到 Pearson r、r²、回归斜率、Spearman ρ 与可选的 Kendall τ,并给出相关强度解释与散点数据。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
输入
r、ρ、τ 都在本地计算,Spearman 用平均秩处理并列名次,Kendall 用 τ-b 做并列修正。
结果
0.60000.60002.20000.73795这个工具能做什么
- 判断两组数据是否线性相关:例如身高与体重、广告投放与销售额,先看 Pearson r 有多大再决定要不要做回归。
- 数据有明显非线性或极端值时改用 Spearman ρ:它只看名次,对离群点不敏感,还能处理并列名次。
- 样本量小或名次型数据(问卷 1–5 分、评委排序)用 Kendall τ:它衡量的是「两两顺序一致的比例」,比 ρ 更稳健。
- 做论文或报告的附录:一次拿到 r、r²、回归斜率与截距,并复制散点数据画到别的图表工具里。
示例
输入
X 序列 1, 2, 3, 4, 5;Y 序列 2, 4, 5, 4, 5;勾选「同时计算 Kendall τ」
输出
样本量 5,Pearson r = 0.7746,r² = 0.6000,回归斜率 = 0.6000,回归截距 = 2.2000,Spearman ρ = 0.7379,Kendall τ = 0.6708,相关强度:强正相关
r² = 0.6 表示 Y 的变异有 60% 能被 X 的线性关系解释;Spearman ρ 略低于 r,是因为 Y 里有两个并列值 4 和两个并列值 5,平均秩拉平了名次。
常见问题
Pearson、Spearman、Kendall 该选哪个?
数据近似线性、没有明显离群点用 Pearson r。数据是名次或有并列值、关系单调但非线性(例如指数增长)用 Spearman ρ。样本很小(n < 30)或大量并列时 Kendall τ 的置信区间表现更好。三个都算出来对比,结论不一致时优先相信 ρ 或 τ。
为什么 r 很大也不能说「X 导致 Y」?
相关系数只描述同步变化,不包含因果信息。两个变量同时受第三个因素影响(例如气温同时抬高冰激凌销量和游泳人数)就会得到高相关。要做因果推断需要实验设计或工具变量等方法。
两组数据长度不一样会怎样?
会直接报错「X 与 Y 的长度必须一致」。相关系数要求一一配对,少一个点就不知道它对应谁;如果某一组有缺失值,请把两个序列里对应的那一对一起删掉再粘贴。
某一组数据全是同一个值,为什么算不出来?
因为方差为 0,公式里会出现除以 0。一个不变化的序列与任何序列都没有线性关系可言,工具会提示「方差为 0,无法计算相关系数」而不是返回 NaN。
Kendall τ 为什么有样本量上限?
τ-b 需要两两比较所有配对,复杂度是 O(n²):2000 个点约 200 万次比较。超过上限会提示错误,避免页面卡住;这种规模的数据用 Spearman ρ 已经足够。
关键词:correlation coefficientpearsonspearmankendall taur squaredscatter data相关系数皮尔逊斯皮尔曼肯德尔线性相关散点