不能直接用 np.linalg.solve 求逻辑回归参数,因其损失函数为非线性交叉熵,非线性方程组,需用梯度下降等迭代法;sigmoid 需数值稳定实现防溢出;特征须标准化,截距项需显式添加;预测应基于概率阈值而非简单 round。

为什么不能直接用 np.linalg.solve 求逻辑回归参数?
逻辑回归不是线性方程组,它的损失函数是交叉熵(非二次、非解析可解),np.linalg.solve 只能解形如 A @ x == b 的线性系统。强行套用会得到完全错误的系数——它根本没考虑 sigmoid 映射和概率解释。
必须用迭代优化:最常用的是梯度下降或牛顿法。NumPy 本身不提供优化器,但可以手写梯度更新逻辑,核心是算对梯度:
-
z = X @ theta(线性组合) -
a = 1 / (1 + np.exp(-z))(sigmoid 激活) -
grad = X.T @ (a - y) / m(交叉熵对theta的梯度,m是样本数)
如何用 np.dot 和 np.exp 安全计算 sigmoid?
直接写 1 / (1 + np.exp(-z)) 在 z 很大(如 >700)时会触发 RuntimeWarning: overflow encountered in exp,因为 np.exp(700) 超出 float64 表示范围。
改用数值稳定版本:
立即学习“Python免费学习笔记(深入)”;
def sigmoid(z):
z_clipped = np.clip(z, -500, 500) # 防溢出,500 已足够覆盖 sigmoid 有效区间
return 1 / (1 + np.exp(-z_clipped))注意:np.clip 不影响梯度方向,且比 np.where(z > 0, ...) 更简洁;不要用 math.exp,它不支持数组。
训练循环里必须手动实现 theta -= alpha * grad 吗?
是的。NumPy 没有内置的优化器,scipy.optimize.minimize 虽然可用,但题目限定纯 NumPy 实现。关键点在于:
- 学习率
alpha通常设为0.01或0.1,太大导致震荡,太小收敛慢 - 务必对特征
X做标准化((X - X.mean(axis=0)) / X.std(axis=0)),否则不同量纲特征梯度差异巨大,训练几乎不收敛 - 截距项要显式添加:用
X = np.column_stack([np.ones(m), X]),否则模型没 bias - 建议监控损失变化,比如每 100 轮打印
-np.mean(y * np.log(a + 1e-8) + (1-y) * np.log(1-a + 1e-8))(加1e-8防 log(0))
预测时用 np.round(sigmoid(X @ theta)) 还是阈值判断?
用 np.round() 看似简单,但实际不可靠:它依赖浮点精度,且无法调整分类阈值。真实场景中常需权衡 precision/recall(比如医疗检测宁可多报不可漏报)。
正确做法是保留概率输出,再按需切分:
y_pred_prob = sigmoid(X_test @ theta) y_pred = (y_pred_prob >= 0.3).astype(int) # 举例:降低阈值提高召回
注意:sigmoid 输出是 [0,1] 区间浮点数,直接 >= 0.5 是默认二分类决策边界,但这个 0.5 并非固定真理——它隐含了类别先验相等的假设,数据不平衡时往往要调。
逻辑回归真正难的不是公式推导,而是梯度实现不溢出、特征不标准化导致不收敛、以及把“概率输出”和“硬分类”混为一谈。这些坑在 NumPy 手写时一个都绕不开。


















