因为数值列需归一化、类别列需编码,混用会报错或训练失效;模型需字典输入且多分支并行,Sequential不支持;Embedding的input_dim须≥类别数+1以防越界。

用 tf.data.Dataset 加载表格数据时,为什么数值列和类别列要分开预处理?
因为 TensorFlow 的 Keras 层(比如 tf.keras.layers.StringLookup 或 tf.keras.layers.Normalization)对不同数据类型有明确的输入要求:数值列需归一化或标准化,类别列需编码成整数或独热向量。混在一起直接丢进模型会报 InvalidArgumentError: input must be numeric 或静默出错——模型把字符串当 float 解析,训练 loss 不降反升。
实操建议:
立即学习“Python免费学习笔记(深入)”;
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 先用
pandas.read_csv()读入,用df.select_dtypes(include=['number'])和df.select_dtypes(include=['object'])分开数值列与类别列 - 对数值列,用
tf.keras.layers.Normalization并调用adapt()(传入训练集数值子集);对类别列,用tf.keras.layers.StringLookup+vocabulary=sorted(df[col].unique())构建查表 - 避免在
Dataset.map()中做vocab构建——那会每次调用都重算,应提前构建好层对象再复用
构建模型时,tf.keras.Model 的输入必须是字典,但为什么不能用 Sequential?
因为表格数据通常含异构特征(数值、类别、嵌入),而 Sequential 只支持单输入单输出的线性堆叠。一旦你有多个并行分支(比如数值分支走 Dense,类别分支走 Embedding 后拼接),就必须用函数式 API 或 Subclassing 方式定义模型。
实操建议:
立即学习“Python免费学习笔记(深入)”;
- 定义输入时,用
{'num_input': tf.keras.Input(...), 'cat_input': tf.keras.Input(...)}显式命名 - 类别列输入维度必须是
(None, 1)(每样本一个类别值),否则StringLookup输出 shape 不匹配,报ValueError: Input 0 of layer ... is incompatible with the layer - 拼接前确保所有分支输出 shape 第二维一致(如都为
(None, 64)),用tf.keras.layers.Concatenate()而非 Python 列表拼接
训练时 model.fit() 报错 ValueError: Failed to find data adapter 怎么快速定位?
这几乎一定是输入数据格式和模型声明的输入结构不一致。TensorFlow 2.x 对 fit() 输入非常严格:如果模型输入是字典,你就必须传字典;如果是张量元组,就传元组;不能传 DataFrame 或 numpy 结构数组。
实操建议:
立即学习“Python免费学习笔记(深入)”;
- 检查
Dataset.from_tensor_slices((dict_of_features, labels))中的dict_of_features键名是否和模型Input名称完全一致(包括大小写和下划线) - 打印一个 batch:
next(iter(dataset.take(1))),确认输出是({'num_input': ..., 'cat_input': ...}, labels)形式 - 别用
df.values直接喂模型——它丢掉列名,变成纯 ndarray,无法映射到多输入模型
类别特征嵌入后,tf.keras.layers.Embedding 的 input_dim 设多少才不越界?
input_dim 必须 ≥ 实际类别数 + 1,因为 StringLookup 默认把未知值(OOV)映射到 index 0,有效类别从 1 开始编号。设小了会在 embedding 查表时触发 InvalidArgumentError: indices[0] = 123 is not in [0, 120)。
实操建议:
立即学习“Python免费学习笔记(深入)”;
- 统计每个类别列唯一值数量:
len(df['col'].unique()),然后input_dim = len(unique_vals) + 1 - 若训练集和预测集类别不完全重合,务必在
StringLookup初始化时设num_oov_indices=1(默认值),并确保adapt()用的是完整训练集(不是采样子集) - 嵌入维度(
output_dim)不必太大,类别数
Normalization 层是否在推理时正确复用(不能重新 adapt())。这两处出错,线上预测结果会系统性偏移,但训练日志里完全看不出来。

















