用str.split()和explode()可将分词list展开为一维Series以支持value_counts()统计,中文需先用jieba分词再explode,注意清洗、去停用词及缓存展开结果提升效率。

用 str.split() + explode() 快速展开分词结果
分词后通常是 list 类型(比如 ["苹果", "香蕉", "苹果"]),但 Pandas 的统计方法(如 value_counts())只认一维 Series。直接对含 list 的列调用 value_counts() 会报错:TypeError: unhashable type: 'list'。
正确做法是先用 str.split()(若原始是字符串)或直接赋值 list 列,再用 explode() 展开:
df["words"] = df["text"].str.split() # 假设按空格分词 word_series = df["words"].explode().dropna()
explode() 会把每个 list 元素变成独立行,dropna() 防止空 list 或 NaN 导致的 null 行干扰统计。
调用 value_counts() 前注意参数取舍
value_counts() 默认排序降序、不归一化、不包含 NaN——这通常符合词频需求,但几个关键参数容易被忽略:
立即学习“Python免费学习笔记(深入)”;
-
normalize=False:保持原始频次(整数),别误开成True得到比例 -
sort=True:默认已开启,若需保留原始出现顺序(如按文档顺序统计),得设为False并配合groupby().size() -
dropna=True:默认行为,确保空字符串或 None 不混入结果;若分词后有意保留空项,需显式设为False
最简统计写法:
word_freq = word_series.value_counts()
处理中文分词结果时要避开 str.split() 的坑
中文没空格,直接用 str.split() 会把整句当一个词。必须先用第三方库(如 jieba)分好词,再塞进 DataFrame:
import jieba df["words"] = df["text"].apply(lambda x: list(jieba.cut(x))) # 返回 list word_series = df["words"].explode().dropna()
常见错误:
- 忘记
list()包裹jieba.cut()结果 → 得到 generator,explode()无法处理 - 没去标点/停用词 → “的”“了”高频但无意义,建议在
apply中一并过滤 - 未统一编码或含不可见字符(如 \u3000、\xa0)→ 分词后产生异常 token,建议提前
.str.replace()清洗
性能敏感场景下避免链式操作重复计算
如果后续还要做 TF-IDF 或共现分析,反复调用 explode() + value_counts() 效率低。推荐一次性展开并缓存:
expanded = df[["id", "words"]].explode("words").dropna()
expanded["words"] = expanded["words"].str.strip() # 清空格
word_freq = expanded["words"].value_counts()这样 expanded 可复用,也方便加条件筛选(如只统计长度 ≥2 的词):
word_freq = expanded.query('words.str.len() >= 2')["words"].value_counts()真正麻烦的不是语法,而是分词质量本身——停用词表是否适配领域、专有名词有没有被切碎、繁简体是否统一,这些不会报错,但会让 value_counts() 统计出一堆无效高频词。


















