nlargest 比 sort_values + head 更快,因其基于堆实现,时间复杂度为 O(n log k),而 sort_values 为 O(n log n);当 k 远小于 n 时优势明显,但仅支持数值列。

nlargest 为什么比 sort_values + head 更快
nlargest 内部用堆(heap)实现,时间复杂度约 O(n log k),而 sort_values 是 O(n log n)。当 N 远小于 DataFrame 行数时,跳过全量排序能明显提速,尤其在百万级数据上差异显著。
注意:nlargest 只支持数值列(int/float),对字符串或 datetime 列会报 TypeError: ';若需按时间取最大(即最新),得先转成 <code>datetime64 类型再用。
nlargest 基本用法与参数含义
调用形式为 df.nlargest(n, columns, keep='first'),其中:
-
n:要取的行数,必须是正整数 -
columns:可传单列名('score')或列名列表(['score', 'age']);多列时按顺序优先级排序,类似sort_values(['score', 'age'], ascending=[False, False]) -
keep:控制重复值处理,'first'(默认,保留首次出现)、'last'、'all'(可能返回超过 n 行)
示例:df.nlargest(5, 'price', keep='all') 会返回所有 price 并列第 5 名的行,结果可能 >5 行。
立即学习“Python免费学习笔记(深入)”;
常见错误:空值、非数值列、索引丢失
遇到以下情况会出问题:
- 目标列含
NaN:默认被排在最后,nlargest仍会返回前 N 行(含 NaN 行),但通常这不是预期行为 —— 应先用dropna(subset=['col'])清洗 - 列类型是
object但实际存数字字符串(如'123'):会报错或返回空,需先转类型:df['col'] = pd.to_numeric(df['col'], errors='coerce') - 原 DataFrame 索引不连续(如删过行):
nlargest返回的新 DataFrame 索引默认保留原始索引,不是 0,1,2…,如需重置,链式调用.reset_index(drop=True)
替代方案对比:什么时候不该用 nlargest
当 N 接近总行数(比如取前 90%),nlargest 的堆操作开销反而可能高于直接排序;此时 df.sort_values('x', ascending=False).head(n) 更稳。
另外,如果后续还要按其他字段二次分组或聚合,用 sort_values 后接 groupby().head() 更自然;nlargest 不支持分组内 top-N(得用 groupby().apply(lambda x: x.nlargest(n, 'col')),但性能较差)。
真正省心又高效的前提是:单列、纯数值、N ≪ len(df)、不需要分组上下文。


















