用简单命令分析CSV文件,获取统计、筛选行、检测异常、分组聚合,零外部依赖。
Csv Analyzer — CSV数据分析器
功能概述
Csv Analyzer — CSV数据分析器是一项面向实际任务的技能,主要用于用简单命令分析CSV文件,即时获取统计、筛选数据、检测异常并导出结果——无需pandas或重型依赖;Agent平台 : 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等);
核心要点
- 操作系统 : Windows / macOS / Linux。
- 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
- 从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。
使用与执行
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;
结果检查与注意事项
涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
Csv Analyzer — CSV数据分析器
用简单命令分析CSV文件,即时获取统计、筛选数据、检测异常并导出结果——无需pandas或重型依赖。
依赖说明
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
依赖项
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key 配置
本Skill无需额外API Key(LLM能力由Agent平台内置提供)
可用性分类
- 分类: MD+EXEC()
核心能力
1. 快速统计(stats)
python3 {baseDir}/scripts/csv_analyze.py stats data.csv
返回行数、列类型、数值列的min/max/mean、文本列的unique计数。
输入: 用户提供快速统计(stats)所需的指令和必要参数。
- 执行
快速统计(stats)操作,处理输入数据并返回结果 - 验证执行结果,确认输出符合预期格式
- 异常时参考错误处理章节进行恢复
- 关键参数:
快速统计(stats)选项
2. 灵活筛选(filter)
python3 {baseDir}/scripts/csv_analyze.py filter data.csv --where "amount>1000" --output big_orders.csv
支持比较运算符(>、<、>=、<=、==、!=),可将筛选结果导出为CSV。
输入: 用户提供灵活筛选(filter)所需的指令和必要参数。
3. Top/Bottom N
python3 {baseDir}/scripts/csv_analyze.py top data.csv --column revenue --n 10
python3 {baseDir}/scripts/csv_analyze.py bottom data.csv --column revenue --n 5
按指定列取前N或后N行。
输入: 用户提供Top/Bottom N所需的指令和必要参数。 输出: 返回Top/Bottom N的执行结果,包含操作状态和输出数据。
4. 异常检测(anomalies)
python3 {baseDir}/scripts/csv_analyze.py anomalies data.csv --column price
基于z-score检测超出2σ(2倍标准差)的值。
输入: 用户提供异常检测(anomalies)所需的指令和必要参数。 输出: 返回异常检测(anomalies)的执行结果,包含操作状态和输出数据。
5. 分组聚合(group)
python3 {baseDir}/scripts/csv_analyze.py group data.csv --by category --agg "sum:amount" "count:id"
按指定列分组,支持 sum、count 等多种聚合函数,可同时指定多个聚合。
输入: 用户提供分组聚合(group)所需的指令和必要参数。 输出: 返回分组聚合(group)的执行结果,包含操作状态和输出数据。
6. 自动列类型检测
自动识别列类型:数值(numeric)、日期(date)、文本(text)。数值列做统计计算,文本列做unique计数。
输入: 用户提供自动列类型检测所需的指令和必要参数。 处理: 按照skill规范执行自动列类型检测操作,遵循单一意图原则。 输出: 返回自动列类型检测的执行结果,包含操作状态和输出数据。
- 执行
自动列类型检测操作,处理输入数据并返回结果 - 验证执行结果,确认输出符合预期格式
- 参考
自动列类型检测相关配置参数进行设置
7. 结果导出
filter 等命令支持 --output 参数,将处理结果导出为CSV,便于后续分析或报表使用。
能力覆盖范围
本skill还覆盖以下能力场景: 用简单命令分析、获取统计、筛选行、检测异常、零外部依赖、数据分析器用简单、命令分析、即时获取统计、筛选数据、检测异常并导出结、仅依赖、标准库、pandas、或重型依赖、内存服务器上运行、无压力、核心能力、命令返回行数、命令支持比较运算、可导出筛选结果、命令按指定列取前、命令基于、文本自动识别、处理结果可导出为、适用场景、数据探索、异常排查、报表预处理、ETL、不适用于、的大文件、流式处理、加密文件破解。这些能力在上述核心功能中均有对应处理逻辑。
为何不用pandas?
pandas很强大,但:
- 仅导入就占100MB+内存
- 对快速分析任务过于重型
- 本技能在2GB内存服务器上运行无压力
- 对真正的大数据集,Agent可建议安装pandas
使用流程
- 确认环境:检查
python3可用(无需安装任何外部包)。 - 快速统计:用
stats命令获取数据概况(行数、列类型、min/max/mean)。 - 按需分析:根据统计结果选择
filter/top/bottom/anomalies/group命令。 - 导出结果:用
--output参数将筛选/处理结果导出为CSV。 - 验证输出:检查导出文件的行数与内容是否符合预期。
- 大数据集建议:若文件接近100MB或分析慢,考虑安装pandas。
命令参数说明
--by: 命令参数,用于指定操作选项
示例
示例1:快速统计
python3 {baseDir}/scripts/csv_analyze.py stats orders.csv
# 输出:
# 行数: 1500
# 列: order_id(text, 1500 unique), amount(numeric, min=10.5, max=9999.0, mean=456.78),
# category(text, 12 unique), order_date(date)
示例2:筛选大额订单并导出
python3 {baseDir}/scripts/csv_analyze.py filter orders.csv --where "amount>1000" --output big_orders.csv
# 输出:筛选出87行,已导出到 big_orders.csv
示例3:取销售额前10
python3 {baseDir}/scripts/csv_analyze.py top orders.csv --column amount --n 10
# 输出:amount最大的10行记录
示例4:检测价格异常
python3 {baseDir}/scripts/csv_analyze.py anomalies orders.csv --column amount
# 输出:超出2σ的异常值,共23行
# 例如:amount=9999.0(z-score=3.8),amount=5.0(z-score=-2.5)
示例5:按类别分组聚合
python3 {baseDir}/scripts/csv_analyze.py group orders.csv --by category --agg "sum:amount" "count:order_id"
# 输出:
# category=electronics, sum:amount=125000.50, count:order_id=320
# category=clothing, sum:amount=45000.20, count:order_id=180
# ...
示例6:多条件组合(先filter再stats)
python3 {baseDir}/scripts/csv_analyze.py filter orders.csv --where "amount>500" --output high_value.csv
python3 {baseDir}/scripts/csv_analyze.py stats high_value.csv
# 输出:高价值订单的统计概况
错误处理
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
FileNotFoundError |
文件路径错误或不存在 | 校验文件路径与扩展名(.csv) |
python3: command not found |
系统未安装Python 3 | 安装Python 3.x并确保 python3 在PATH中 |
--column 列名不存在 |
列名拼写错误或大小写不匹配 | 先用 stats 查看实际列名,再传入 |
--where 表达式无效 |
比较运算符或列名错误 | 使用合法运算符(>/</>=/<=/==/!=)与正确列名 |
--agg 聚合函数不支持 |
传入了非sum/count的函数 | 仅支持 sum/count,按 func:column 格式传入 |
| 数值列含非数值 | 数据中有空值或字符串 | 清洗数据或确认列类型识别正确 |
| 日期解析失败 | 非ISO格式 | 优先使用ISO 8601(2024-01-15),其他格式可能无法识别 |
| 文件过大导致内存不足 | 超过约100MB | 改用pandas流式处理,或拆分文件 |
--n 值非法 |
传入0或负数 | 传入正整数,如 --n 10 |
--output 路径不可写 |
目录权限不足 | 检查目标目录权限或更换输出路径 |
| 导出文件空 | 筛选条件无匹配行 | 放宽 --where 条件或检查数据 |
常见问题
Q1:为何不用pandas?
pandas仅导入就占100MB+内存,对快速分析任务过于重型。本技能仅用Python标准库(csv模块),在2GB内存服务器上运行无压力。对真正的大数据集,Agent可建议安装pandas。
Q2:支持多大的文件?
设计支持约100MB以内的文件(载入内存)。超过此规模建议安装pandas或使用流式处理。2GB内存服务器可稳定运行。
Q3:如何检测异常?
anomalies 命令基于z-score检测超出2σ(2倍标准差)的值。这些值在统计上偏离均值较远,可能是数据错误或值得关注的异常点。
Q4:支持哪些聚合函数?
目前支持 sum(求和)与 count(计数)两种聚合函数,按 func:column 格式传入,可同时指定多个(如 "sum:amount" "count:id")。
Q5:如何导出筛选结果?
filter 命令支持 --output 参数,将筛选结果导出为CSV文件。例如 --output big_orders.csv。
Q6:列类型如何识别?
自动识别:数值列做min/max/mean统计,文本列做unique计数,日期列尝试ISO格式解析。非ISO日期可能无法识别。
Q7:支持哪些比较运算符?
filter 的 --where 支持 >、<、>=、<=、==、!= 六种比较运算符,如 "amount>1000"。
Q8:能在2GB内存服务器上运行吗?
能。本技能零外部依赖,仅用Python标准库,内存占用远低于pandas。2GB内存服务器可稳定运行100MB以内的文件分析。
已知限制
- 设计支持约100MB以内的文件(载入内存),更大文件需pandas流式处理。
- 日期解析为基础级,优先支持ISO 8601格式,其他格式可能无法识别。
- 聚合函数仅支持
sum与count,暂不支持avg/min/max/median。 - 仅依赖Python标准库,无pandas的向量化加速,大文件分析较慢。
- 不支持加密CSV文件的破解。
- 不支持多表JOIN与跨文件关联分析。
--where仅支持单条件,不支持 AND/OR 组合条件。
热门AI工具
相关专题
本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。
0
2026.09.16
本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。
0
2026.09.16
本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。
0
2026.09.16
本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。
0
2026.09.11
本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。
0
2026.09.11
本专题围绕GDB调试C++程序的实际过程,详细说明程序编译、调试器启动、命令行参数传入、断点命中和程序继续运行等步骤,并介绍条件断点、临时断点和观察点的设置方法,方便开发者跟踪复杂代码的执行状态。
0
2026.09.11
本专题讲解Iris框架MVC开发模式,包含控制器注册、方法命名与路径映射、By参数绑定、BeforeActivation自定义路由,以及依赖注入容器注册、数据库依赖注入、返回值序列化及MVC下WebSocket与gRPC整合实践。
0
2026.09.11
热门下载
相关下载
精品课程
共6课时 | 12万人学习
共79课时 | 160.6万人学习
共6课时 | 54.6万人学习
最新文章

