awk是Mac系统中处理结构化文本数据的内置高效工具,支持按列提取、筛选、计算和格式化,适用于CSV、日志及空格分隔文件等多种场景。

如果您需要在Mac系统中处理结构化文本数据,例如从CSV、日志或空格分隔的文件中按列提取、筛选、计算或格式化内容,则awk是内置且高效的命令行工具。以下是多种基于awk实现按列提取与处理的具体方法:
一、基础列提取:使用默认空格/制表符分隔
awk默认以空白字符(空格、制表符)为字段分隔符,$1表示第一列,$2表示第二列,依此类推。该方法适用于整齐对齐或空格分隔的文本。
1、提取文件的第1列和第3列,并用冒号连接输出:
awk '{print $1 ":" $3}' filename.txt
2、仅显示第2列中包含“error”的所有行:
awk '$2 ~ /error/ {print}' filename.txt
3、跳过首行(标题行),从第二行开始提取第4列:
awk 'NR > 1 {print $4}' filename.txt
二、指定分隔符:处理CSV或自定义分隔文本
当文本使用逗号、竖线或其他非空白字符分隔时,需通过-F选项显式指定字段分隔符,确保列位置准确对应。
1、处理逗号分隔的CSV文件,提取第2列(姓名)和第5列(邮箱):
awk -F',' '{print $2 "," $5}' data.csv
2、处理竖线分隔的日志,打印第1列(时间戳)和第6列(状态码),并过滤出状态码为404的记录:
awk -F'|' '$6 == "404" {print $1, $6}' access.log
3、使用正则表达式作为分隔符,按一个或多个空格切分:
awk -F'[[:space:]]+' '{print $1, $NF}' report.txt
三、数值计算与列运算:对数字列执行加减乘除与统计
awk支持在行处理过程中对字段进行算术运算,并可累积变量实现汇总统计,适用于日志分析、数据报表等场景。
1、计算第3列与第4列的乘积,并输出结果到新列:
awk '{result = $3 * $4; print $0, result}' sales.txt
2、累加第2列所有数值并最终输出总和:
awk '{sum += $2} END {print sum}' numbers.txt
3、计算第1列数值的平均值(需同时跟踪行数与总和):
awk '{sum += $1; count++} END {if (count > 0) print sum / count}' values.txt
四、条件筛选与多列组合逻辑
通过逻辑运算符(&&、||、!)组合多个字段条件,可精准定位符合复合规则的数据行,避免后续管道过滤开销。
1、同时满足第3列大于100且第5列等于"active"的记录:
awk '$3 > 100 && $5 == "active" {print $0}' users.txt
2、排除第2列为null或空字符串的行:
awk '$2 != "" && $2 != "null" {print}' inventory.csv
3、匹配第1列以字母开头、第4列为数字、且第6列不为空的行:
awk '$1 ~ /^[a-zA-Z]/ && $4 ~ /^[0-9]+$/ && $6 != "" {print}' records.txt
五、格式化输出与列重排:控制字段顺序与对齐方式
awk允许自由调整字段输出顺序,并通过printf实现固定宽度、补零、小数位数等格式控制,提升结果可读性。
1、将第3列(金额)右对齐为10字符宽,第1列(ID)左对齐为6字符宽:
awk '{printf "%-6s %10.2f\n", $1, $3}' finance.txt
2、重排列顺序:原顺序为姓名、年龄、城市,输出为城市、姓名、年龄(用制表符分隔):
awk -F',' '{print $3 "\t" $1 "\t" $2}' people.csv
3、为每行添加行号前缀,并将第2列转为大写(需配合toupper函数):
awk '{print NR ". " toupper($2), $1}' names.txt

















