grep默认使用基本正则表达式(BRE),其中+、?、|等不是元字符,仅作字面匹配;要启用其特殊含义需转义(如a\+),而grep -E或egrep直接支持扩展正则表达式(ERE),语法更直观统一。

grep 默认只支持基本正则表达式(BRE),直接写 +、?、| 会当字面量处理,不生效;要用扩展正则(ERE)必须加 -E 或用 egrep。
为什么 grep "a+" file 不匹配多个 a?
BRE 中 +、?、|、{} 都不是元字符,只是普通字符。想让它们有“重复”“可选”“或”等含义,得加反斜杠转义,比如 a\+ 才表示“一个或多个 a”。但这种写法易错、难读,且不同工具转义规则不一致。
- 想匹配
abc或def:BRE 写法是grep "abc\|def" file,注意\| - 想匹配“以 root 开头的行”:
^root可用,因为^在 BRE 中本就是锚点,无需转义 - 想匹配“单词 boundary”:BRE 不支持
\b,得用\ 和 <code>\>,例如\<root></root> - 实际建议:除非维护老脚本,否则统一用
grep -E,避免记忆混乱
grep -E 和 egrep 的区别在哪?
二者完全等价:egrep 就是 grep -E 的符号链接,行为无差别。但 grep -E 更推荐,因为显式表明意图,且在脚本中更易 grep 自身(比如 ps aux | grep "grep -E" 比 grep egrep 更可控)。
-
grep -E "cat|dog|bird" file:直接用|表示“或”,不用转义 -
grep -E "go+gle":+直接表示“前一字符一次以上”,不用写go\+gle -
grep -E "(ab)+c":括号分组 + 量词组合有效,BRE 中要写成\(ab\)\+c - 注意:
grep -E仍不支持\d、\s、\b这类 Perl 风格简写,得用[0-9]、[[:space:]]、\/<code>\>
匹配 IP 地址时为什么总漏掉边界?
常见错误是写 grep "[0-9]\+\.[0-9]\+\.[0-9]\+\.[0-9]\+" file,结果把 192.168.1.1000 或 abc10.0.0.1def 也匹配进来——没做单词/位置锚定。
- 正确做法:用
grep -E "\" file,但注意{}在grep -E中默认不启用,得加-E并用反斜杠转义,或改用grep -P(PCRE) - 更稳妥的 BRE 写法:
grep "\" file,其中\<和\>锚定单词边界 - 真正实用的 IP 匹配应校验每段 ≤255,这已超出 grep 能力范围,建议用
awk或脚本后处理 - 小技巧:先用
grep -oE "[0-9]{1,3}\.[0-9]{1,3}\.[0-9]{1,3}\.[0-9]{1,3}"提取所有疑似 IP,再过滤
如何避免正则中的点号 . 匹配任意字符?
. 在所有正则模式中都默认匹配“除换行符外的任意字符”,这是最常被忽略的隐含行为。比如 grep "file.txt" log 会意外匹配 fileatxt 或 file#txt。
- 要字面匹配点号,必须转义:
grep "file\.txt" log - 如果整个模式是固定字符串,直接用
fgrep "file.txt" log或grep -F "file.txt" log,跳过正则解析,更快更安全 - 在
grep -E中,.依然需要转义才能字面匹配;它不会因为用了-E就自动失去通配意义 - 特别注意路径场景:如
grep "/var/log/.+" conf,这里的.是字面点还是通配?答案是通配——除非写成/var/log/\.
真正麻烦的不是语法记不住,而是同一正则在 grep、grep -E、sed、vim 里转义规则各不相同;实际工作中,优先用 grep -F 处理固定字符串,grep -E 处理逻辑较复杂的情况,并始终用 --color=auto 看清到底匹配了什么。


















