
本文详解如何使用 Python 正则表达式安全提取形如 identifier{...} 中的花括号内内容,特别处理内部可能含 {{var}} 的情况,避免因普通 .*? 导致的跨组误匹配或嵌套干扰。
本文详解如何使用 python 正则表达式安全提取形如 `identifier{...}` 中的花括号内内容,特别处理内部可能含 `{{var}}` 变量语法的情况,避免因普通 `.*?` 导致的跨组误匹配或嵌套干扰。
在模板字符串或 DSL 解析中,常需从类似 identifier{...} 的结构中提取花括号内的内容,但若内容本身包含 {{var}} 这类双花括号变量(如 Jinja2、Vue 或自定义模板语法),直接使用 r'\{(.+?)\}' 会因 . 匹配任意字符(包括 { 和 })而失效——要么过早终止(如遇到第一个 }),要么贪婪吞并多个区块(如将 }{ 之间的内容连通匹配)。
根本挑战在于:需允许 {{var}} 存在,但禁止独立的单层 { 或 } 出现在内容中。因此,核心思路是:*用 `[^{}]显式排除所有单层花括号,再通过非捕获组特例允许{{...}}` 成对出现**。
推荐正则表达式如下(简洁可靠,兼容多数场景):
import re
pattern = r"{([^{}]*(?:{{[^{}]*}}[^{}]*)*)}"
content = "identifier{ {{var1}} rest of the content} outer content identifier{ {{var2}} another content} identifier{ content with no vars }"
# 提取并清理首尾空格
matches = [s.strip() for s in re.findall(pattern, content)]
print(matches)
# 输出:['{{var1}} rest of the content', '{{var2}} another content', 'content with no vars']✅ 模式解析:
- { — 字面量左花括号;
- ( — 捕获组开始(即我们想要的内容);
- [^{}]* — 匹配零个或多个非花括号字符(确保不意外进入嵌套);
- (?:{{[^{}]*}}[^{}]*)* — 非捕获组,可重复零次或多次:
- {{ + [^{}]* + }} → 精确匹配一个 {{...}} 变量片段;
- 后续 [^{}]* → 允许变量后接普通文本;
- ) — 捕获组结束;
- } — 字面量右花括号。
⚠️ 注意事项:
- 该模式不允许三层及以上嵌套(如 {{{var}}}),因其本质是“单层大括号容器 + 内部双层变量”,符合绝大多数模板规范;
- 若需更严格边界(防止 {{var}} 被 identifier{ 或 } 邻近的其他花括号干扰),可升级为带负向断言的版本:
r"(?<!{){\s*([^{}]*(?:{{[^{}]+}}[^{}]*)*)\s*}(?!})",它确保 { 前无 {、} 后无 },避免误匹配 {{{...}}} 等边缘情况; - 实际使用中,建议始终配合 .strip() 清理空格,并对 re.findall 结果做空值校验;
- 如需进一步解析 {{var}} 中的变量名,可在提取后对每个匹配项单独运行 r'{{(\w+)}}'。
掌握此模式,即可稳健支撑模板引擎、配置解析、代码生成等场景中的结构化内容抽取任务。

















