用迭代器写文本解析器的核心是解耦解析逻辑与数据消费,每次next()只推进一步并返回一个有意义单元,内存友好且逻辑清晰;推荐用yield生成器实现,支持逐行、逐词或按模式切分,可链式组合多个迭代器形成处理流水线,并在生成器内精细控制异常处理与边界情况。

用迭代器写文本解析器,核心是把解析逻辑和数据消费解耦——每次调用 next() 只推进一步、返回一个有意义的单元(比如词法单元、行、段落或自定义结构),不一次性加载全部内容,内存友好且逻辑清晰。
用生成器函数构建基础迭代器
Python 中最自然的方式是用 yield 写生成器。它自动实现迭代器协议,适合逐行、逐词或按模式切分文本。
例如,实现一个跳过空行和注释(以 # 开头)的行迭代器:
def skip_comments_and_blanks(lines):
for line in lines:
stripped = line.strip()
if stripped and not stripped.startswith('#'):
yield stripped
使用时可直接遍历:
with open('config.txt') as f:
for valid_line in skip_comments_and_blanks(f):
print(valid_line) # 每次只处理一条有效行
按需解析结构化片段(如键值对)
若文本是类 INI 格式(key = value),可在迭代器中封装解析逻辑,直接产出元组:
def parse_key_value(lines):
for line in lines:
line = line.strip()
if '=' in line and not line.startswith('#'):
key, sep, value = line.partition('=')
yield key.strip(), value.strip()
这样上层代码无需关心字符串分割细节,拿到的就是结构化数据:
for key, val in parse_key_value(f):- 直接用
key和val做后续处理
组合多个迭代器做流水线处理
迭代器天然支持链式组合。比如:读文件 → 过滤注释 → 分割字段 → 转换类型,每步都是独立迭代器:
def split_fields(lines, sep='='):
for line in lines:
parts = [p.strip() for p in line.split(sep, 1)]
yield parts if len(parts) == 2 else (line, '')
<p>def convert_types(pairs):
for k, v in pairs:</p><h1>简单类型推断</h1><pre class='brush:php;toolbar:false;'> if v.isdigit():
yield k, int(v)
elif v.lower() in ('true', 'false'):
yield k, v.lower() == 'true'
else:
yield k, v最终调用:for k, v in convert_types(split_fields(skip_comments_and_blanks(f))):
逻辑清晰、职责分明、易于测试和复用。
处理边界与异常更可控
相比一次性 readlines() 后处理,迭代器让错误定位更精确。可在生成器内部捕获解析异常,并选择跳过、记录或抛出:
- 遇到格式错误行,
logging.warning(f"Skip malformed line: {line}")后continue - 关键字段缺失时,
raise ValueError(f"Missing required key in line {i}") - 所有异常都发生在实际消费时,便于调试和恢复
不复杂但容易忽略:迭代器本身不执行,直到第一次 next() 或进入 for 循环——这让你能延迟初始化、按需构造解析流程。

















