应分两次调用str.extract()提取数字和邮箱,数字用r'(\d+.?\d*)',邮箱用r'([a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+.[a-zA-Z]{2,})';多匹配需用str.findall()并妥善处理空值与类型。

用 str.extract() 分别匹配数字和邮箱
直接用正则一次性提取两类内容不可靠,因为 str.extract() 默认只返回第一个匹配组;更稳妥的做法是分两次调用,各自用带命名组的正则。数字推荐用 r'(\d+\.?\d*)'(覆盖整数、小数),邮箱用标准模式 r'([a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,})'。注意:该邮箱正则不验证域名有效性,仅做基础识别。
示例:
import pandas as pd
df = pd.DataFrame({'text': ['价格:¥299.99,邮箱 contact@demo.com', 'ID:12345,发信至 admin@test.org.cn']})
df['number'] = df['text'].str.extract(r'(\d+\.?\d*)')
df['email'] = df['text'].str.extract(r'([a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,})')
用 str.findall() 提取全部匹配项(含多个数字/邮箱)
当单个字符串里可能含多个数字或多个邮箱时,str.extract() 会丢失后续匹配,必须改用 str.findall()。它返回列表,需用 str[0] 或 apply(lambda x: x[0] if x else None) 取首个,或保留列表结构供后续处理。
- 多个数字场景:如
'订单号1001,金额250.5,运费8'→str.findall(r'\d+\.?\d*')返回['1001', '250.5', '8']</li> <li>多个邮箱场景:如 <code>'抄送 a@x.com 和 b@y.net'
→str.findall(r'[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}') - 性能提示:对超长文本或大数据量,
findall比extract略慢,但准确性优先
处理空值和无匹配导致的 NaN
str.extract() 和 str.findall() 在无匹配时都返回 NaN(前者是标量,后者是空列表)。若需默认值,不要用 fillna('') 直接覆盖——这会让原本是列表的列变成字符串列。正确做法:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
立即学习“Python免费学习笔记(深入)”;
- 对
extract结果:df['email'].fillna('')安全,因结果是字符串列 - 对
findall结果:先用df['emails'].apply(lambda x: x if isinstance(x, list) else [])统一类型,再用str.join('; ')转为字符串,或保留列表用于 explode - 避免链式调用陷阱:如
df['text'].str.extract(...).fillna('').str.upper(),若中间有 NaN 会被转成字符串'nan'
邮箱正则的兼容性与常见漏匹配
上面用的邮箱正则能覆盖绝大多数常见格式,但以下情况仍会漏掉:
- 带中文域名(如
张三@公司.中国)→ 需启用 Unicode 模式并扩展字符集,但 Pandas 默认 regex 引擎不支持re.UNICODE标志,建议先用原生re.findall()处理再构造 Series - IP 形式域名(如
user@[192.168.1.1])→ 基础正则不包含方括号包裹 IP 的分支 - 连续多个点或特殊符号组合(如
..@a..b..com)→ 属于非法邮箱,不建议强行匹配
真正需要高精度校验时,应配合专用库如 email-validator,Pandas 正则只做初步筛选。

















