最可靠方式是使用DOM解析器(如Go的goquery、Python的BeautifulSoup、JS的DOMParser)提取img标签src属性,正则仅适用于结构简单、可控的HTML片段;需注意处理data-src懒加载、base64内联图、protocol-relative路径及SVG/AVIF等现代格式。

匹配 <img> 标签中的 src 属性值
直接从 HTML 片段中提取图片地址,最常见也最可靠的方式是匹配 <img> 标签的 src 属性。别用 .* 贪婪匹配,容易跨标签、吃掉多余内容,尤其当 HTML 里有多个 <img> 或含 onerror 等属性时。
推荐正则:/<img[^>]+src\s*=\s*[\'"]([^\'"]+?\.((?:jpe?g|png|gif|webp|svg|avif))[\'"][^>]*>/i
-
[^>]+限定在单个标签内,避免跨标签捕获 -
src\s*=\s*[\'"]容忍等号前后空格和单/双引号 -
([^\'"]+?)非贪婪捕获 URL,防止吃到后缀前的引号 -
\.((?:jpe?g|png|gif|webp|svg|avif))显式限定图片后缀,svg和avif需要特别注意——它们是合法图片格式但常被旧正则遗漏 -
i修饰符保证大小写不敏感(如.JPG或Src)
处理 base64 图片和 data URI
现代网页中 src 值可能是 data:image/png;base64,... 这类内联数据。如果业务需要过滤掉它们(比如只取真实网络 URL),得在匹配后加判断;如果需要保留,就得扩展正则支持 data: 协议。
带 data URI 的宽松匹配(仅提取完整 src 值):/src\s*=\s*[\'"]([^\'"]+?\.((?:jpe?g|png|gif|webp|svg|avif)|data:image\/(?:jpe?g|png|gif|webp|svg|avif);base64))[\'"]/i
立即学习“PHP免费学习笔记(深入)”;
- 这个正则会把
data:image/svg+xml;base64,...也纳入——注意svg+xml不是svg,所以后缀分支里显式写了svg和svg\+xml - 实际使用中,建议先用基础正则提取所有
src,再用filter_var($url, FILTER_VALIDATE_URL)或str_starts_with($url, 'data:')分离处理,比塞进一个巨长正则更可读、易调试 - base64 数据体本身不用提取,它不是“URL”,强行解码还可能因长度或编码问题失败
忽略 protocol-relative 和相对路径的陷阱
提取出来的 src 可能是 //cdn.example.com/a.jpg(protocol-relative)、/images/b.png(绝对路径)、./c.gif(相对路径)或 logo.svg(同目录)。正则本身不负责补全,但你得清楚后续怎么处理。
- PHP 中可用
parse_url()判断是否为完整 URL:parse_url($src, PHP_URL_SCHEME) !== null - 若需转成绝对 URL,别手动拼接。用
http_build_url()(需 pecl_http)或简单逻辑:if (str_starts_with($src, '//')) { $src = 'https:' . $src; } elseif (!str_starts_with($src, 'http')) { $src = rtrim($base_url, '/') . '/' . ltrim($src, '/'); } - 特别注意:SVG 文件可能是 XML 文本内联(
<svg>...</svg>),这种不会出现在<img src="...">里,正则完全捕获不到——它属于 DOM 解析范畴,不是正则该管的
为什么不用 DOMDocument?什么时候该换
正则快、轻量,适合脏 HTML 或小片段。但一旦 HTML 结构复杂(如 src 在 JS 字符串里、标签未闭合、属性换行),正则就开始漏或错。这时候必须切到 DOMDocument。
最小可用 DOM 提取示例:
$dom = new DOMDocument();
@$dom->loadHTML($html, LIBXML_HTML_NOIMPLIED | LIBXML_HTML_NODEFDTD);
$imgs = $dom->getElementsByTagName('img');
foreach ($imgs as $img) {
$src = $img->getAttribute('src');
if ($src && preg_match('/\.(jpe?g|png|gif|webp|svg|avif)$/i', $src)) {
echo $src . "\n";
}
}
-
@抑制 loadHTML 的警告(常见于乱码或非法标签) -
LIBXML_HTML_NOIMPLIED防止自动补<html><body> -
preg_match后置校验后缀,比把所有格式塞进 DOM 查询条件更稳 - DOM 方式天然支持
srcset、data-src等懒加载字段,正则硬刚很容易漏
真正难的不是写对正则,而是判断当前 HTML 是否“够干净”——如果来源不可控(比如用户提交的富文本),DOM 是唯一靠谱的选择。



















