main 是爬虫定位正文的唯一结构锚点,必须直接包裹可索引内容且仅有一个;article 表示独立可分发内容单元,section 仅为主题分组;figure+figcaption 联合建模图文语义;h1 至 h6 构成内容逻辑骨架,须严格遵循层级与唯一性。

main 是爬虫定位正文的唯一结构锚点,不是“加分项”,而是“准入门槛”——没它,或用错,正文大概率不被当主体索引。
为什么 main 不是可选项而是硬性结构信号
Google 移动优先索引(2023年起100%启用)默认从 main 内部提取首屏文本、链接和标题层级。它不解析 CSS 类名,也不猜测 div.content 里哪段是正文。
- 多个
main或嵌套在footer/header中,会触发“结构冲突”警告,整块内容权重打折 - SPA 路由切换后未销毁旧
main节点,DOM 中残留两个,Google 会降低全页可信度评分 -
main里只放div id="root"这类空容器,而无实际 HTML 内容,爬虫大概率跳过该区域 -
main必须直接包裹h1、段落、figure等可索引内容,不能是纯交互容器
article 和 section 的语义边界直接影响内容是否被独立建索引
二者都划分区块,但搜索引擎对它们的处理逻辑完全不同:article 表示可独立分发、复用、订阅的内容单元(如一篇博客、一条新闻),section 只是主题相关的分组,无独立语义价值。
- 把整页新闻列表用一个
section包裹,爬虫误判为“一篇长文”,而非“10篇独立报道” - 每个
article应有自己独立的h1或h2,且内部可含time、footer等子语义标签 -
section必须配h2或更高阶标题;纯section+p被视为结构缺失,不参与主题建模 - 滥用
article套按钮、广告位或侧边栏模块,会稀释主内容信号,触发“语义污染”标记
figure+figcaption 是图文长尾词覆盖的联合分析入口
单独给 img 加 alt 是基础;只有放进 figure 并配 figcaption,搜索引擎才会将图像视觉内容与说明文本联合建模,显著提升图搜命中率和长尾词覆盖能力。
立即学习“前端免费学习笔记(深入)”;
-
figcaption必须是figure的第一个或最后一个子元素,否则语义断裂 -
figcaption文本需自然描述图像内容,例如<figcaption>React Server Components 渲染流程对比图</figcaption> - 堆砌关键词如
<figcaption>HTML5 semantic tag tutorial seo</figcaption>会触发垃圾信号 - 装饰性图片(分割线、背景图)必须设
alt="",否则被识别为缺失内容
h1 到 h6 不是样式工具,而是内容树的骨架信号
爬虫靠标题层级推断段落关系和主题权重分布。h1 是正文内唯一主主题锚点,和 title 共同构成“意图一致性”校验对。
- 每个页面只用一个
h1,且必须出现在main内、DOM 顶部附近(避免display: none隐藏后又假装存在) - 跳级(
h1→h4)、重复h1、或用h2包按钮文案,都会触发“结构混乱”标记 -
h2对应一级内容模块,建议每页控制在 3–5 个;全篇都是h2会被视为主次模糊 -
h3不适合包图片标题或图标区域——那是figure+figcaption的职责
真正影响索引效果的,从来不是标签数量,而是标签是否真实反映内容逻辑。一个 main 里混进登录框、客服电话、友情链接,比不用语义化更危险——它不是没结构,而是结构骗过了爬虫。



















