网站采集对于许多站长来说是一项非常实用的技能,尤其是在使用像帝国CMS这样的强大工具时。尽管帝国CMS的采集功能相对简单易学,但仍然有不少朋友在编写采集规则时感到困惑。本文将分享一些关于帝国CMS采集正则的技巧,帮助您更高效地完成网页内容的采集。


### 从文章源代码中获取信息

以下是一些常见的采集场景及其对应的正则表达式规则:


#### 第一种场景

假设我们需要从以下HTML代码中提取分页链接:


[1] [2] [3] [4] 下一页

编写的规则如下:

  • 选全部列出式
  • 区域正则:

    [!--smallpageallzz--]'>下一页

  • 链接正则:


#### 第二种场景

如果遇到以下HTML代码:

可以使用以下规则:


#### 第三种场景

当面对以下HTML结构时:

可以采用以下规则:

  • "全部列出"式正则设置:
  • 分页区域正则(无)
  • 分页链接正则:


#### 第四种场景

最后,考虑以下HTML代码: