问: 采集里怎么样过滤多个信息??
答:
{dede:trim}1{/dede:trim}
{dede:trim}2{/dede:trim}
{dede:trim}3{/dede:trim}
问: 网易财经频道-财经要闻 的采集点分享
答:
{dede:comments}
{!– 采集列表获取规则 –}
{/dede:comments}
{dede:list source='single' sourcetype='list' varstart='2' varend='9'}
{dede:url value='[url]http://finance.163.com/special/00251OFM/cjyw_0[/url][var:分页].html'}
{/dede:url}
{dede:need}/06/{/dede:need}
{dede:cannot}{/dede:cannot}
{/dede:list}
{dede:comments}
{!– 网页内容获取规则 –}
{/dede:comments}
{dede:art sptype='full'}
{dede:sppage}{/dede:sppage}
{dede:note field='title' value='[var:内容]' isunit='' isdown=''}
{dede:match}[var:内容] {/dede:match}
{dede:trim}_网易财经-中国的投资门户{/dede:trim}
{/dede:note}
{dede:note field='body' value='[var:内容]' isunit='1' isdown='1'}
{dede:match}[var:内容]
{/dede:match}
{dede:trim}_网易财经-中国的投资门户{/dede:trim}
{dede:trim}{/dede:trim}
{dede:trim}{/dede:trim}
{/dede:note}
{/dede:art}
问: 采集的时候,把文章内容里的链接去掉,过滤要怎么写
答:
{dede:trim}]*)>([^<]*){/dede:trim}
问: ([^>]*) 是什么意思,是不是代表任意字符!好想不是, 能不能解释一下具体的意思,
答: 除 > 以外的任意字符
在上述代码中,我们使用了多种标签来定义不同的功能。例如,`{dede:trim}`用于删除不需要的内容,而`{dede:match}`则用于匹配特定的HTML元素或文本模式。这些标签可以帮助用户更精确地控制采集过程中的数据筛选与处理。通过这种方式,不仅可以有效地过滤掉无用的信息,还可以确保最终采集到的数据更加干净、准确。
希望以上内容能够帮助您更好地理解和应用采集规则。