首页 > 解决方案 > XMLStarlet:查询 MARCXML

问题描述

MARCXML 文件 foo.xml 的结构如下:

<record><header><identifier>myID001</identifier><datestamp>2020-10-12</datestamp></header><metadata><marcxml:collection xmlns:marcxml="http://www.loc.gov/MARC21/slim">
      <marcxml:record>
          <marcxml:datafield ind1=" " ind2=" " tag="084">
          <marcxml:subfield code="2">rvk</marcxml:subfield>
          <marcxml:subfield code="a">MG 98092</marcxml:subfield>
        </marcxml:datafield>
        <marcxml:datafield ind1=" " ind2=" " tag="084">
          <marcxml:subfield code="2">bk</marcxml:subfield>
          <marcxml:subfield code="a">89.52</marcxml:subfield>
        </marcxml:datafield>
        <marcxml:datafield ind1=" " ind2=" " tag="084">
          <marcxml:subfield code="2">ddc</marcxml:subfield>
          <marcxml:subfield code="a">320.9439</marcxml:subfield>
        </marcxml:datafield>
      </marcxml:record>
    </marcxml:collection>
    </metadata></record>

我只想提取<marcxml:subfield code="a">前一个字段<marcxml:subfield code="2">包含字符串“bk”的内容。

因此,此示例中所需的输出为:89.52。

到目前为止,我尝试过

xmlstarlet sel -N marcxml="http://www.loc.gov/MARC21/slim" -t -m "//marcxml:collection/marcxml:record/marcxml:datafield/marcxml:subfield[text()='bk']" -v '//marcxml:collection/marcxml:record/marcxml:datafield/marcxml:subfield[text()]' -nl foo.xml

这导致

rvk

MG 98092

bk

89.52

直流电

320.9439

XMLStarlet 如何做到这一点?

标签: xmlxml-namespacesxmlstarlet

解决方案


尝试以下方式:

xmlstarlet sel -N marcxml="http://www.loc.gov/MARC21/slim" -t -v '//marcxml:subfield[@code="2"][text()="bk"]/following-sibling::marcxml:subfield[@code="a"]' -nl foo.xml

推荐阅读