使用 lxml 和 xpath 加速 xml 解析过程

奉京徐

<?xml version="1.0" encoding="UTF-8" standalone="yes"?>
   <document DateTime="2017-06-23T04:27:08.592Z">
       <PeakInfo No="1" mz="505.2315648572003965"
                 Intensity="4531.0000000000000000"
                 Rel_Intensity="3.2737729673489735"
                 Resolution="1879.5638812957554364"
                 SNR="14.0278637770897561"
                 Area="1348.1007591467391649"
                 Rel_Area="2.3371194184605959"
                 Index="238.9999999999976694"/>
       <PeakInfo No="2" mz="522.1330917856538463"
                 Intensity="3382.0000000000000000"
                 Rel_Intensity="2.4435886505350317"
                 Resolution="3502.9921209527169594"
                 SNR="10.4705882352940982"
                 Area="881.4468100654634100"
                 Rel_Area="1.5281101521284057"
                 Index="925.0000000000000000"/>
   </document>

以上是我最近使用的一个 xml 文件的一部分。每个文件包含 400 多个 PeakInfo，我确实制作了一个 python 脚本来解析每个文件：

from lxml import etree
import pandas as pd
import tkinter.filedialog
import os
import pandas.io.formats.excel

full_path = tkinter.filedialog.askdirectory(initialdir='.')
newfolder = full_path+'\\xls files'
os.chdir(full_path)
os.makedirs(newfolder)

data = {}
for files in os.listdir(full_path):
        if os.path.isfile(os.path.join(full_path, files)):
            plist = pd.DataFrame()
            filename = os.path.basename(files).rpartition('.')[0]

            if len(filename) == 2:
                filename = filename[:1]+'0'+filename[1:]

            xmlp = etree.parse(files)
            for p in xmlp.xpath('//PeakInfo'):
                data['Exp. m/z'] = p.attrib['mz']
                data['Intensity'] = p.attrib['Intensity']
                plist = plist.append(data, ignore_index=True)
                plist['Exp. m/z'] = plist['Exp. m/z'].astype(float)
                plist['Exp. m/z'] = plist['Exp. m/z'].map('{:.4f}'.format)
                plist['Intensity'] = plist['Intensity'].astype(float)
                plist['Intensity'] = plist['Intensity'].map('{:.0f}'.format)
                pandas.io.formats.excel.header_style = None
                plist.to_excel(os.path.join(newfolder, filename+'.xls'),index=False)

如果只有两个字符（即 A1 到 A01），此代码更改文件名，然后拉出 mz 和 Intensity 并保存为 xls 文件。问题是解析每个文件花费的时间太长。是否有任何提示可以显着加快进程？

贪吃

from lxml import etree
import pandas as pd
import tkinter.filedialog
import os
import pandas.io.formats.excel

full_path = tkinter.filedialog.askdirectory(initialdir='.')
newfolder = full_path+'\\xls files'
os.chdir(full_path)
os.makedirs(newfolder)

data = {}
for files in os.listdir(full_path):
        if os.path.isfile(os.path.join(full_path, files)):
            plist = pd.DataFrame()
            filename = os.path.basename(files).rpartition('.')[0]

            if len(filename) == 2:
                filename = filename[:1]+'0'+filename[1:]

            xmlp = etree.parse(files)
            for p in xmlp.xpath('//PeakInfo'):
                data['Exp. m/z'] = p.attrib['mz']
                data['Intensity'] = p.attrib['Intensity']
                plist = plist.append(data, ignore_index=True)
plist['Exp. m/z'] = plist['Exp. m/z'].astype(float)
plist['Exp. m/z'] = plist['Exp. m/z'].map('{:.4f}'.format)
plist['Intensity'] = plist['Intensity'].astype(float)
plist['Intensity'] = plist['Intensity'].map('{:.0f}'.format)
pandas.io.formats.excel.header_style = None
plist.to_excel(os.path.join(newfolder, filename+'.xls'),index=False)

只是改变空间，你的代码就像to_excel执行太多时间，而且很慢，“astype”会复制元素，占用太多内存然后减慢速度。

本文收集自互联网，转载请注明来源。

如有侵权，请联系 [email protected] 删除。

编辑于 2021-08-28

我来说两句

0 条评论

登录后参与评论

上一篇：为什么 jQuery 将单选按钮的值返回为“ON”？如何纠正？

使用 lxml 和 xpath 解析

使用lxml xpath解析xml文件

使用LXML和XPATH解析后显示完整路径

xpath 到 dic python、lxml 和 xml

使用 glob 和 lxml 解析 xml 文件夹

使用 lxml 和 xpath 加速 xml 解析过程

使用 lxml 和 xpath 加速 xml 解析过程

隐藏发件人没有短信PHP

材质UI垂直滑块。如何改变在垂直材料UI滑块导轨的厚度（反应）

在Windows 7中无法删除文件（2）

HttpClient中的角度变化检测

Azure VM启动/停止日志

如何在 Vb.net 中使用函数返回多个值

Powerpoint-条形长度错误的堆积条形图

最新歌剧断断续续的快速拨号和渲染错误

Mac OS X更新后的GRUB 2问题

需要公式以vlookup逗号分隔单个单元格中的值

Hashchange事件侦听器在将事件处理程序附加到事件之前进行侦听

ggplot：对齐多个分面图-所有大小不同的分面

OS X-为什么我需要打开WiFi才能确定最近的位置

用日期数据透视表和日期顺序查询

Java Eclipse中的错误13，如何解决？

如何在Django中使用UUID

加载Microsoft Visual菜单时出现问题

具有if条件的SQL UPDATE

从JSON到JSONL的Python转换

如何在Kod中更改字体？

共享图像将路径放入地址