Python - 从没有正则表达式的段落中的引号中提取单词

dmtzz 发表于 Dev

Dmtz

我有以下段落作为 .txt 文件的输入：

... lorem“非常胡萝卜，增强了本科体验。”。目前不在 convallis 的 felis。营养元素“犯规”是“中径作者的一次热身！”。赛程为他，足球“伤心”...

这是一个 Python 字符串：

'Lorem "ipsum dolor sit amet, consectetur adipiscing elit.". Praesent non sem urna. Pellentesque elementum "turpi" est, "in fermentum diam auctor aliquam!". Morbi rhoncus erat ipsum, eu "tristique"'

我想创建一个仅包含引用短语的列表，并将引号内的单词隔离为一个列表（由空格分隔）。

输出：

['ipsum', 'dolor', 'sit', 'amet,', 'consectetur', 'adipiscing', 'elit.', 'turpi'', 'in', 'fermentum', 'diam', 'auctor', 'aliquam!', 'tristique']

我的思考过程是读入文件，然后以某种方式用引号拆分段落，但我似乎无法找到让“split()”按照我想要的方式工作的方法。我有一种感觉，这可以通过最少的循环和使用 split() 作为组织数据的方法来完成，而无需使用 re、shlex、csv 或其他导入的模块。

我什至想过将分隔符重新添加到列表中，然后“清理”列表。但即使这样也感觉有点复杂。

下面的代码为数组中的每一项都添加了双引号，这不是我想要的。只是我觉得我可以在使用 split() 后跟踪报价的一种方式。

with open(input_file, "r") as read_file:
     for line in read_file:
          quotes = ['"' + i + '"' for i in line.split('"') if i]

凯文王 |

从我的评论复制：

使用 " 作为分隔符进行拆分后，您可以简单地提取列表的所有奇数索引元素。然后，正常拆分这些元素（使用空格分隔符）并将列表连接在一起。

例子：

text = """Lorem "ipsum dolor sit amet, consectetur adipiscing elit.". Praesent non sem urna. Pellentesque elementum "turpi'" est, "in fermentum diam auctor aliquam!". Morbi rhoncus erat ipsum, eu "tristique" """

text_split_by_quotes = text.split('"')
# get the odd-indexed elements (here's one way to do it):
text_in_quotes = text_split_by_quotes[1::2]
# split each normally (by whitespace) and flatten the list (here's one way to do it):
ans = []
for text in text_in_quotes:
    ans.extend(text.split())
# print answer
print(ans)

>>> ['ipsum', 'dolor', 'sit', 'amet,', 'consectetur', 'adipiscing', 'elit.', "turpi'", 'in', 'fermentum', 'diam', 'auctor', 'aliquam!', 'tristique']

本文收集自互联网，转载请注明来源。

如有侵权，请联系 [email protected] 删除。

编辑于 2021-07-30

我来说两句

0 条评论

登录后参与评论

Python - 从没有正则表达式的段落中的引号中提取单词

Python - 从没有正则表达式的段落中的引号中提取单词

蓝屏死机没有修复解决方案

计算数据帧中每行的NA

UITableView的项目向下滚动后更改颜色，然后快速备份

Node.js中未捕获的异常错误，发生调用

在 Python 2.7 中。如何从文件中读取特定文本并分配给变量

Linux的官方Adobe Flash存储库是否已过时？

验证REST API参数

ggplot：对齐多个分面图-所有大小不同的分面

Mac OS X更新后的GRUB 2问题

通过 Git 在运行 Jenkins 作业时获取 ClassNotFoundException

带有错误“ where”条件的查询如何返回结果？

用日期数据透视表和日期顺序查询

VB.net将2条特定行导出到DataGridView

如何从视图一次更新多行（ASP.NET - Core）

Java Eclipse中的错误13，如何解决？

尝试反复更改屏幕上按钮的位置 - kotlin android studio

离子动态工具栏背景色

应用发明者仅从列表中选择一个随机项一次

当我尝试下载 StanfordNLP en 模型时，出现错误

python中的boto3文件上传

在同一Pushwoosh应用程序上Pushwoosh多个捆绑ID