使用ijson迭代解析JSON文件



我想分块解析一个巨大的json文件。我想在不加载整个东西的情况下使用它的块。数据可以在这里找到http://jmcauley.ucsd.edu/data/amazon/

当我使用ijson来做这件事时,我得到了一个JSONError: Additional data的错误。有办法做到这一点吗?

我的代码:##生成附加数据错误

import pandas as pd

file = open('Books_5.json',"r") ##Books_5.json is the 5-core small dataset
objects = ijson.items(file, 'meta.data.item')
reviews = (o for o in objects if o['type']=='reviewText')
for review in reviews : print(review)

这确实有效,但速度非常慢:

path='Books_5.json'
def parse(path):
g = open(path, 'rb')
for l in g:
yield eval(l)
def getDF(path):
i = 0
df = {}
for d in parse(path):
df[i] = d
i += 1
return pd.DataFrame.from_dict(df, orient='index')
df = getDF(path)
df.info()

代码的结果

听起来JSON数据中有多个顶级对象,这是JSON标准不支持的。然而,当使用multiple_values=True选项时,ijson仍然支持这一点(例如,ijson.items(file, 'meta.data.item', multiple_values=True).

最新更新