我想分块解析一个巨大的json文件。我想在不加载整个东西的情况下使用它的块。数据可以在这里找到http://jmcauley.ucsd.edu/data/amazon/
当我使用ijson来做这件事时,我得到了一个JSONError: Additional data
的错误。有办法做到这一点吗?
我的代码:##生成附加数据错误
import pandas as pd
file = open('Books_5.json',"r") ##Books_5.json is the 5-core small dataset
objects = ijson.items(file, 'meta.data.item')
reviews = (o for o in objects if o['type']=='reviewText')
for review in reviews : print(review)
这确实有效,但速度非常慢:
path='Books_5.json'
def parse(path):
g = open(path, 'rb')
for l in g:
yield eval(l)
def getDF(path):
i = 0
df = {}
for d in parse(path):
df[i] = d
i += 1
return pd.DataFrame.from_dict(df, orient='index')
df = getDF(path)
df.info()
代码的结果
听起来JSON数据中有多个顶级对象,这是JSON标准不支持的。然而,当使用multiple_values=True
选项时,ijson仍然支持这一点(例如,ijson.items(file, 'meta.data.item', multiple_values=True)
.