Ich rufe Twitter-Daten mit einem Python-Tool ab und speichere diese im JSON-Format auf meiner Festplatte. Ich bemerkte ein unbeabsichtigtes Entweichen der gesamten Datenzeichenfolge für einen Tweet, der in doppelte Anführungszeichen eingeschlossen war. Darüber hinaus werden alle doppelten Anführungszeichen der tatsächlichen JSON-Formatierung mit einem Backslash maskiert.
Sie sehen so aus:
"{" created_at ":" Fri Aug 08 11:04:40 +0000 2014 "," id ": 497699913925292032,
Wie vermeide ich das? Es sollte sein:
{"created_at": "Fri Aug 08 11:04:40 +0000 2014" .....
Mein File-Out-Code sieht folgendermaßen aus:
with io.open('data'+self.timestamp+'.txt', 'a', encoding='utf-8') as f:
f.write(unicode(json.dumps(data, ensure_ascii=False)))
f.write(unicode('\n'))
Das unbeabsichtigte Escapezeichen verursacht Probleme beim Einlesen der JSON-Datei in einem späteren Verarbeitungsschritt.