Ich habe eine Sammlung von 400 Millionen Knoten, in denen alle eine große Sammlung von Grafiken bilden. Und diese Knoten werden wöchentlich verändern, daher ist sie dynamisch. Für die angegebenen 2 Knoten muss ich den Pfad zwischen Start und Endknoten finden. Die Daten sind in 2 verschiedenen Tabellen, übergeordnete Tabelle (jede Knotendetails) und eine untergeordnete Tabelle der ersten Ebene (für jeden Elternteil die nächste Ebene der sofortigen Kinder). Zunächst hatte ich Gedanken daran, EMR mit PYSPark unter Verwendung von Graphenrahmen zu verwenden. Aber ich bin mir nicht sicher, ob dies die skalierbare Lösung ist. Ich habe die im GitHub genannte Lösung überprüft, das dauert jedoch noch einige Stunden und die Eingabedateien unterscheiden sich von dem, was ich habe. Mein Tech -Stack betrifft (Python, PySpark, AWS Resources und alle Bibliotheken)

    Schlagen Sie mir eine skalierbare Lösung vor. Dank im Voraus.

    Von NenavathShashi

    Share.
    Leave A Reply