
[OC] # Netzwerkstrukturanalyse: Erkennung von Anomalien in redigierten öffentlichen Aufzeichnungen
(Neu bei Reddit als Mitwirkender, habe es mehrmals bearbeitet, um es an das Format usw. anzupassen. Wenn es nicht akzeptabel ist, werde ich es löschen. Ich würde mich nur freuen, wenn 1 oder 2 Leute es lesen würden.)
Verfahren: Graphentheoretische Analyse, Cosinus-Ähnlichkeitsprofilierung
Überprüfung: MD5 c4baa2bb518d806b27ef649ac9cf1f46 | 19.977 Kanten | Vollständig reproduzierbar
Das Problem
Wenn Regierungen Dokumente mit Schwärzungen veröffentlichen, geht die Öffentlichkeit davon aus, dass anonymisierte Einträge entweder dem Datenschutz dienen oder nicht zugänglich sind "Mülleimer." Diese Annahmen werden selten mathematisch überprüft.
Die Methode
Wenn zwei anonymisierte Knoten beides sind "Mülleimer," sie sollten ähnliche Verbindungsprofile haben (hohe Kosinusähnlichkeit). Wenn es sich um eine reale, eindeutige Einheit handelt, ist ihr Profil orthogonal.
Der Befund
[SEE IMAGE ABOVE] (Das Bild zeigt zur besseren Verdeutlichung Werte ×100)
| Vergleich | Kosinusähnlichkeit | Interpretation |
|---|---|---|
| Knoten A vs. B | 0,0184 | ORTHOGONAL – völlig verschieden |
| Knoten A vs. C | 0,364 | Geringe Überlappung |
| Knoten B vs. C | 0,9025 | IDENTISCH – gleiche Artefaktklasse |
B und C: 0,9025 Ähnlichkeit = kollabierte Artefakte (gleiche Quelle)
A vs. B: 0,0184 Ähnlichkeit = KEIN Artefakt (eindeutige Entität)
Schutzasymmetrie
| Knoten | Verbindungen | Sichtweite |
|---|---|---|
| Jeffrey Epstein | 5.625 | Sichtbar |
| KNOTEN A | 3.923 | VERSTECKT |
| Donald Trump | 1.685 | Sichtbar |
| Ehud Barak | 701 | Sichtbar |
| KNOTEN B | 481 | VERSTECKT |
| KNOTEN C | 160 | VERSTECKT |
Knoten A hat 5,6x MEHR Verbindungen als Barak, erhält aber VOLLSTÄNDIG Anonymisierung.
Kantentypverteilung
| Typ | Knoten A | Knoten B | Knoten C |
|---|---|---|---|
| Unbekannt | 53,3 % | 71,0 % | 52,5 % |
| Geschäft | 6,9 % | 1,2 % | 6,8 % |
| Legal | 5,8 % | 3,4 % | 5,8 % |
| Kommunikation | 3,95 % | 4,78 % | 3,75 % |
Knoten A zeigt strukturiert Verteilung = reale Entität Knoten B zeigt 71 % unbekannt = Rauschbereich
Die Logik
FRAGE: Ist Knoten A nur ein weiterer zusammengebrochener Daten-Bucket?
PRÜFEN: Wenn A ein Bucket wie B und C ist, sollten ihre Profile übereinstimmen.
BEWEIS:
– B vs. C = 0,9025 Kosinus = GLEICHER EIMER
– A vs B = 0,0184 Cosinus = ANDERE ENTITÄT
ABSCHLUSS: Knoten A ist statistisch unterschiedlich. Kein Artefakt.
Reproduktion
„python def cosine_similarity(p1, p2): all_keys = set(p1.keys()) | set(p2.keys()) v1 = np.array([p1.get(k, 0) for k in all_keys]) v2 = np.array([p2.get(k, 0) for k in all_keys]) return np.dot(v1, v2) / (np.linalg.norm(v1) * np.linalg.norm(v2))
Ergebnisse:
A vs. B: 0,0184 (deutlich)
B vs. C: 0,9025 (gleicher Eimer)
„
Was das zeigt
- Knoten A ist statistisch gesehen realkein Datenartefakt
- Knoten A empfängt unverhältnismäßiger Schutz relativ zur Konnektivität
- Die Methodik ist vollständig reproduzierbar
Was dies NICHT zeigt
- Identität einer Person
- Schuld oder Fehlverhalten
- Verschlusssachen
Hash: c4baa2bb518d806b27ef649ac9cf1f46
Struktur, Anomalie, Methodik – keine Anschuldigung.
Von Old_Iron986